Forskere har udviklet et automatisk talegenkendelsessystem (ASR) for Mizo, et lavressourcesprog, der tales i det nordøstlige Indien. Ved at indsamle og kuratere 17,62 timers taleoptagelser og finjustere tre Whisper-modeller samt SraVaani 1.0 opnåede de betydelige forbedringer i genkendelsesnøjagtighed. Whisper-large-v3 opnåede den laveste konventionelle WER på 18,08%, mens en morfologi-bevidst evaluering gav en WER på 7,22%. Dette viser, at selv et hidtil uset sprog kan håndteres effektivt med eksisterende modeller og relativt små mængder data.
For beslutningstagere inden for sprogteknologi og offentlig digitalisering er dette et signal om, at barrieren for at understøtte nye sprog er faldende. SraVaani 1.0, en indisk flersproget model, havde en zero-shot WER på 58,27%, men efter finjustering med kuraterede Mizo-data faldt den til 29,45% konventionel WER og 17,93% morfologi-bevidst WER. Dette understreger værdien af at investere i datakuration frem for at stole udelukkende på flersprogede modellers baseline-ydeevne.
For virksomheder og organisationer, der overvejer at udrulle talegenkendelse i regioner med lavressourcesprog, indikerer resultaterne, at en målrettet finjusteringsindsats kan levere brugbare resultater uden massive datasæt. Den fulde undersøgelse giver detaljer om metodikken og evalueringsprotokollerne, hvilket kan være nyttigt for dem, der planlægger lignende initiativer.
