Et nyt syntetisk bengali-talemateriale er blevet frigivet offentligt, specifikt designet til telekom-kundeservice-scenarier. Datasættet indeholder 10.000 lyd-tekst-par, svarende til cirka 26,82 timers tale ved 24 kHz, og er tilgængeligt på Hugging Face under CC-BY-4.0-licensen. Det er genereret med OmniVoice i voice-cloning-tilstand og inkluderer et normaliseret transkriptionsfelt, der er optimeret til træning og evaluering af automatisk talegenkendelse (ASR/STT).
Det interessante for beslutningstagere er ikke kun datasættets eksistens, men dets potentiale til at løse et konkret problem: sproglig dækning i kundevendte systemer. Mange talebaserede kundeservice-løsninger kæmper med domænespecifikke udtryk og accenter, og syntetiske datasæt kan udfylde huller, hvor rigtige optagelser er dyre eller svære at få. For virksomheder, der bygger eller køber ASR-løsninger til bengalitalende markeder, kan dette datasæt reducere behovet for manuel dataindsamling og dermed sænke omkostningerne ved at træne præcise systemer.
Kvaliteten er underbygget af en automatisk intelligibilitetstjek på alle 10.000 prøver med en domæne-tilpasset Whisper ASR-model, der viser en gennemsnitlig WER på 2,54% og en CER på 0,59%. Medianværdierne er 0,00%, hvilket indikerer stærk tekst-audio-konsistens. Forfatterne diskuterer dog også begrænsningerne ved syntetisk tale og STT-baseret evaluering, hvilket er værd at have in mente, når man vurderer datasættets anvendelighed i produktion.
For dem, der overvejer at bruge datasættet, er det værd at læse den originale arXiv-artikel for detaljer om genereringsprocessen og evalueringsmetoden. Datasættet er frit tilgængeligt, hvilket gør det til en lav-hængende frugt for teams, der ønsker at eksperimentere med syntetisk tale til domænespecifik ASR.
