Google har udgivet Gemini 3.5 Transcribe, en ny talegenkendelsesmodel, der leveres som to separate endpoints i stedet for én samlet løsning. Det skriver MarkTechPost. Streaming-endpointet leverer transskription på under et sekund, men dropper speaker-diarisering og ord-tidsstempler. Batch-endpointet beholder begge funktioner, til halv pris. Google rapporterer en gennemsnitlig word error rate (WER) på 2,6 % på batch og 4,0 % på streaming, med 70 % hurtigere færdiggørelse end forgængeren Chirp 3.
For virksomheder, der bygger voice-agenter eller transskriptionspipelines, er opdelingen ikke triviel. Streaming er oplagt til realtidsapplikationer som live-kundeservice, hvor lav latenstid er kritisk, men hvor man må undvære diarisering og tidsstempler. Batch-endpointet er billigere og rigere på metadata, hvilket gør det velegnet til offline-behandling af store mængder lyd, fx mødeoptagelser eller call-center-analyse. Valget mellem de to er nu en konkret beslutning om, hvad der vejer tungest: hastighed eller funktionalitet.
Den lave WER på tværs af 85+ sprog er et signal om, at Google fortsat presser kvaliteten i flersproget talegenkendelse. For beslutningstagere, der overvejer at skifte fra eksisterende løsninger, er det værd at notere, at modellen er en direkte efterfølger til Chirp 3, og at den markante forbedring i færdiggørelsestid kan reducere ventetider i eksisterende workflows.
