NVIDIA har udgivet NemotronLabs VoiceChat 11B, en open source-model til tale-til-tale-interaktion, der kan håndtere samtaler med kun 448 ms latenstid og samtidig kalde værktøjer live. Det betyder, at en stemmeassistent kan forstå, svare og udføre handlinger – som at booke et møde eller hente data – uden at brugeren skal vente på en tekstmellemvej.
Modellen er fuld-duplex, hvilket vil sige, at den kan lytte og tale samtidig, ligesom en rigtig samtale. Det er et markant skridt fra de traditionelle stemmeassistenter, der typisk skifter mellem at lytte og svare, og det gør interaktionen mere naturlig og hurtig.
For virksomheder og udviklere betyder det, at man nu kan bygge stemmeassistenter, der reagerer næsten øjeblikkeligt og kan integreres med eksisterende systemer via værktøjskald. Da modellen er open source, kan organisationer tilpasse og implementere den på egen infrastruktur – uden at være bundet til en lukket cloud-tjeneste.
NVIDIA har offentliggjort detaljerne i en officiel meddelelse, og modellen er tilgængelig for dem, der vil eksperimentere eller bygge videre på den.
