Når talebaserede AI-systemer skal besvare spørgsmål, passerer lyden først gennem automatisk talegenkendelse (ASR), før nogen søge- eller genereringskomponent aktiveres. Fejl i denne første fase er dermed en fast, uundgåelig begrænsning for resten af systemet. Ny forskning fra Hugging Face-publikationen Better Retrieval, Worse Robustness undersøger, om to udbredte udvidelser til retrieval-augmented generation (RAG) – entity-graph linking og iterativ reformulering – absorberer eller forstærker disse fejl.
Forskerne testede fire RAG-konfigurationer på tre multi-hop QA-benchmarks (HotpotQA, 2WikiMultiHopQA og MuSiQue) med fire engelske accenter genereret via neural TTS. Resultatet er klart: Selvom de strukturelt rigere konfigurationer generelt opnår højere absolut F1-score under ASR-input, forstærker begge udvidelser fejlene. F1-gabet fra ren tekst til accenten med højest WER er 36-67% større under kombinationen af de to udvidelser end under naiv tæt søgning – på alle tre benchmarks.
Den dominerende fejlmekanisme er korruption af et eller flere query-entiteter, som står for 87-96% af forringelserne på 2WikiMultiHopQA på tværs af alle fire metoder. To letvægts overfladeform-mitigationer efterlader det meste af gabet intakt, hvilket indikerer, at downstream-søgestrukturen forstærker de resterende entity-fejl.
For beslutningstagere, der bygger eller køber talebaserede AI-løsninger – fx kundeservice, virtuelle assistenter eller vidensøgningsværktøjer – er implikationen klar: Kompleksiteten i søgestrukturen kan give bedre resultater på ren tekst, men den øger risikoen for, at tale-fejl bliver til alvorlige svarfejl. Det betyder, at valget af RAG-arkitektur ikke kun er et spørgsmål om ydeevne på ideelle input, men også om robusthed i virkelige, støjfyldte tale-scenarier.
Forskerne har frigivet kode og data på GitHub, så udviklere og arkitekter selv kan teste og validere resultaterne i deres egne pipelines.
