En retrieval-augmented QA-løsning kan give forskellige svar, efter at databasen bag den er udvidet – selv når model, prompt, retrieval-politik og alle andre parametre holdes fast. Fænomenet kaldes accuracy-blind answer churn: den samlede nøjagtighed ændrer sig næsten ikke, men svarene på enkeltspørgsmål skifter alligevel. Det viser en ny undersøgelse fra Hugging Face.
Forskerne introducerer en Snapshot Compatibility Audit, der måler uforklaret svar-ændring ved at trække den normale variation fra – altså hvor meget systemet selv svarer forskelligt på samme spørgsmål, når intet ændres. I et præregistreret studie med 400 spørgsmål fra Natural Questions fandt de et overskydende svar-skift på 6,44 procentpoint (normaliseret eksakt match) og 10,25 procentpoint (semantisk match), mens den samlede nøjagtighed kun faldt 1,50 procentpoint. Med andre ord: uden en grundig audit ville man tro, at intet var gået galt.
Pointen er ikke, at opdateringer er dårlige – men at de kan ændre adfærd på en måde, som almindelige kvalitetsmålinger skjuler. I en separat undersøgelse med TriviaQA gik nøjagtigheden endda i den modsatte retning af svar-skiftet, og en replikation med en anden DeepSeek-generator viste 8,75 procentpoint semantisk overskydende skift, selvom eksakt match steg med 3,00 procentpoint. Det betyder, at et system kan blive bedre målt på gennemsnit, men værre målt på stabilitet – og at en beslutning om at opdatere en index kan have utilsigtede konsekvenser for brugere, der oplever pludselige ændringer i svar.
For virksomheder, der bygger på RAG-systemer – fx kundesupport, søgning eller interne vidensassistenter – er implikationen klar: Man bør ikke kun måle nøjagtighed, men også svar-stabilitet, når man opdaterer datagrundlaget. En audit, der kun kigger på gennemsnitlig kvalitet, kan give et falsk trygt billede. Læs hele papiret her for detaljer om metoden og de præregistrerede studier.
