En ny forskningsartikel fra arXiv introducerer RENDER, et benchmark-kontrolværktøj, der afslører et overset problem i evalueringen af AI-modellers hukommelse og RAG-systemer: Det format, som historikken præsenteres i, kan ændre svarenes kvalitet dramatisk. Forskerne bag RENDER-studiet viser, at forskellen mellem bedste og værste præsentationsformat kan være op til 48,8 point per model – et tal ingen beslutningstager kan ignorere, når de vælger eller bygger AI-løsninger.

Studiet sammenligner fem forskellige måder at præsentere samme samtalehistorik på: fra rå uddrag til strukturerede opsummeringer, som de der bruges i ChatGPT, LangChain og MemGPT. Resultaterne er slående: Når modellerne får samme mængde kontekst, klarer de sig 42,4-72,6 point bedre med strukturerede pakker end med rå, afkortet dialog. Selv i realistiske opsætninger, hvor skabelonerne ligner dem i rigtige produkter, er spredningen mellem formaterne 24,6-48,8 point per model.

Det mest bemærkelsesværdige fund: Tre modeller, der scorer 0 procent på formelle regnskabslignende pakker, kan svare korrekt på 45,4-53,4 procent af de samme spørgsmål, når informationen præsenteres som naturligt sprog. Det betyder, at valget af præsentationsformat ikke er en teknisk detalje – det er en strategisk beslutning, der kan fordoble eller halvere en models effektivitet i praksis.

For virksomheder, der bygger eller køber AI-systemer med hukommelse, har dette direkte konsekvenser: Evalueringer, der ikke kontrollerer for præsentationsformatet, kan give misvisende billeder af en models reelle kapabiliteter. RENDER tilbyder en metode til at standardisere denne kontrol, hvilket gør det muligt at sammenligne modeller mere retfærdigt og træffe bedre beslutninger om systemdesign.

Selvom effekten er konsistent på tværs af modeller og opgaver, er der nuancer: Under en anden evalueringsmetode er resultaterne ikke entydigt signifikante for alle modeller. Alligevel peger studiet på et klart behov: Fremtidige hukommelses- og RAG-evalueringer bør rapportere eller kontrollere, hvordan historikken præsenteres – ellers risikerer man at sammenligne æbler og pærer.