En ny forskningsindsats fra arXiv introducerer SearchAuditBench, en benchmark designet til at teste, hvor godt AI-modeller kan finde, forstå og rette fejl i lange søgeprocesser. Dette er kritisk, fordi selv avancerede søgeagenter ofte fejler, når de arbejder over mange trin – og fejlene kan være næsten umulige for mennesker at opdage manuelt. Ifølge det tekniske papir indeholder SearchAuditBench 1.243 fejlbehæftede søgeforløb, hver med gennemsnitligt 73,1 beskeder og 65.100 tokens, indsamlet fra otte open-weight-modeller på fem forskellige søgebenchmarks. Hvert forløb er ekspert-annoteret med det kritiske fejltrin, en søgespecifik rodårsag og en reference-reparation med bedømmelseskriterier.
Resultaterne er slående: Selv den stærkeste baseline, drevet af en frontlinjemodel som GPT-5.5, opnår kun en end-to-end succesrate på 26,6%. Til sammenligning klarer den nye SearchAuditor-ramme sig bedre – med en succesrate på 32,3% – og når den bruges til at genoptage fejlslagne søgninger, hjælper den agenterne med at komme sig efter fejl. SearchAuditor fungerer ved at bruge flere perspektiver og evidensbaseret vurdering til at lokalisere, attribuere og reparere fejl.
For beslutningstagere betyder dette noget: Hvis din virksomhed overvejer at implementere AI-drevne søgeagenter til komplekse opgaver – som research, due diligence eller kundesupport – er pålideligheden stadig en stor udfordring. Selv de bedste modeller fejler i tre ud af fire tilfælde i lange, komplekse søgninger. Det er ikke kun et teknisk problem; det har direkte konsekvenser for risikostyring, omkostninger og tillid til AI-systemer. SearchAuditBench giver dog et værktøj til at måle og forbedre denne pålidelighed, hvilket kan være afgørende for at træffe informerede beslutninger om, hvor og hvordan man bruger disse agenter.
