En ny undersøgelse fra arXiv sætter tal på et velkendt problem: når en AI skal skrive en persons livshistorie, opfinder den det meste. Audit af LLM-genereret selvbiografi viser, at 354 ud af 366 dage (96,7%) i en dagbog genereret af en samtale-AI ikke kunne bekræftes mod en uafhængig kilde. Kun 12 dage indeholdt en bekræftet scene, og 19 dage (5,2%) indeholdt påstande, der direkte modsiger det dokumenterede liv.
Undersøgelsen, der er den første kvantificerede audit af sin slags, fandt at den dominerende fejltype er 'grounded drift' – hvor rigtige personer, arbejdsgivere og steder optræder i opfundne scener. Forfatteren, der også er subjektet i undersøgelsen, efterprøvede resultatet ved at regenerere de samme dage med aktuelle navngivne modeller, hvilket gav 100% fejlrate under samme input. Når generationen blev forankret i subjektets egen korpus, faldt fejlraten markant, men 83,3% af dagene fejlede stadig.
For beslutningstagere, der overvejer at bruge AI til at skrive biografier, erindringsbøger eller andre personlige fortællinger, er konsekvensen klar: uden grundig verifikation er output ikke til at stole på. Selv med grounding er der væsentlige fejl. Værktøjet, der bruges i undersøgelsen, er gjort tilgængeligt, så andre kan gentage målingerne – men dets egen grænse mellem 'svag' og 'ubekræftet' viser sig upålidelig, hvilket understreger behovet for menneskelig gennemgang.
