En ny forskningsartikel fra arXiv introducerer TeXFix-Bench, en benchmark designet til at teste, hvor godt sprogmodeller (LLM'er) kan reparere fejl i dokumentkilder som LaTeX, Typst og Markdown. Resultaterne viser, at selv de bedste modeller kun opnår en kompileringsrate på 84,2 %, og at en høj kompileringsrate ikke nødvendigvis betyder, at dokumentets indhold er bevaret korrekt.
Forskerne bag TeXFix-Bench har udviklet en metode, der er baseret på empiriske fejl fra virkelige projekter, i modsætning til tidligere benchmarks, der brugte kunstigt indsatte fejl. De identificerede 168 verificerede fejl fra TeX Stack Exchange, GitHub og dokumentation, og skabte en taksonomi med 18 fejlkategorier. Denne taksonomi blev implementeret i et værktøj kaldet DocMut, som genererer fejl på en måde, der er tættere på virkelige problemer.
Resultaterne er slående: Fejl genereret med DocMut er 5,6-9,2 procentpoint sværere at reparere end tidligere brugte mønsterbaserede fejl. Endnu vigtigere er, at en undersøgelse af 88 rigtige fejl fra mennesker viser, at modellerne kun formår at rette 67,0 % af dem. Det betyder, at selv de bedste modeller fejler i en tredjedel af tilfældene, når de står over for reelle problemer – en afgørende indsigt for virksomheder, der overvejer at automatisere vedligeholdelsen af teknisk dokumentation.
En anden vigtig opdagelse er, at Typst er markant sværere at reparere end LaTeX og Markdown. Det har konsekvenser for virksomheder, der overvejer at skifte til Typst for deres tekniske dokumentation, da det kan øge omkostningerne ved AI-baseret fejlretning.
Mest bekymrende er dog fundet omkring indholdets integritet: Selv når modellerne formår at få dokumentet til at kompilere, ændrer de i 13,6-18,5 % af tilfældene faktisk dokumentets tekst. Det betyder, at en tilsyneladende vellykket reparation kan introducere fejl i indholdet, hvilket er kritisk for dokumentation, der skal være præcis.
Forskerne understreger, at kompileringssucces alene overvurderer kvaliteten af reparationen. For beslutningstagere betyder det, at man ikke kan stole blindt på AI-værktøjer til automatisk at rette dokumentationsfejl – der er behov for menneskelig gennemgang af indholdet.
Læs mere i den originale forskningsartikel.
