En ny træningsmetode, Co-RL, viser, at AI-modeller kan udvikle ræsonnement uden at få facitlisten fra mennesker. I stedet for at lære af manuelt verificerede belønninger — som er dyre at producere og svære at skalere — træner flere modeller hinanden i et samarbejde, hvor de belønner hinandens svar. Resultaterne er bemærkelsesværdige: Co-RL matcher eller overgår superviseret læring på tværs af syv tekst-baserede og fire multimodale benchmarks, uden at bruge nogen ground-truth labels. På tekst-benchmarks giver metoden gennemsnitlige forbedringer på 3,0-8,6 procentpoint, og på multimodale benchmarks 2,3-7,2 procentpoint, ifølge paperet.
Metoden adresserer et centralt problem i AI-udvikling: afhængigheden af menneskelig evaluering. Jo bedre modeller bliver, jo sværere bliver det for mennesker at vurdere, hvad der er korrekt — og det gør manuelle labels til en flaskehals. Co-RL løser dette ved at lade flere modeller, der ikke deler parametre, træne hinanden gennem peer-baserede belønninger. En vigtig pointe er, at mangfoldighed er afgørende: Ved at bruge heterogene modeller — forskellige familier, størrelser og omskrevne træningseksempler — reduceres de korrelerede fejl, der ellers får modeller til at forstærke egne skævheder og kollapse i ensartede svar. Det er en konkret løsning på et kendt problem i selv-belønnende RL, hvor modeller kan blive fanget i feedback-loops.
For virksomheder og beslutningstagere betyder det noget på to fronter. For det første sænker det omkostningen ved at udvikle AI-systemer, fordi behovet for dyre, manuelle annotationsprocesser reduceres markant. For det andet peger det på en vej til at træne modeller, der kan blive ved med at forbedre sig, selv når opgaverne overstiger menneskelig evalueringsevne — et kritisk skridt for at skalere AI til mere komplekse domæner. Koden er offentligt tilgængelig på GitHub, så interesserede kan selv afprøve metoden.
