En ny stor undersøgelse fra arXiv viser, at træning af sprogmodeller til at ræsonnere på andre sprog end engelsk kan give næsten samme resultater som engelsk-træning – men også medføre alvorlige tilbageslag på andre sprog. Forskerne bag undersøgelsen har kortlagt, hvordan GRPO, en central metode til at forbedre modellers ræsonnement, opfører sig på tværs af sprog og modeller.

Undersøgelsen finder, at træning i modersproget ofte kun efterlader et lille gab til træning på engelsk, og at der er stærk krydslingvis overførsel: træning på ét sprog forbedrer ofte præstationen på mange andre. Men mønstrene er stærkt model- og sprogafhængige, og i nogle tilfælde fører træning på et bestemt sprog til markante forringelser på andre sprog.

For beslutningstagere, der overvejer at implementere flersprogede AI-løsninger, er konsekvensen klar: gevinsten ved at træne på lokale sprog er reel, men kræver omfattende evaluering for at opdage sprogspecifikke regressioner. At antage, at én model passer til alle sprog, kan føre til uventede fejl i produktion.