Uafhængigt trænede sprogmodeller udvikler tilsyneladende fælles interne repræsentationer af begreber — og denne lighed kan udnyttes funktionelt. Det viser en ny systematisk undersøgelse fra arXiv, der for første gang dokumenterer, at såkaldte 'styringsvektorer' fra én model kan påvirke en helt anden model, uden at den er blevet finjusteret til formålet.
Forskerne testede fem åbne modeller i størrelsesordenen 0,8 til 8 milliarder parametre og to arkitektur-familier. Resultatet: Over en tærskel på cirka 1,7 milliarder parametre valideres 47–49 % af tværmodel-funktionsparrene (med høj statistisk sikkerhed), mens overførslen falder markant under 0,8 milliarder. En enkelt universel styringsvektor opnåede 67,3 % succes i fire ud af fem modeller uden nogen per-model supervision.
Det interessante er ikke kun, at det virker — men at det virker betinget. Overførslen forringes for modeller under 1,7 milliarder parametre og for én model med generationsustabilitet. Det bekræfter, at funktionel udnyttelighed kræver tilstrækkelig repræsentationskapacitet. Med andre ord: Jo større modellen er, jo mere 'fælles' bliver dens indre geometri med andre store modeller.
For beslutningstagere rejser det både muligheder og risici. På den ene side åbner det for mere effektiv styring af modeladfærd på tværs af systemer — eksempelvis til sikkerhedsjusteringer, der kan overføres uden dyr finjustering. På den anden side betyder det, at kontrolmekanismer, der er udviklet til én stor model, potentielt kan påvirke andre store modeller — også dem, man ikke selv har trænet. Det understreger behovet for at gentænke, hvordan vi sikrer og validerer kontrolforanstaltninger, især i lyset af at værktøjer valideret ved 7 milliarder parametre måske ikke virker på mindre modeller uden genvalidering.
Undersøgelsen giver dermed et funktionelt supplement til den såkaldte 'Platoniske Repræsentationshypotese' — at uafhængigt trænede modeller konvergerer mod fælles interne repræsentationer. Det er første gang, at denne geometriske konvergens kædes direkte sammen med tværmodel adfærdskontrol.
