Forskere har præsenteret en ny tilgang til vidensredigering i store sprogmodeller (LLM'er), der adresserer et centralt problem: Når man opdaterer en models viden med en fri tekstpassage, kan modellen ofte huske passagen, men ikke bruge den til at svare på konkrete spørgsmål eller kombinere fakta i fler-trins ræsonnementer. Metoden, kaldet HPSE (Hybrid-Policy Self-Editing), er beskrevet i et nyt paper på Hugging Face og tilbyder en løsning, der kan være afgørende for virksomheder, der ønsker at holde deres AI-systemer opdaterede uden at genoptræne dem fra bunden.

Traditionel vidensredigering (KE) har fokuseret på strukturerede data, men nyere forskning bevæger sig mod ustruktureret KE, hvor redigeringen er en fri passage, der kan indeholde flere fakta på én gang. Problemet er, at eksisterende editorer injicerer passagen, men ikke formår at bruge den: Den redigerede model kan gengive passagen, men kan hverken besvare atomare spørgsmål om dens fakta eller komponere dem til fler-trins ræsonnementer. Forskerne tilskriver denne manglende egenskab, som de kalder 'composability', editorernes passive afhængighed af den faste passage som eneste læringskilde.

HPSE løser dette ved at omforme redigering til en proaktiv selv-destillation fra en privilegeret in-context tilstand af samme model, hvilket ikke kræver ekstern supervision. Metoden bygger en hybrid rollout, der træder ind og placerer manglende fakta på studentens egen bane præcis der, hvor dens dækning fejler, mens den ellers forbliver on-policy. Forskerne analyserer teoretisk HPSE's fordel over ren on-policy destillation og etablerer empirisk dens plug-and-play-forbedringer på tværs af fire LLM-baser og to KE-editorer under forskellige scenarier.

For beslutningstagere betyder dette, at man kan opdatere en models viden med en fri tekst, og modellen kan derefter bruge den nye viden til at svare på spørgsmål og ræsonnere over den. Det er et skridt mod mere fleksible og vedligeholdelsesvenlige AI-systemer, hvor man ikke behøver at genoptræne eller finjustere hele modellen for at opdatere dens viden. Det kan have betydning for virksomheder, der bygger AI-assistenter, der skal følge med i et hurtigt skiftende informationslandskab.