Et nyt forskningssystem, Mechanist, bruger AI til selv at opdage, hvordan andre AI-modeller fungerer – fra at finde uventede sikkerhedsrisici til at forklare, hvordan modeller danner overbevisninger. Systemet er udviklet til at lukke kløften mellem, hvad modeller kan gøre, og vores evne til at forstå og kontrollere dem.
Mechanist er et agentisk system, der fungerer som et videnskabeligt instrument til autonom opdagelse af de mekanismer, der ligger bag AI-intelligens. Det bygger på en fortolkningsfokuseret vidensgraf med cirka 13.000 papers og integrerer en tværfaglig database med 43 millioner papers fra 26 felter. Derudover har systemet adgang til et bibliotek med 32 fundamentale metoder til mekanismeanalyse, kausal indgriben og validering.
Sammenlignet med eksisterende systemer som Claude Code og andre AI-forskersystemer genererer Mechanist mere værdifulde mekanismehypoteser og udfører eksperimenter mere pålideligt. Det viser også en progression fra at opdage modeladfærd til at forklare og kontrollere AI-modeller.
Et af systemets mest opsigtsvækkende fund er en kontraintuitiv sikkerhedsrisiko i videnskabelige laboratorier: usikre egenskaber kan overføres på tværs af modaliteter gennem tilsyneladende sikre træningsdata. Det er en risiko, som traditionelle sikkerhedsvurderinger kan overse.
Mechanist udvikler desuden en mekanistisk teori om overbevisninger, der afslører, hvordan modeller repræsenterer verdensviden, danner overbevisninger, infererer andres overbevisninger, og hvordan disse mekanismer opstår under prætræning. Endelig oversætter systemet disse indsigter til praktiske interventioner, der forbedrer modelpræstationer i forskellige scenarier og styrer videnskabelige basismodeller mod at generere DNA-sekvenser med specificerede egenskaber.
For beslutningstagere betyder det, at vi nu har et værktøj, der kan automatisere den ellers manuelle og tidskrævende proces med at forstå, hvad AI-modeller faktisk gør – og hvorfor. Det kan blive afgørende for virksomheder og institutioner, der skal vurdere risici ved at implementere AI i følsomme områder som forskning, sundhed og finans.
