En ny forskningsmetode, SkillConsist, kan opdage uoverensstemmelser mellem, hvad en AI-agent hævder at gøre, og hvad den faktisk gør. Det er afgørende, fordi sådanne uoverensstemmelser kan skjule farlig adfærd eller få virksomheder til at vælge den forkerte agent-færdighed. Metoden, beskrevet i et arXiv-paper, opnår en markant forbedring i præcision sammenlignet med eksisterende tilgange.
SkillConsist adresserer to centrale udfordringer: At adskille erklæret adfærd fra faktisk implementering, og at håndtere, at en kort beskrivelse kan dække over flere sammenhængende implementeringstrin. Metoden bruger en LLM til at opdele indhold i adfærdsregistreringer, kombineret med statisk analyse, og opbygger derefter to grafer: én for erklæret og én for faktisk adfærd. Ved at sammenligne disse grafer identificerer den konflikter.
På en benchmark med 633 færdigheder fra ClawHub's 500 mest downloadede offentlige færdigheder og 133 Skill-Inject-pakker, opnår SkillConsist 86,85% præcision, 89,03% recall og 87,93% F1 for pakke-niveau detektion — en forbedring på 20,43 procentpoint i F1 over den bedste baseline. For lokalisering af uoverensstemmelser opnår den 67,60% præcision og 58,14% recall.
For beslutningstagere betyder dette, at der nu findes en mere pålidelig metode til at validere AI-agenter, før de implementeres i produktionsmiljøer. Det kan reducere risikoen for uventet adfærd og hjælpe med at vælge de rigtige færdigheder.
