En ny forskningsartikel på arXiv introducerer ChemDIRT, et benchmark designet til at teste, hvor robuste sprogmodeller er, når de arbejder med kemi. Resultaterne er en øjenåbner: Modellerne præsterer markant ujævnt, afhængigt af hvordan opgaverne formuleres, og hvilken kemisk repræsentation der bruges. Det betyder, at tidligere benchmarks kan have overvurderet modellernes reelle evner i realistiske scenarier.

ChemDIRT adskiller sig fra eksisterende benchmarks ved systematisk at variere både instruktioner og molekylære repræsentationer på tværs af otte kategorier af kemiopgaver. Ifølge artiklen måler frameworket både nøjagtighed og konsistens under kontrollerede ændringer, hvilket giver et mere pålideligt billede af modellernes ræsonneringsevner end konventionelle single-format benchmarks. For eksempel kan en model klare en opgave perfekt, når den stilles på én måde, men fejle, når den samme opgave formuleres lidt anderledes – en skrøbelighed, som tidligere tests ikke har fanget.

Forskerne bag ChemDIRT har benchmarked en bred vifte af både open- og closed-source LLM'er og fundet betydelig prompt-følsomhed, repræsentationsafhængighed og ujævn præstation på tværs af opgavetyper. Det er et vigtigt signal for alle, der overvejer at bruge AI i kemisk forskning, udvikling eller kvalitetskontrol: En model, der klarer sig godt i en standardiseret test, er ikke nødvendigvis pålidelig i praksis, hvor opgaverne varierer.

For beslutningstagere i medicinal-, materiale- eller kemikalieindustrien betyder det, at man skal være varsom med at stole på enkeltresultater fra eksisterende benchmarks. ChemDIRT giver et værktøj til at vælge modeller, der er robuste nok til virkelige anvendelser – eller til at udvikle interne tests, der afspejler de variationer, man reelt møder. Artiklen er tilgængelig på arXiv, hvor man kan dykke ned i metodikken og de konkrete resultater.