Et nyt benchmark, WuYuEval, viser, at selv de bedste AI-modeller har betydelige svagheder, når de skal træffe professionelle beslutninger inden for affaldshåndtering. Mens topmodellen opnår 94,64% korrekthed på grundlæggende viden, falder gennemsnittet til 42,50% på de sværeste opgaver – især inden for beregning, eksperimentelt design, byplanlægning og åbne ekspertopgaver.

Benchmarket, udviklet af forskere og beskrevet i en ny artikel på arXiv, adskiller sig fra eksisterende tests ved at fokusere på professionelle beslutninger under tekniske, miljømæssige og politiske begrænsninger. Det indeholder en grundmodul med 4.590 multiple-choice-spørgsmål og en ekspertmodul med 247 scenariebaserede åbne spørgsmål, der kræver multi-objektiv optimering og afvejning af modstridende hensyn.

For beslutningstagere i affaldssektoren – kommuner, renovationsselskaber og rådgivere – er resultatet en klar advarsel: AI kan være en nyttig assistent til rutineopgaver, men den kan ikke stoles på til komplekse, strategiske valg. Undersøgelsen viser også, at AI-modeller, der bruger 'tænkende' tilstande, kun forbedres, når de er forankret i konkrete enheder, antagelser og tekniske begrænsninger. Ellers kan de 'drive væk fra afgørende svar'.

Det betyder, at virksomheder og offentlige instanser, der overvejer at implementere AI i affaldshåndtering, bør kræve dokumentation for, hvordan modellen håndterer komplekse, kontekstafhængige beslutninger – ikke kun generel viden. Benchmarket kan bruges som et værktøj til at evaluere og vælge de rette AI-løsninger.