Spildevandsoperatører står ofte med spørgsmål som "hvorfor stiger N2O?" eller "hvad sker der, hvis jeg skærer luftningen med 20%?" – spørgsmål, der kræver svar forankret i den konkrete plantes variable og dynamik, ikke i generel sprogmodel-viden. Forskere har nu sammenlignet tre konkrete måder at forankre en frossen Qwen2.5-32B-Instruct-model i en arkitektonisk fortolkelig spildevandssimulator (CCSS-IX): en live simulator-orakel (Metode 1), struktureret parameter-injektion (Metode 2) og en Decoupled Recall-Reasoning (DRR) retriever (Metode 3).

På et kausalt benchmark med 198 spørgsmål opnår de tre metoder henholdsvis 99,5%, 79% og 75,8% – en markant forbedring i forhold til den stærkeste retrieval-augmented baseline på 48%. DRR-retrieveren har 110M parametre og trænes per plante på cirka 17 sekunder. Efter overførsel til en biologisk anderledes plante når den stadig 88%, mens Metode 2's statiske tabel ikke kan overføres.

På et kontrafaktisk benchmark med 60 spørgsmål er det kun Metode 3, der kan håndtere spørgsmål om, hvad der sker efter en intervention: +16,3 procentpoint over Metode 2, med 100% korrekt på tidskala- og driftsregime-kategorier. På AI2 Reasoning Challenge (ARC) med et OpenBookQA-faktakorpus når den samme selektive retrieval-mekanisme 79% mod 76% for uindskrænket Llama-3.1-8B og 74% for fuld injektion – en out-of-domain-replikation, der taler imod, at resultatet kun gælder spildevandsbehandling.

Forskerne leverer den første enkelt-simulator-sammenligning af live tool-use, statisk parameter-injektion og lært numerisk-parameter-retrieval til industriel kausal spørgsmål-besvarelse. For beslutningstagere i industrien betyder det, at AI-assistance nu kan gives med en troværdighed, der er forankret i den faktiske proces – ikke kun i sprogmodellens gæt.

Læs mere i det originale paper.