Automatisk generering af prøvespørgsmål kan spare lærere for betydelig tid, men hidtidige systemer har halter på pålidelighed og tilpasning til specifikke læreplaner. Nu introducerer forskere TeachMateGPT, et multi-agent-system designet til at skabe lærebogsforankrede vurderingsopgaver med væsentligt højere kvalitet end tidligere løsninger. Systemet adresserer centrale svagheder i eksisterende retrieval-augmented generation (RAG) systemer, som ofte er begrænset til enkeltspørgsmål og mangler sikkerhedsforanstaltninger mod svag evidens.

TeachMateGPT bygger på fire centrale fremskridt, som hver især løser et konkret problem. For det første introducerer det COPE, en hierarkisk vidensbase, der strukturerer dokumenter efter læreplanens opbygning og forbinder dem i tre granularitetsniveauer via en grafbaseret lineage. Dette erstatter den traditionelle token-window-chunking og sikrer, at evidens matches til hvert emnes undervisningsniveau. For det andet anvender systemet en trinvis, fail-closed agent-pipeline, hvor en routing-gate styrer søgningen, og en coverage-gate tilbageholder generering, hvis evidensen er utilstrækkelig. Dette reducerer risikoen for at producere opgaver uden solidt grundlag.

For det tredje implementerer TeachMateGPT SAVER, en kildeattribueret verifikationsprotokol, der scorer trofasthed, relevans og hallucinationsrisiko mod den hentede evidens. SAVER anvender strengere grounding-tjek på hver af de fire underdele i kreative spørgsmål og inkluderer lærer-i-loop-evaluering frem for automatisk filtrering. Endelig introducerer forskerne NCTB-SciGen8, et datasæt med 198 vurderingsemner (143 multiple-choice og 55 kreative spørgsmål) dækkende alle 14 kapitler i NCTB's 8. klasses naturfagsbog, vurderet af tre praktiserende lærere.

Resultaterne er markante: TeachMateGPT øger trofasthed fra 0,68 til 0,96 og svarrelevans fra 0,60 til 0,89 sammenlignet med en vanilla RAG-baseline. Dette indikerer, at systemet ikke blot producerer flere opgaver, men også opgaver af højere kvalitet, der er tættere knyttet til lærebogens indhold.

For beslutningstagere i uddannelsessektoren og edtech-virksomheder betyder dette, at AI-drevet opgavegenerering nu er tættere på at være anvendelig i praksis. Systemets evne til at håndtere lavressource-læreplaner og board-eksamensstrukturer gør det relevant for markeder uden for de store engelsksprogede uddannelsessystemer. Lærere kan potentielt frigøres fra rutinepræget opgavekonstruktion, men den lærer-i-loop-tilgang understreger, at menneskelig vurdering forbliver afgørende for at sikre kvalitet.

Læs mere om TeachMateGPT i den originale arXiv-publikation.