Kliniske forsøgsprogrammer — at omsætte studieprotokoller til analyseklare datasæt under CDISC-standarder — er en flaskehals i regulatoriske indsendelser, og hidtil har LLM-baseret kodegenerering fejlet katastrofalt på opgaven: på tværs af 11 enkeltforsøg med fem frontier-modeller producerede ingen et validt datasæt på subjektniveau. Det viser en ny arXiv-udgivelse, der introducerer GxP-Agent, et multi-agent-system, som indkoder regulatorisk procesrækkefølge som en rettet acyklisk graf (DAG).

Systemet nedbryder monolitisk datasætgenerering i 15 domænespecifikke noder, udført af worker-agenter med pharmaverse-færdighedskontekst, valideringsporte og betinget genforsøg. På CDISC-Bench, en ny eksekveringsbaseret benchmark bygget fra FDA-pilotindsendelsen CDISCPilot01 (254 subjekter, 49 ground-truth ADSL-variabler), opnår GxP-Agent med Claude Sonnet 4.6 100% strukturel match (49/49 variabler, 254 korrekte records) på tværs af tre uafhængige kørsler — sammenlignet med 59,2% for den bedste retrieval-augmenterede baseline og 0% for alle single-agent- og flade multi-agent-tilgange.

Bemærkelsesværdigt generaliserer DAG-topologien også til svagere modeller: GPT-4.1 opnår 59,2% gennemsnitlig strukturel match under samme DAG, hvor den scorer 0% under enhver anden arkitektur. Tilgangen generaliserer desuden til ADAE (adverse events; 9-node forgrenet DAG, 55 variabler, 1.191 records), hvor den opnår 100% strukturel match ved første forsøg.

For beslutningstagere i life science og regulatoriske processer signalerer resultatet, at pålidelig GxP-kompatibel programmering ikke kræver stærkere modeller, men bedre procesindkodning. At lægge domæneviden i graf-topologien — frem for at stole på LLM-ræsonnement alene — kan være nøglen til at automatisere en opgave, der hidtil har været en flaskehals i godkendelsesprocesser.