Forskere har udviklet en ny metode, der markant forbedrer AI-modellers evne til at generere funktionelle hjemmesider ud fra naturlige sprogbeskrivelser. Metoden, kaldet WebGrader, løser en central flaskehals i træningen af sprogmodeller: hvordan man automatisk vurderer, om en genereret hjemmeside faktisk virker, som den skal.

Traditionelt har man brugt enten manuelt skrevne browser-scripts, som er dyre at lave, eller visuelle og GUI-baserede evaluatorer, som kan afgive dommen for tidligt. WebGrader adskiller sig ved at udlede de nødvendige interaktionsflows automatisk fra hver enkelt hjemmeside-anmodning, repræsentere dem som eksekverbare 'Flow Contracts' og bruge resultatet som belønning i reinforcement learning. Ifølge arXiv-papiret materialiserer WebGrader den genererede projekt i en live browser, forankrer handlinger mod kildekode og live DOM, og indsamler visuelle, DOM-, respons- og persistent-state-beviser langs samme browser-bane.

Resultaterne er markante: På WebGen-Bench træner WebGrader en 8B-politik til en funktionel succesrate på 52,01%, hvilket er 7,88 procentpoint bedre end en matchet appearance-plus-script-belønning og overgår både o4-mini og DeepSeek-v4-flash. På WG-core-250 opnår politikken en Full Score på 44,953 og overgår Qwen3-Coder-480B. Det betyder, at en mindre model med denne træningsmetode kan præstere bedre end væsentligt større modeller.

For beslutningstagere er implikationen klar: Evnen til at generere velfungerende webapplikationer fra simple beskrivelser kan reducere udviklingstid og -omkostninger markant. Metoden adresserer et kerneproblem i AI-genereret kode — at det ofte ser rigtigt ud, men fejler i praksis. Ved at sikre, at belønningen kun gives efter at have observeret den ønskede overgang, skaber WebGrader et mere pålideligt fundament for træning af modeller, der kan bruges i produktionsmiljøer.