En ny forskningsartikel på arXiv introducerer AFDBench, den første benchmark til at evaluere AI-modellers evne til at generere professionelle vejrudsigtsdiskussioner – de tekniske analyser, som meteorologer i den amerikanske vejrtjeneste (NWS) udarbejder. Resultaterne viser, at selvom open-source-modeller har svært ved at matche den faglige stil og præcist bruge deres inputdata, kan forstærkningslæring næsten fordoble deres evne til at skrive som professionelle meteorologer.

Forskerne bag AFDBench har bygget et datasæt med 7.732 ekspert-skrivne diskussioner fra 13 NWS-kontorer, parret med rigtige AI-vejrdata fra Googles WeatherNext 2. De har desuden udviklet tre målemetoder: Met-Align (numerisk nøjagtighed), Style-Align (faglig sprogbrug) og Input-Grounding (trofasthed mod kildedata).

I zero-shot-evalueringer – hvor modellerne ikke er trænet på opgaven – scorer open-source-modeller lavt på Style-Align (~0,33) og moderat på Input-Grounding (~0,88). De formår altså hverken at skrive i den professionelle NWS-register eller at bruge deres inputdata pålideligt. Men ved at anvende Group Relative Policy Optimization (GRPO) med domænespecifikke belønninger, der målretter temperatur-nøjagtighed, synoptisk korrekthed og format-overholdelse, forbedres resultaterne markant: Style-Align stiger fra 0,318 til 0,619, og Input-Grounding fra 0,881 til 0,940 på 1.033 hold-out-prøver fra to NWS-kontorer, som modellen ikke har set før.

For beslutningstagere i meteorologi, forsikring, logistik og katastrofeberedskab er dette ikke en teknisk kuriosum. Vejrudsigter er højrisiko-kommunikation, hvor fejl i tal eller fortolkning kan få alvorlige konsekvenser. At AI-modeller nu kan trænes til at skrive fagligt korrekte og datatrofaste analyser åbner for mere automatisering i vejrtjenester og relaterede sektorer – men det understreger også, at åbne modeller kræver målrettet træning, før de kan bruges i produktion.