En ny undersøgelse fra arXiv viser, at store sprogmodeller (LLM'er) med in-context learning kan finde beskyttede sundhedsoplysninger (PHI), som både specialbyggede afidentifikationssystemer og deres guldstandarder overser. På 100 pædiatriske onkologinotater fra Texas Children's Hospital (5.322 PHI-segmenter) overgik LLM'erne de specialbyggede systemer markant: bedste F1-score var 0,918 mod Stanford TiDE's 0,779. Forskellen var størst på institutionelt situeret PHI – fx hospitalsforkortelser, bygningsnavne og interne koder, hvis status er lokalt bestemt. Læs hele papiret på arXiv.
Det centrale fund er, at blot at nævne de oversete kategorier i prompten genvandt 79% (48/61) af de manglende PHI-segmenter, og at instruktioner mod over-redigering genoprettede præcisionen. Ingen agentisk arkitektur overgik en kalibreret enkelt-prompt (F1 0,906–0,907), hvilket betyder, at komplekse multi-agent setups ikke er nødvendige for at opnå topresultater.
Endnu vigtigere: LLM'erne afslørede 414 kandidat-huller i annotationsguldstandarden. Re-annotation bekræftede 227 PHI-segmenter, som de oprindelige systemer og deres reference havde overset. Med den endelige prompt nåede LLM'en en recall på 0,981 (F1=0,907). Det betyder, at LLM'erne ikke bare kan afidentificere bedre – de kan også bruges til at revidere og forbedre den reference, som andre systemer vurderes mod.
For beslutningstagere i sundhedssektoren og virksomheder, der håndterer helbredsdata, er implikationen klar: LLM-baseret afidentifikation er ikke længere et eksperiment, men en legitim, tilpasningsdygtig løsning. Den koster mere at køre end traditionelle metoder, men prisen køber både bedre compliance og en måde at auditere sin egen reference på. Institutionsspecifik prompt-udvikling bør være den primære tilpasningsstrategi, ikke at bygge eller købe endnu et specialsystem.
