En ny open-source model, InSight-doc, angriber et velkendt problem for virksomheder, der arbejder med lange, visuelt rige dokumenter: behandlingen er dyr og fejlbehæftet. Modellen, udviklet af forskere og udgivet på Hugging Face, starter med lav opløsning og zoomer kun ind på de regioner, hvor der er brug for flere detaljer – uden at bruge en ekstern søgemaskine. Det reducerer inferens-latensen med 41–68% og hallucinationer med mere end 40% på lange dokumenter, samtidig med at nøjagtigheden forbedres med 4,3–16,4 procentpoint på dokument-VQA-benchmarks. Koden, datasæt og model er offentligt tilgængelige.
For beslutningstagere betyder det, at dokumenttunge processer – fra juridisk gennemgang til due diligence og kundeservice – kan blive markant billigere og mere pålidelige. Den adaptive tilgang betyder, at virksomheder kan skalere dokumentanalyse uden at eksplodere i cloud-omkostninger, og at resultaterne er mere troværdige, fordi modellen er trænet med 17,9K eksempler på aktiv perception og 19,2K hårde RL-eksempler. Det er ikke en triviel opdatering, men en ny arkitektur, der behandler visuel opløsning som en ressource, der kan allokeres dynamisk.
Strategisk set åbner det for, at organisationer kan automatisere opgaver, der tidligere krævede menneskelig gennemgang af lange dokumenter – og gøre det hurtigere og med færre fejl. For dem, der overvejer at bygge eller købe dokumentanalyse-løsninger, er det værd at undersøge, om InSight-doc kan integreres i eksisterende workflows, da den er open source og dermed kan tilpasses uden licensomkostninger.
