Multimodale AI-modeller (MLLM'er) klarer sig godt på statiske billeder og korte signaler, men fejler markant, når de skal analysere lange, dynamiske EKG-optagelser fra Holter-monitorer. Det viser et nyt benchmark, Holtercare-Bench, præsenteret af forskere fra Zhejiang University.

Forskerne har bygget et datasæt, Holtercare-23K, med 22.980 spørgsmål-svar-par fra 788 kliniske Holter-optagelser, hvor signal, video og tekst er koblet sammen. På dette grundlag tester benchmarken modellernes evne til at lokalisere hændelser i tid, stille kliniske diagnoser og lave globale opsummeringer. Resultaterne viser, at selv førende MLLM'er har et markant præstationsgab, når de skal håndtere ultra-lange, patologiske sekvenser.

For beslutningstagere i sundhedssektoren og AI-investeringer er pointen klar: Modeller, der excellerer i andre medicinske opgaver, er ikke nødvendigvis klar til langvarig overvågning, som er afgørende for fx arytmi-detektion. Men der er håb: Fine-tuning af repræsentative modeller giver væsentlige forbedringer, hvilket peger på, at specialiserede løsninger kan lukke gabet.