En ny open source-løsning giver Anthropics AI-model Claude evnen til at 'se' og 'høre' videoer. Værktøjet, claude-video, er udviklet af bradautomates og har på én dag fået 989 stjerner på GitHub – en indikation af, at behovet for multimodal videoanalyse er stort.
Værktøjet fungerer ved at downloade en video, udtrække frames (billeder) og transskribere lydsporet. Herefter sendes både frames og transskription til Claude, som så kan analysere indholdet. Det betyder, at Claude pludselig kan bruges til opgaver som automatisk at opsummere mødeoptagelser, analysere overvågningsvideo eller ekstrahere information fra undervisningsvideoer – uden at udviklere selv skal bygge kompleks pipeline.
Dette er relevant, fordi det giver organisationer, der allerede bruger Claude til tekst- eller billedanalyse, mulighed for at udvide til video uden at skifte model eller platform. Værktøjet er open source og skrevet i Python, hvilket gør det let at integrere i eksisterende workflows. Kvaliteten af analysen afhænger dog af Claudes evne til at forstå konteksten på tværs af frames og transskription – en opgave, der stadig er under udvikling i AI-forskningen.
Strategisk set peger dette på en tendens: Open source-fællesskabet bygger bro mellem specialiserede AI-modeller og praktiske anvendelser. For virksomheder, der overvejer at investere i videoanalyse, kan claude-video være en hurtig og billig måde at teste værdien af multimodal AI på, før man binder sig til dyrere, proprietære løsninger.
