Et nyt åbent dataset fra LAION kan give både forskere og virksomheder en hidtil uset ressource til at træne AI-modeller, der forstår både video, lyd og billeder. LAION-BVD indeholder 80 millioner videoer med en samlet varighed på 10 millioner timer, indsamlet fra offentlige kilder via CommonCrawl.

Datasættet er designet til multimodal pre-training, hvilket betyder, at modeller kan lære at forbinde indhold på tværs af flere sansemodaliteter. Ved hjælp af indholdsbevidst sceneregistrering er videoerne opdelt i klip, og der er genereret syntetiske billedtekster til både video og lyd. Ifølge forskerne opnår modeller trænet på disse data konkurrencedygtige resultater på standard benchmarks for video-tekst og lyd-tekst, med konsekvente forbedringer, når trænings- eller modelstørrelsen øges.

En særlig interessant detalje er brugen af video-rammer som en alternativ kilde til billed-tekst-data. Ved at udtrække scener, hvor indholdet ændrer sig markant, har forskerne skabt et datasæt, der adskiller sig visuelt fra traditionelle web-billedkorpus. Modeller trænet på disse rammer opnår stærk billed-tekst-retrieval-ydeevne.

For beslutningstagere er det vigtigste, at datasættet er åbent og frit tilgængeligt for forskningsmiljøet. Det betyder, at både etablerede virksomheder og nye startups kan få adgang til en ressource i en skala, der tidligere var forbeholdt de største tech-giganter. Dette kan accelerere innovation inden for alt fra videoforståelse til automatisk indholdsgenerering og søgning.