Forskere har udgivet det første offentligt tilgængelige nepali-dominerede benchmark for opdagelse af out-of-context (OOC) misinformation – hvor autentiske billeder parres med vildledende billedtekster for at skabe falske fortællinger uden billedmanipulation. NepOOC-benchmarken indeholder 1.090 billede-tekst-par (545 ægte, 545 OOC) annoteret på tværs af fem typologier, herunder fabrikerede, fejlciterede og geografiske eller tidsmæssige fejljusteringer, med en inter-annotator-aftale på kappa = 0,84.
Den systematiske evaluering af fem multimodale arkitekturer samt tekst- og billed-only-baselines viser et overraskende resultat: En tekst-only mBERT-model opnår 94,65 ± 0,20 % Macro-F1, hvilket er statistisk ækvivalent med det bedste multimodale system (ResNet-50+mBERT, samme F1; McNemar median p = 1.000). Billed-only-modeller præsterer nær tilfældighed (33-50 %). Dette indikerer, at billedsemantik i øjeblikket er utilstrækkelig til at fange OOC-misinformation, mens billedtekstens indhold alene er tilstrækkeligt ved denne dataskala.
For beslutningstagere, der overvejer at implementere OOC-detektion – fx i nyhedsplatforme, sociale medier eller faktatjek-organisationer – betyder resultatet, at man ikke nødvendigvis behøver tunge multimodale systemer for at komme i gang. Tekstbaserede modeller kan levere stærk ydeevne på nuværende niveau, og træningsdataskala viser sig at være en mere direkte vej til forbedring end arkitektonisk kompleksitet eller regional specialisering.
Dog bør resultatet læses med forbehold: Datasættet er lille (1.090 par), og forfatterne påpeger, at udvidelse af datasættet er en mere direkte vej til fremskridt end arkitektonisk raffinement. For virksomheder, der ønsker at bygge robuste systemer på tværs af sprog og kulturer, er dette et signal om at investere i dataindsamling og annotation frem for i dyrere modeller.
