En ny kompakt AI-model til juridisk informationssøgning viser, at specialiserede modeller kan matche langt større systemer – og samtidig køre på almindelig hardware. GreenLeaf Law Embed Tiny, udviklet af forskere og præsenteret på arXiv, opnår 75,11% på Massive Legal Embedding Benchmark (MLEB) og 64,38% på MTEB(Law, v1), hvilket placerer den blandt de bedste modeller under 1 milliard parametre.

Modellen er bygget med en to-trins træningsproces: først destilleres viden fra en større lærer-model ned i en kompakt elev-arkitektur, derefter finjusteres den med juridisk specifikke data og hård negativ mining. Træningsdata omfatter 3,4 millioner query-passage-par, herunder 150.000 menneskeligt kuraterede eksempler fra forskellige retssystemer.

For beslutningstagere i advokatbranchen, retsvæsenet eller legal-tech-virksomheder er det centrale punkt ikke teknikken i sig selv, men konsekvensen: Modellen understøtter flere kvantiseringsniveauer (BF16, INT8, binær), hvilket gør den anvendelig i miljøer med begrænsede ressourcer. Det betyder, at juridisk søgning kan ske lokalt – uden at sende følsomme dokumenter til eksterne sky-tjenester.

Resultaterne indikerer, at domænespecifik træning med høj kvalitetsdata kan løfte selv små modeller til et niveau, hvor de reelt kan bruges i produktion. For virksomheder, der overvejer at bygge eller købe juridisk AI, er spørgsmålet ikke længere kun, om modellen er god nok – men om man kan få samme ydelse med mindre infrastruktur og større kontrol over data.