En ny familie af tekst-embedding-modeller, kaldet Giga-Embeddings, er offentliggjort på arXiv. Modellerne er designet til at kombinere høj kvalitet i informationssøgning med effektiv servering – en kombination, der kan få betydning for virksomheder, der bygger eller driver søgeløsninger, RAG-systemer eller andre applikationer, der afhænger af tekstrepræsentationer.
Den største model i familien er en sparsom Mixture-of-Experts-encoder med 10 milliarder parametre, men kun omkring 1,8 milliarder aktive parametre pr. token. Det betyder, at den kan levere stærk ydeevne uden at kræve samme beregningsressourcer som en tæt model af samme størrelse. Ifølge forfatterne opnår denne model den stærkeste samlede ydeevne på tværs af engelske, russiske, flersprogede og kode-MTEB-benchmarks sammenlignet med de øvrige modeller i familien.
Hastighed er et centralt salgsargument: I en vLLM-benchmark med 1024-token-inputs behandler den 114.500 tokens pr. sekund – 25 procent højere gennemløb end den tætte 3B-model og 1,56 til 2,65 gange gennemløbet af de evaluerede eksterne systemer. For virksomheder, der serverer mange forespørgsler, kan det oversættes til lavere latenstid eller reducerede serveromkostninger pr. forespørgsel.
Familien inkluderer også en tæt 3B-encoder og en destilleret 480M-encoder til strammere compute- og hukommelsesbudgetter. Den kompakte model er trænet med et dimensions-agnostisk mål, der justerer teacher- og student-similaritetsfordelinger. Resultatet er en 480M-model, der scorer 70,98 på Russian MTEB – højere end FRIDA, mens den bruger 42 procent færre parametre. For udviklere, der har brug for effektive modeller til edge-enheder eller mindre infrastruktur, er det en relevant overvejelse.
Alle tre model-checkpoints er frigivet, hvilket gør det muligt for teams at implementere dem direkte. Det er værd at bemærke, at resultaterne er baseret på forfatternes egne benchmarks, og at uafhængig validering endnu ikke er offentliggjort.
For beslutningstagere, der overvejer at opgradere eller bygge søgeinfrastruktur, peger denne udgivelse på en tendens: Embedding-modeller bliver både bedre og billigere at drive, især med sparsomme arkitekturer. Det kan påvirke valget af modelleverandør og den interne afvejning mellem kvalitet og driftsomkostninger.
