Modelkort rapporterer typisk kvalitet under server-klasse, fuld præcision. De tal siger sjældent noget om, hvordan den samme model opfører sig på en telefon. Den uge udgav Liquid AI Pipette, en open-source platform til benchmarking af foundation-modeller på edge-enheder, bygget i partnerskab med Artificial Analysis som uafhængig validator af metodikken. Pipette behandler on-device-adfærd som en helhed – kvantisering, runtime og hardware måles sammen, ikke hver for sig.

For beslutningstagere, der overvejer at købe eller bygge AI-løsninger til telefoner, tablets eller andre enheder, er dette en game-changer. Tidligere var man nødt til at stole på modelkort, der lovede ydeevne under ideelle forhold – tal der ofte ikke holder i praksis. Med Pipette kan man nu få reproducerbare, uafhængige målinger, der viser, hvordan en model faktisk klarer sig på den hardware, man planlægger at bruge. Det reducerer risikoen ved at vælge en model til on-device-applikationer markant.

Platformen er open-source, hvilket betyder, at enhver kan køre benchmarks selv eller verificere resultaterne. Partnerskabet med Artificial Analysis giver ekstra troværdighed, da metodikken er valideret af en uafhængig aktør. For virksomheder, der investerer i edge-AI, er dette et værktøj, der kan spare både tid og penge ved at undgå dyre fejlkøb.