Et open source-værktøj til at teste og validere AI-modeller vinder stærkt frem og bliver brugt af både OpenAI og Anthropic. promptfoo er et TypeScript-baseret værktøj, der giver udviklere og virksomheder mulighed for at sammenligne ydeevnen af forskellige AI-modeller som GPT, Claude, Gemini og DeepSeek — og ikke mindst til at udføre såkaldt "red teaming" og sårbarhedsscanning af deres AI-systemer.

For beslutningstagere, der overvejer at bygge eller købe AI-løsninger, er dette vigtigt: promptfoo tilbyder en simpel, deklarativ konfiguration, der kan integreres direkte i eksisterende CI/CD-pipelines. Det betyder, at kvalitetssikring af AI ikke længere kræver specialiserede teams eller dyre værktøjer — det kan automatiseres som en del af den normale softwareudviklingsproces.

Værktøjets popularitet afspejler en bredere tendens: Efterhånden som AI går fra eksperimenter til produktion, bliver evnen til at teste, overvåge og sikre AI-systemer en konkurrenceparameter. At både OpenAI og Anthropic selv bruger promptfoo signalerer, at værktøjet er modent nok til selv de mest krævende miljøer.

For virksomheder, der skal vælge leverandør eller bygge egne AI-løsninger, er det værd at overveje, hvordan kvalitetssikring af AI håndteres. promptfoo viser, at der findes robuste open source-muligheder, der kan reducere risikoen ved AI-implementeringer — både i forhold til funktionalitet og sikkerhed.