De fleste NL2SQL-modeller hævder at ramme over 89 procents eksekveringsnøjagtighed på benchmarks som Spider og BIRD. Men et nyt benchmark, ESQ-Bench, viser, at de tal er misvisende, når det kommer til virkelige enterprise-databaser.

ESQ-Bench er bygget op omkring Oracle-databaser med systematiske kompleksitetsniveauer og evaluerer modellerne på seks befolkede skemaer med i alt 465 tabeller og 164.682 rækker – alle med identiske seed-data på tværs af Oracle, PostgreSQL, MySQL og SQL Server. Benchmarken indeholder 550 guld-validerede spørgsmål-query-par fordelt på tre kompleksitetsniveauer.

Resultaterne er tankevækkende. GPT-4o med schema-linked prompting falder fra 79,8 procent eksekveringsmatch på niveau 1 til 57,2 procent på niveau 3. Claude Sonnet 4.6 klarer sig bedre med 87,4, 74,9 og 68,7 procent på de samme niveauer. Men det vigtigste fund er, at selv blandt de queries, der eksekveres korrekt, er der en stille semantisk divergens på 73-99 procent – altså at modellen genererer SQL, der kører, men som giver forkerte resultater.

For beslutningstagere betyder det, at man ikke kan stole blindt på NL2SQL-modeller i enterprise-sammenhænge, især ikke på Oracle. De åbne modeller halter endnu mere: Llama 3.2 når kun 13,3 procent på tværs af bankens niveauer. Det er en klar indikation af, at virksomheder, der overvejer at implementere NL2SQL-løsninger, bør teste på deres egne data og ikke kun på akademiske benchmarks.