En ny forskningsindsats viser, at sprogmodeller kan optimere SQL-databaseforespørgsler på GPU'er med markante hastighedsforbedringer — et skridt mod at automatisere en opgave, der hidtil krævede håndskrevet kode. DataKernelBench, et nyt benchmark fra arXiv, oversætter SQL til validerede PyTorch TorchPlan-programmer og evaluerer, hvor godt LLM'er kan optimere enten kerneudsnittet eller hele forespørgslen i CUDA eller Triton gennem eksekveringsstyret reparation.

På TPC-H SF10 med en H100-GPU opnåede den stærkeste fuld-forespørgsels CUDA-konfiguration en 2,11× hastighedsforøgelse i forhold til torch.compile ved fuld beståelsesrate. For data større end GPU-hukommelsen, udvidet med Dask-cuDF til on-demand partition-loading på TPC-H SF100 med fire H100-GPU'er, blev der opnået 2,54× hastighedsforøgelse.

Forskerne fandt, at de bedste implementeringer typisk brugte kernel-fusion og ændringer i eksekveringsstrategien, og at stærkere modeller havde størst gavn af fuld-forespørgsels-specialisering. Interessant nok betød arbejdsbyrdens kontekst mere end hardwarekonteksten for resultatet.

Konsekvens for beslutningstagere: Dette er ikke kun en akademisk øvelse. For virksomheder, der driver store database-systemer på GPU-infrastruktur, peger resultatet på, at AI-drevet kodeoptimering kan blive en konkurrenceparameter — potentielt reducerende behovet for specialiserede CUDA-udviklere og løbende manuel tuning. Det åbner også for, at LLM'er kan bruges i produktionsmiljøer til at forbedre ydeevnen på eksisterende SQL-arbejdsbyrder uden at omskrive hele systemer.