Næringsliv28. juli 2026
Store språkmodeller sliter med avansert SQL-feilretting
Ny forskning viser betydelige begrensninger i store språkmodellers evne til å feilrette sammensatt SQL-kode, noe som har direkte implikasjoner for dataarkitektur i bedrifter.
Til tross for at store språkmodeller (LLM-er) har vist fremgang innen koding, er deres evne til å feilrette SQL-kode i komplekse bedriftsmiljøer fortsatt utilstrekkelig. Dette fremgår av en studie som introduserer 'OurBench', et nytt referansepunkt for å evaluere LLM-ers ferdigheter i SQL-feilretting og resonnement. Studien understreker at selv erfarne databaseutviklere og avanserte tekst-til-SQL-modeller ofte krever flere iterasjoner for å produsere korrekt SQL-kode.
OurBench er unikt utformet for å speile utfordringene i produksjonsmiljøer. Det benytter en automatisert metode for å systematisk injisere realistiske feil i omfattende SQL-kode, noe som sikrer et mangfoldig og skalerbart datasett. Evalueringen er dessuten eksekveringsfri, noe som betyr at den er raskere og mer ressurseffektiv. Referansepunktet består av 469 syntaksfeil (OurBenchSyn) og 516 semantiske feil (OurBenchSem), der sistnevnte handler om kode som ikke møter brukerens intensjon. Koden som testes er meget kompleks, med et gjennomsnitt på over 140 linjer per forespørsel.
Resultatene fra testing av nesten 30 ulike LLM-er avslører betydelige svakheter. Selv den best presterende modellen, Claude-4-Sonnet, oppnådde kun 36.46 prosent nøyaktighet på OurBenchSyn og 32.17 prosent på OurBenchSem. De fleste andre modeller havnet under 20 prosent. Dette indikerer et betydelig gap mellom dagens LLM-kapasitet og kravene til effektiv SQL-feilretting i bedriftsapplikasjoner. Forskningen peker på behovet for videre utvikling og nye strategier for at LLM-er skal kunne spille en mer sentral rolle i feilretting av SQL-kode.