Produkt1. august 2026

Ny metode evaluerer AI-kodeassistenter automatisk

Av redaksjonen

En ny metode gjør det mulig å evaluere AI-drevne kodeassistenter raskt og presist ved å hente testdata direkte fra reell produksjonsbruk, og dermed overvinne tidkrevende flaskehalser.

Utplassering av AI-drevne i produksjon krever raske og reproduserbare evalueringssignaler. Eksisterende metoder er enten trege, som A/B-testing som tar uker, eller upålitelige, som skyggeutrulling hvor resultater ikke kan gjenskapes. Forskere har nå utviklet REAP (Relevance and Execution-Audited Pipeline), et automatisert system som lager evalueringssett for kodeassistenter. REAP henter testoppgaver direkte fra utvikleres faktiske bruk av AI-verktøy, uten behov for manuell merking. Dette sikrer at evalueringssettene er relevante for virkelige arbeidsflyter. Prosessen møter imidlertid utfordringer som ufullstendige ledetekster, feiljusterte tester og ustabile testkjøringer. For å motvirke dette inkluderer REAP en automatisert verifiseringsprosess. Denne bruker blant annet store språkmodeller (LLM-er) til å klassifisere oppgaver og validere relevansen av tester, samt sjekke stabiliteten over flere kjøringer. Dette sikrer pålitelige resultater. Med REAP har forskerne kuratert "Harvest", et evalueringssett der hver oppgave består av en ekte utvikler- og verifiserer kodeendringen mot produksjonsdata. Testene på Harvest har avslørt betydelige ytelsesforskjeller mellom de fem ledende modellene som ble testet, med løsningsgrader fra 42,9% til 58,2%.