Optimal kombinasjon av AI-modeller for kodegjennomgang
Av AIWatch
Forskning viser hvordan AI-modeller best samarbeider om programvareutvikling, med spesifikk anbefaling for hvilken modell som bør utføre kodegjennomgang.
Utviklere tar i økende grad i bruk flere AI-modeller i kodeprosessen, der én modell genererer kodeutkast og en annen vurderer det. En fersk studie undersøker verdien av slike kombinasjoner og rekkefølgen for samarbeidet mellom modellene. Forskerne gjennomførte et kontrollert eksperiment med modellene Claude og Codex på 116 programmeringsoppgaver av ulik vanskelighetsgrad. Studieoppsettet simulerte en programvareutviklers arbeidsflyt, og inkluderte tester med modeller som opererte uavhengig, samt tester med modeller som gjennomgikk hverandres kode eller egen kode. Resultatene indikerer en asymmetrisk fordel ved bruk av AI-kombinasjoner. Når Claude gjennomgikk kodeutkast fra Codex, økte suksessraten for løsningene fra 71,6 % til 89,7 %. Codex’ selvgjennomgang av egne utkast forbedret suksessraten til 84,5 %. Den motsatte kombinasjonen ga imidlertid negativ effekt. Når Codex gjennomgikk Claudes utkast, sank suksessraten fra 91,4 % til 82,8 %. Claudes selvgjennomgang ga ingen endring i utgangspunktet på 91,4 %. Funnene viser at det er mest effektivt å la Claude vurdere kode generert av Codex, fremfor å snu rekkefølgen. Dette gir innsikt i hvordan AI-verktøy kan anvendes optimalt for å forbedre kvaliteten i programvareutvikling.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert
Arbeidsliv26. sep.
Kundeservice-AI feiler uten god forberedelse: Én uke kan spare store kostnader
Arbeidsliv25. sep.
RSNA starter AI-sertifisering for bildediagnostikk
Arbeidsliv25. sep.
Helse-AI gasser på mens tech-giganter vurderer bremsen
Arbeidsliv25. sep.
Ansatte frykter AI endrer jobben – ikke bare teknologien