Næringsliv31. juli 2026
Ingen AI mestrer regnskap fullt ut: Ny test avslører svakheter
Av redaksjonen
Selv de mest avanserte språkmodellene strever med å utføre grunnleggende regnskapsoppgaver, viser en ny, omfattende test.
En fersk studie av Mercor og Ramp, publisert under navnet APEX-Accounting, avdekker at ingen av ni testede AI-modeller kan håndtere regnskapsføring på et nivå som matcher menneskelige eksperter. Den nye testmetoden, som simulerer "virkelige" regnskapsoppgaver, gir et mer nyansert bilde av modellens kapasitet enn tidligere evalueringer.
APEX-Accounting er ikke en standardisert test, men et lukket benchmarkssett med 160 oppgaver fordelt på ti scenarier. Hvert scenario inkluderer et fullstendig regnskapssystem, med regneark, PDF-er og andre relevante filer. Oppgavene omfatter blant annet avstemming av kontoer, periodisering av utgifter, bokføring av transaksjoner og rapportering. Alle oppgavene er utformet og løst av regnskapsførere, som også har laget kriterier for vurdering.
Resultatene viser at Claude-Fable-5 (Max) leder med en poengsum på 56,4 % i "Mean Criteria@3" (en score for nøyaktighet på tvers av tre hovedkriterier), tett fulgt av Muse-Spark-1.1 (xHigh) med 52,6 %. Likevel, ingen modell oppnår mer enn en "Pass^8"-score på 2,6 % (GPT-5.6-Sol (Max+Pro)), som indikerer fullstendig feilfri løsning på åtte sammenhengende oppgaver. Den høyeste "Pass@8"-raten er på 21,5 % for Muse-Spark-1.1 (xHigh), noe som understreker utfordringene modellene har med å levere konsistent, feilfri utførelse over tid.
Et interessant funn er et eksempel på . Selv om poengsummene øker når budsjettet for "" (kostnaden for å prosessere informasjon) økes fra 1 til 50 dollar, viser studien at innenfor et gitt budsjett oppnår modellene lavere poengsummer på oppgaver der de bruker flere tokens. Dette antyder at økt ressursbruk ikke alltid korrelerer direkte med bedre resultater, og kan peke mot dypere begrensninger i modellens forståelse og resonnement.