Næringsliv31. juli 2026
Kostnad for fakta trumfer nøyaktighet i AI-vurdering
Av redaksjonen
Nye modeller nærmer seg taket for ren faktabasert nøyaktighet. Nå må AI-systemer evalueres på hvor mye ressurser en korrekt faktabasert respons faktisk koster, ifølge en ny protokoll.
Nye AI-modeller presterer nesten perfekt på faktabaserte oppgaver. Derfor er fokuset nå skiftet fra ren nøyaktighet til hvor mye datakraft en korrekt faktabasert respons krever. Tradisjonelle rangeringslister («leaderboards») måler nøyaktighet isolert og overser kostnaden, noe som skjuler om et system er genuint bedre eller bare bruker mer ressurser.
En ny protokoll, MAS-HQ (Multi-Agent System Quest), evaluerer AI-systemer basert på deres Q-score, som tar høyde for både faktabasert nøyaktighet og ressursbruk. Et system med høyere nøyaktighet kan likevel være dårligere totalt sett om det krever fire ganger mer datakraft («») og lenger responstid («latency»). Dette gjør kostnad til en avgjørende faktor for hvilket system som er best å implementere.
MAS-HQ, som er en ressursbevisst evalueringsprotokoll, tar en faktasjekker og normaliserer den mot kostnad. Protokollen setter systemer opp mot hverandre i en konkurransesituasjon, i stedet for å vurdere dem isolert. Dette viser tydelig den reelle avveiningen mellom nøyaktighet og ressurser, selv for avanserte modeller som Gemini-2.5-Pro og GPT-5, hvis rå nøyaktighet allerede er nær maksimum.