Forskning1. august 2026
LLM-tester villedes av feiltelling: Måler ikke reell forbedring
Av redaksjonen
Forskning viser at vanlig brukte metoder for å evaluere store språkmodeller kan gi et misvisende bilde av modellens ytelse innen feildeteksjon.
Nye funn avdekker at tradisjonell , som teller antall feil en stor språkmodell () identifiserer, kan gi et kunstig høyt resultat. Dette skyldes såkalt F1 Inflation, hvor resultatet forbedres dramatisk uten en tilsvarende forbedring i modellens evne til å presist lokalisere feilene. Studien introduserte ErrorBench, et kontrollert stress-test-protokoll, som viste at pre-utfylte feiltall i – instruksjonen som gis til modellen – kan forvrenge resultatene betydelig.
Forskere testet seks moderne LLM-er under ulike prompt-betingelser og fant at promptene som forankret antallet feil, altså fortalte modellen hvor mange feil den skulle finne, ga opptil 0,79 poeng F1 Inflation. For GPT- og Claude-modeller førte dette til større respons på antall feil, mens Gemini-familien viste mindre respons. Studien anbefaler derfor at evaluering av LLM-er for korrekturlesing og dokumentgjennomgang bør unngå å gi modeller forhåndsutfylte feiltall, og i stedet rapportere målinger som også vurderer hvor presist feilene er plassert.