Forskning31. juli 2026
Gjentatte AI-svar kan skjule et felles bias
Av redaksjonen
Forskning viser at enighet blant AI-modeller, eller at et enkelt språkmodell gjentar seg selv, ikke er en garanti for korrekte svar, men heller kan signalisere en felles skjevhet.
Når store språkmodeller (LLM-er) er uenig med seg selv, eller med andre modeller, er vi gjerne skeptiske til svaret. Men ny forskning problematiserer antakelsen om at konsistens – enten fra en enkelt modell eller et panel av modeller – er et pålitelig signal på korrekthet. Tvert imot kan en høy grad av enighet indikere en felles skjevhet eller en memorert heuristikk snarere enn sannhet, ifølge en fersk studie publisert på arXiv.
Forskere bak studien utførte en omfattende analyse med 53 "runners", altså konfigurasjoner av modeller og prompt-teknikker, som genererte totalt 265 000 svar. De undersøkte hvordan konsistens korrelerte med korrekthet på komplekse spørsmålssett som GPQA Diamond og AIME, som krever avansert resonnering og faktakunnskap. Resultatene viser at enighet er en positiv, men svak prediktor for korrekthet. Spesielt problematisk er det at de mest avanserte "frontier-modellene" – de kraftigste og mest nøyaktige språkmodellene – ofte utviser høy selvsikkerhet (hvor de konsekvent gir samme svar) selv når de tar feil. I noen tilfeller var 48 % av de konsistente svarene fra slike modeller feil.
Dette antyder at "" (at en modell gir det samme svaret gjentatte ganger) og "" (flere modeller gir samme svar) fungerer best som indikatorer for kvalitet i de mellomstore modellene. For toppledermodellene, som ofte skal håndtere kritiske oppgaver, kan høy enighet faktisk gi en falsk trygghet. For AI-utviklere og de som tar i bruk LLMer i produksjonssystemer, betyr dette at man ikke blindt kan stole på modeller som gjentar seg selv eller er enige med hverandre, som en garanti for korrekt informasjon. Det understreker behovet for smartere evalueringsmetoder som går utover ren konsistens.