Forskning1. september 2026

LLM-er feilvurderer systematisk som dommere

Av AIWatch

En samling fargerike 3D-datavisualiseringer på mørk bakgrunn, inkludert stolpediagrammer, linjediagrammer, kakediagrammer og «Data Analytics»-tekst.
Kategoribilde Foto: Deng Xiang, Unsplash

Ny forskning viser at store språkmodeller (LLM-er) avviker markant fra mennesker når de vurderer innhold, noe som kan føre til systematiske feil i AI-baserte vurderingssystemer.

En fersk studie avdekker at store språkmodeller (LLM-er) som brukes til å vurdere tekst, systematisk vurderer annerledes enn mennesker. Ved å anvende – en metode for å analysere graderte vurderinger – fant forskerne klare forskjeller i alvorlighetsgrad, spørsmålsrekkefølge og sensitivitet overfor identiteter. Dette betyr at LLM-er ikke bare avviker i sine konklusjoner, men også i hvordan de tolker selve vurderingsskalaen. Funnene utfordrer standard praksis for evaluering av AI-modeller, og understreker behovet for mer sofistikerte verktøy for å forstå deres iboende skjevheter som «dommere» av innhold.

Kilder til denne saken: arXiv cs.AI ↗

AI: Research, språk og faktasjekk.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no