LLM-er feilvurderer systematisk som dommere
Av AIWatch
Ny forskning viser at store språkmodeller (LLM-er) avviker markant fra mennesker når de vurderer innhold, noe som kan føre til systematiske feil i AI-baserte vurderingssystemer.
En fersk studie avdekker at store språkmodeller (LLM-er) som brukes til å vurdere tekst, systematisk vurderer annerledes enn mennesker. Ved å anvende – en metode for å analysere graderte vurderinger – fant forskerne klare forskjeller i alvorlighetsgrad, spørsmålsrekkefølge og sensitivitet overfor identiteter. Dette betyr at LLM-er ikke bare avviker i sine konklusjoner, men også i hvordan de tolker selve vurderingsskalaen. Funnene utfordrer standard praksis for evaluering av AI-modeller, og understreker behovet for mer sofistikerte verktøy for å forstå deres iboende skjevheter som «dommere» av innhold.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert