Forskning1. august 2026

LLM-er feiler når de simulerer menneskelige svar

Av redaksjonen

Ny forskning viser at store språkmodeller (LLM-er) systematisk feiler i å representere menneskelige holdninger, selv de mest avanserte.

Nye funn avslører at LLM-er, brukt som for å simulere menneskelige undersøkelsessvar, ikke klarer å gjenskape reelle holdninger. Dette er kritisk for beslutninger innen produktutvikling, politikk og marked, hvor slike data ofte benyttes som grunnlag. Selv de største og mest kapable modellene feiler på viktige punkter. Forskere testet fire LLM-er mot to uavhengige sett med ekte menneskelige data: generelle sosiale holdninger i USA og tverrkulturelle verdier. Modellene, som spenner fra 8 milliarder til de mest avanserte parametrene, ble benchmarked mot tradisjonelle, ikke-LLM . Resultatene viste to konsekvente svakheter på tvers av alle modeller og datasett. For det første presterte ingen LLM bedre enn de etablerte baselinene når det kom til individuelle svar. På tverrkulturelle verdier lå alle modellene langt under forventet nivå. For det andre overvurderer LLM-ene systematisk demografiske faktorer, og tillegger identitet langt større betydning for holdninger enn det som observeres hos ekte mennesker. Dette forvrenger resultatene og kan føre til feilaktige beslutninger, for eksempel ved segmentering i markedsføring, der modellene blåser opp forskjeller mellom segmenter to til fire ganger.