Forskning30. juli 2026

Hvordan språkmodeller uttrykker egen usikkerhet

Ny forskning utforsker grunnlaget for språkmodellers selvsikkerhet, et nøkkelelement for pålitelig bruk av AI. Dette bidrar til økt forståelse for hvorfor modeller vurderer egne svar som korrekte.

Evnen til å vurdere egen usikkerhet er avgjørende for tilliten til store språkmodeller i praksis. Tidligere analyser har primært vurdert hvor godt modellens selvtillit samsvarer med korrekte svar, men har i mindre grad utforsket hva selve selvtillitssignalet fundamentalt representerer. Forskere har nå undersøkt om svarenes logit-verdier – tall som reflekterer modellens interne preferanser for ulike svar – representerer en latent beslutningsvariabel, en slags indre "overbevisning" om svarets riktighet. Alternativt kan de være et heuristisk preferansesignal, som kombinerer informasjon på en ikke-Bayesiansk måte, altså uten en strengt logisk sannsynlighetsbasert kalkyle. Studien benyttet et rammeverk fra beregningsnevrovitenskap, kalt statistisk beslutningssikkerhet (SDC), for å analysere logit-differansen mellom det antatte korrekte og det nest beste svaret. Resultatene viste at i oppgaver som omfattet perseptuell diskriminering og hukommelsesbaserte beslutninger, oppførte logit-differansene seg som en monoton avlesning av en latent beslutningsvariabel. Dette indikerer at modellene i disse scenariene uttrykker en genuin grad av selvsikkerhet, snarere enn bare en heuristisk preferanse. Dette mønsteret ble observert på tvers av ulike modeller, inkludert multimodal-modeller uten resonneringsevne og én resonneringsmodell. I mer komplekse visuelle resonneringsoppgaver forutså logit-differansen fremdeles korrekthet utover objektiv oppgavevanskelighet. Imidlertid manglet de fullstendige geometriske signaturene fra SDC-rammeverket her, noe som peker på begrensninger når det mangler eksplisitte normative prosessmodeller for en given oppgave. Funnene gir en dypere forståelse av hvordan språkmodeller danner og uttrykker sin 'selvtillit', og etablerer SDC som et felles rammeverk for å studere dette fenomenet i både biologisk og kunstig intelligens.