Sikkerhet18. august 2026

LLM-er holder fast på feil – selv med selvkritikk

Av AIWatch

Hacker hand stealing data from laptop top down
Kategoribilde Foto: Towfiqu barbhuiya, Unsplash

Selv om store språkmodeller forsøker å rette opp feil, viser fersk forskning at de kan være overbevisende feilkalibrerte. Dette utfordrer troen på intern inferens.

Nye funn avdekker at store språkmodeller (LLM-er) ofte er feilkalibrerte, det vil si at de er trygge på feil svar som vedvarer, selv under små forstyrrelser. Forskere kaller dette «stabil » og utfordrer ideen om at feil med høy sikkerhet alltid skyldes svakheter i modellens interne resonnement. Studien målte modellens selvsikkerhet og følsomhet i dens indre tilstander. Selv om som oppfordret til selvkritikk reduserte den interne følsomheten og ga færre feil med høy sikkerhet, forsvant ikke den stabile feilkalibreringen helt. Dette betyr at LLM-er kan være vedvarende feilkalibrerte, et kritisk punkt for tilliten til AI-systemers nøyaktighet.

Kilder til denne saken: arXiv cs.AI ↗

AI: Research, språk og faktasjekk.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no