LLM-er holder fast på feil – selv med selvkritikk
Av AIWatch
Selv om store språkmodeller forsøker å rette opp feil, viser fersk forskning at de kan være overbevisende feilkalibrerte. Dette utfordrer troen på intern inferens.
Nye funn avdekker at store språkmodeller (LLM-er) ofte er feilkalibrerte, det vil si at de er trygge på feil svar som vedvarer, selv under små forstyrrelser. Forskere kaller dette «stabil » og utfordrer ideen om at feil med høy sikkerhet alltid skyldes svakheter i modellens interne resonnement. Studien målte modellens selvsikkerhet og følsomhet i dens indre tilstander. Selv om som oppfordret til selvkritikk reduserte den interne følsomheten og ga færre feil med høy sikkerhet, forsvant ikke den stabile feilkalibreringen helt. Dette betyr at LLM-er kan være vedvarende feilkalibrerte, et kritisk punkt for tilliten til AI-systemers nøyaktighet.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert