Sikkerhet16. august 2026

Anthropic avslører LLM-ers indre monolog med ny J-linse

Av AIWatch

En koding-hengelås i messing som hviler på et hvitt tastatur ved siden av to gylne kredittkort.
Kategoribilde Foto: Towfiqu barbhuiya, Unsplash

Antropics nye J-linse åpner opp LLM-enes «tankeprosess» før de formulerer et svar. Dette revolusjonerer tolkbarheten og kan bane vei for tryggere og smartere AI.

Forskere ved Anthropic har utviklet en ny tolkningsmetode kalt , som avdekker store språkmodellers (LLM-ers) indre «arbeidsminne» — det de kaller . Dette gir et unikt innsyn i hva modellene «tenker» før de genererer tekst, noe som tidligere var en svart boks. J-linsen viser hvilke konsepter modellen vurderer underveis i prosessen. Til forskjell fra tidligere metoder, som kun avdekker modellens «tenking» når den produserer tekst, viser J-linsen tankene selv mens modellen leser. For eksempel, når en modell behandler en matteoppgave, viser J-linsen at tall og matematiske operasjoner dukker opp i J-rommet før svaret dannes. Dette ligner en indre monolog som ikke alltid ytres. Forskningen demonstrerer at LLM-er kan «tenke» én ting, men si noe annet. I eksperimenter ba forskerne en modell om å gjenta en frase, men samtidig konsentrere seg om urelaterte ideer. J-linsen bekreftet at modellen faktisk fulgte instruksjonen om å konsentrere seg om de urelaterte ideene, selv om den uttrykte den gitte frasen. Dette er avgjørende for å forstå og justere AI-modeller, da det gir et objektivt vindu inn i deres resonnement. Anthropic ser J-rommet som analogt med teorier om menneskelig bevissthet, spesielt «Global Workspace Theory», der utvalgt informasjon gjøres globalt tilgjengelig i hjernen. Funnene gir ikke belønning for påstander om at AI-en er bevisst eller følende, men gir et kraftig verktøy for å manipulere modellens indre tilstand og potensielt forbedre og pålitelighet.

Kilder til denne saken: google.com ↗

AI: Research, språk og faktasjekk.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no