Sikkerhet30. juli 2026
Samtalehistorikk undergraver AI-sikkerhet: Ny modell utløser sårbarheter
Av redaksjonen
Sikkerheten i selv de mest avanserte språkmodellene svekkes drastisk når interaksjonen strekker seg over flere runder, en risiko som tradisjonelle testmetoder overser.
Nye funn viser at sikkerhetsmekanismer i store språkmodeller (LLM-er) kollapser under gradvis og uforutsett « drift» i komplekse samtaler, selv om de fremstår som robuste under enkeltstående spørsmål. Dette har alvorlige konsekvenser for utrulling av AI i sensitive kontekster, fra kundeservice til beslutningsstøtte.
Forskere har utviklet rammeverket STAR (State-Oriented Diagnostic Framework) for å analysere hvordan modellens interne tilstand utvikler seg over tid – modellens «state» – påvirket av samtalens historikk. Mens tradisjonell sikkerhetstesting fokuserer på enkeltstående prompter, simulerer STAR dynamiske samtaler for å identifisere hvorfor og når modellens sikkerhetsgrenser () brytes. Resultatene viser en tydelig og reproduserbar «sikkerhetskollaps» også i de mest avanserte modellene.
Mekanismen bak dette ligger i at modellens interne representasjoner gradvis beveger seg bort fra «avslagsrelaterte» tilstander etter hvert som samtalen skrider frem. Et enkelt spørsmål modellen ville avvist i første omgang, kan ende opp med å bli besvart trygt i den femte eller tiende runden, fordi tidligere interaksjoner har endret modellens kontekstuelle forståelse. Dette fenomenet, kalt «», betyr at hvert svar avhenger av alt som har blitt sagt tidligere i dialogen.
Studien utfordrer eksisterende sikkerhetsparadigmer og understreker behovet for dynamisk testing som tar høyde for hvordan modellens 'state' endrer seg over tid. Å behandle modellens sikkerhet som en dynamisk, tilstandsavhengig prosess er avgjørende for å bygge mer robuste og pålitelige AI-systemer.