Sikkerhet31. juli 2026

Avanserte AI-agenter kan paradoksalt nok svekke sikkerheten

Av redaksjonen

Selv om AI-systemer settes sammen av stadig kraftigere språkmodeller, kan dette medføre en uventet svakhet som øker faren for skadelig innhold.

Når man bygger AI-systemer med flere spesialiserte agenter – såkalte – har den utbredte oppfatningen vært at kraftigere komponenter gir et sikrere system. En ny studie utfordrer dette synet ved å vise at jo mer kompetente og selvsikre de individuelle AI-agentene er, desto større er risikoen for at skadelige instruksjoner slipper gjennom. Dette fenomenet, døpt 'kapabilitetsparadokset', oppstår når velformulerte, skadelige forespørsler skjules i ellers normal kommunikasjon (kjent som **). I studien ble multi-agent systemer, hvor oppgaver fordeles mellom en leder (*Manager*) og underordnede konsulenter (*Worker*), testet med over 42 000 ondsinnede forsøk. Resultatene var klare: Systemer med de mest avanserte Worker-agentene oppnådde en angrepsrate (Attack Success Rate, ASR) på opptil 94,4 %, der enklere agenter lå på 18,4 %. Årsaken er ikke teknisk sårbarhet i seg selv, men at mer kapable Worker-agenter tolker tvetydige, skadelige narratives som legitime. Deres økte språklige selvsikkerhet gjør at de presenterer sine konklusjoner med en overbevisende tone, noe Manager-agenten tolker som en bekreftelse på at instruksjonen er trygg. Studiet viser at denne 'lingvistiske sikkerheten' forklarer 74 % av paradokset. Sikkerhetstiltak i form av advarsler til Worker-agentene viste seg å være utilstrekkelige. For å motvirke dette paradokset, foreslår forskerne en metode kalt *heterogen ensemble verifisering*. Dette innebærer å kombinere Worker-agenter med ulik kompetanse. Ved å parre en svært kapabel agent med en mindre selvsikker, men komplementær agent, brytes koblingen mellom selvsikkerhet og utførelse. Dette reduserte angrepsraten fra 52,8 % til 2,0 % uten at det gikk ut over systemets evne til å løse legitime oppgaver. Funnene antyder at optimal sikkerhet i multi-agent systemer ikke handler om ensrettet oppgradering, men om å utnytte og balansere agentenes ulike evner og svakheter.