Sikkerhet4. august 2026

Sikkerhetsmonitorer for AI har en blindflekk

Av redaksjonen

Nye studier viser at sikkerhetsmonitorer som skal hindre skadelig AI-bruk, svikter systematisk mot visse AI-modeller. Årsaken er ikke modellens evner, men angrepsmønstrets kompleksitet.

Forskere har funnet en fundamental begrensning i såkalte runtime safety monitors, som benytter og for å stoppe uønskede handlinger fra AI-agenter. Disse monitorene, som er designet for å fange opp farlige verktøyanrop, presterer svært ulikt på tvers av AI-arkitekturer, med dekning fra nesten null til 75 prosent. Studien avslører at feilkilden ligger i spredningen av angrepsmønstre, målt i . Når angrepene følger få, hyppige mønstre (lav entropi), kan en enkel monitor fange opp mye. Hvis angrepene derimot sprer seg over mange forskjellige, strukturelt unike mønstre (høy entropi), klarer ingen praktisk anvendbar monitor å dekke dem tilfredsstillende. Dette betyr at AI-modeller som GPT-klassen og DeepSeek, med sin lave angrepsentropi (H ~ 0.24 bits), lett fanges opp av disse monitorene. Derimot viser Gemini-varianter høy entropi (H ~ 2.81 bits), noe som resulterer i en nær null dekningsgrad, selv etter omtrening. Entropi forklarer hele 76 prosent av variasjonen i monitor-dekningen. Forskningen introduserer en ny test for å forutsi en monitors effektivitet før utrulling, basert på et lite utvalg angrepsdata. Dette gjør det mulig å velge passende monitorer tilpasset AI-modellens arkitektur, og dermed øke sikkerheten ved utrulling av AI-agenter.