Sikkerhet30. juli 2026

Ny test for AI-agenter måler beredskap etter datainnbrudd

Forskere har utviklet en ny test for AI-agenter for cybersikkerhet, som avdekker betydelige svakheter i agentenes evne til å håndtere hendelser etter et datainnbrudd.

En ny referanseindeks kalt SecRespond evaluerer store språkmodeller (LLM) i situasjoner etter at et system er kompromittert. Dagens testmetoder konsentrerer seg primært om scenarier før et angrep, noe som har etterlatt et hull i testingen av AI-agenter for hendelseshåndtering. SecRespond utfordrer AI-agenter til å analysere et digitalt avtrykk fra et kompromittert system, sammen med alarmer, sårbarhetsskanninger og grunnleggende systemkontroller. Agentenes oppgave er å produsere etterforskningsrapporter om inntrengninger, risikoer og svakheter, samt utarbeide en plan for utbedring. Referanseindeksen er konstruert rundt ti forskjellige simulerte cybermiljøer, hver basert på en reell kompromittert skybasert vert. Disse dekker fire typer inngangspunkter, 21 MITRE ATT&CK-teknikker og fem operativsystemer. Tjuefem av dagens ledende LLM-er ble testet i dette rammeverket. Resultatene viser at selv om AI-agentene er i stand til å identifisere problemer som er varslet, sliter de med å proaktivt søke gjennom disken for skjulte inntrengninger. De har også vanskeligheter med å utarbeide omfattende og verifiserbare utbedringsplaner. Ingen av modellene klarte å oppnå fullstendig deteksjon og utbedring i noen av de testede miljøene. Dette peker på en grunnleggende utfordring i utviklingen av AI-agenter for praktisk hendelseshåndtering.