Sikkerhet30. juli 2026

Ny metode avdekker sikkerhetshull i autonome agenter

Forskere har utviklet et testrammeverk som identifiserer alvorlige sikkerhetsrisikoer i autonome agenter med dype systemprivilegier, noe som kan forbedre robustheten til fremtidige AI-systemer.

Nye får stadig mer utvidede systemrettigheter for å utføre komplekse oppgaver, noe som innebærer potensielle, uadresserbare sikkerhetsfarer. Eksisterende metoder for sikkerhetstesting av store språkmodeller () fokuserer for det meste på og responsvurderinger. De mangler ofte automatisering, grundig dekning og virkelige vurderinger av agentens handlinger. Forskere har nå lansert ASEval, et automatisk rammeverk for sikkerhetstesting av autonome agenter. ASEval genererer realistiske, harmløse flertrinns-samtaler og forrykker disse for å skape risikofylte testscenarioer. Disse scenarioene utføres deretter mot den aktuelle agenten. En handlingsbasert kontrollfunksjon vurderer hele transaksjonskjeden, noe som skiller seg fra tidligere metoder som ofte kun vurderer enkeltoppgaver eller prompter. ASEval er benyttet til å konstruere A3S-Bench, en testpakke med 2 254 utførbare flertrinnstester som dekker mange bruksområder, leveringsmønstre og agent-nivå sikkerhetsrisikoer. Omfattende testing av elleve OpenClaw-agenter, som støttes av LLM, viser at ASEval effektivt avdekker utbredte sikkerhetsbrister. De nye forstyrrelsesoperatørene økte gjennomsnittlig utløsningsrate for risiko fra 22,9 prosent (med eksisterende injeksjonsteknikker) til 47,4 prosent. Dette ble vurdert av en handlingsbasert kontrollfunksjon som samsvarte med menneskelig annotering med 93,2 prosent nøyaktighet. Analyser og case-studier indikerer at disse svakhetene skyldes flere faktorer, som interaksjoner over tid, vedvarende tilstand og verktøy-medierte handlinger, som responsnivå-evalueringer ofte overser. Resultatene understreker viktigheten av å teste agenter på et dypere, handlingsorientert nivå for å identifisere og redusere sikkerhetsrisikoer før de tas i bruk i systemer med omfattende privilegier.