Sikkerhet19. august 2026

Nytt system stopper AI fra skadelige sideeffekter

Av AIWatch

En koding-hengelås i messing som hviler på et hvitt tastatur ved siden av to gylne kredittkort.
Kategoribilde Foto: Towfiqu barbhuiya, Unsplash

Agentbasert AI kan utføre handlinger i den virkelige verden. Et nytt system viser hvordan teknologien kan hindres i å gjøre skade ved å fange opp farlige forslag før de blir handling.

Nye AI-systemer med "agent-evner" kan modifisere filer, sende meldinger og endre arbeidsflyt, noe som flytter sikkerhetsproblemet fra dårlig tekst til skadelige operasjonelle sideeffekter. Konvensjonell styring, som å justere ledetekster, skaper ingen sikkerhetsgrense for utførelse. Forskere har utviklet Aegis, et som behandler AI-ens utdata som handlingsforslag. Systemet medierer disse via et betrodd beslutningslag før verktøyene aktiveres. Aegis vurderer forslag mot aktive retningslinjer, bekrefter opprinnelse, og avviser usikre forslag. I tillegg sendes komplekse tilfeller til en "Senate-lignende" godkjenningsprosess som krever flertall. Testing i et simulert miljø med over 6300 rader viste at Aegis forhindret 79 risikable forslag fra å bli utført. Systemet registrerte ingen skadelige sideeffekter i de 2100 tilfellene det overvåket. Resultatene understreker at systemet kan forhindre observerte risikable forslag fra å bli sideeffekter i testmiljøet, men beviser ikke generell autonom agent-sikkerhet.

Kilder til denne saken: arXiv cs.AI ↗

AI: Research, språk og faktasjekk.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no