Nytt system stopper AI fra skadelige sideeffekter
Av AIWatch
Agentbasert AI kan utføre handlinger i den virkelige verden. Et nytt system viser hvordan teknologien kan hindres i å gjøre skade ved å fange opp farlige forslag før de blir handling.
Nye AI-systemer med "agent-evner" kan modifisere filer, sende meldinger og endre arbeidsflyt, noe som flytter sikkerhetsproblemet fra dårlig tekst til skadelige operasjonelle sideeffekter. Konvensjonell styring, som å justere ledetekster, skaper ingen sikkerhetsgrense for utførelse. Forskere har utviklet Aegis, et som behandler AI-ens utdata som handlingsforslag. Systemet medierer disse via et betrodd beslutningslag før verktøyene aktiveres. Aegis vurderer forslag mot aktive retningslinjer, bekrefter opprinnelse, og avviser usikre forslag. I tillegg sendes komplekse tilfeller til en "Senate-lignende" godkjenningsprosess som krever flertall. Testing i et simulert miljø med over 6300 rader viste at Aegis forhindret 79 risikable forslag fra å bli utført. Systemet registrerte ingen skadelige sideeffekter i de 2100 tilfellene det overvåket. Resultatene understreker at systemet kan forhindre observerte risikable forslag fra å bli sideeffekter i testmiljøet, men beviser ikke generell autonom agent-sikkerhet.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert