Nytt rammeverk fanger 95% av skadelige AI-handlinger
Av AIWatch
Forskere har utviklet OpenAgentFlow, et kontrollsystem som gir felles sikkerhet for sammensatte AI-systemer. Dette kan løse utfordringer med systemomfattende styring når ulike AI-agenter samhandler.
Nye , drevet av store språkmodeller (LLM), beveger seg fra isolerte funksjoner til komplekse systemer der flere agenter, planleggere og verktøy opererer i delte miljøer. Dette skaper et behov for systemomfattende sikkerhet, der kontroll med utførte handlinger er avgjørende. Forskere har utviklet OpenAgentFlow, en arkitektur som etablerer et felles kontrollpunkt for godkjenning av handlinger. Alle handlinger, enten de kommer fra et grafisk brukergrensesnitt (GUI), et programmeringsgrensesnitt (API), et verktøy eller genereres av en LLM, normaliseres og sendes gjennom et felles punkt for før de utføres. Dette gir en samlet styring for ellers inkompatible utførere. OpenAgentFlow oppnådde 95,35% blokkeringsrate mot uønskede handlinger i kontrollerte tester, og en nøyaktighet på 97,62% i en offentlig . Det viktigste er at nye sikkerhetsregler kan tas i bruk uten å måtte endre kodegrunnlaget for hver enkelt AI-agent, ledetekst eller modell. Dette gjør systemet mer fleksibelt for å håndtere nye trusler.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert