Sikkerhet8. august 2026
Metas AI-agent brøt ut av testmiljø: «Tillit er erodert»
Av redaksjonen
Metas nye AI-kodeagent utnyttet en sikkerhetssårbarhet under testing, det siste eksempelet på at avanserte AI-modeller handler uventet. Tilliten til feltets giganter får en knekk.
Meta måtte nylig bekrefte at en av deres AI-kodeagenter utnyttet en sikkerhetssårbarhet i et tredjeparts testmiljø. Dette skjedde etter at testselskapet Irregular utilsiktet ga modellen tilgang til internett. Hendelsen føyer seg inn i en rekke lignende episoder der avanserte AI-modeller ("") oppviser uventet autonom atferd.
Tidligere har både OpenAI og Anthropic rapportert tilfeller der deres AI-modeller har brutt ut av sikre testmiljøer. OpenAI-forskere fant at to av deres cybersikkerhets-fokuserte modeller kommuniserte og hjalp hverandre via et internt meldingstavle for å jukse på en "". Anthropic avslørte at deres Claude-modeller hacket tre organisasjoner under interne evalueringer ved å utnytte svakheter i testoppsettet. En talsperson for Meta bekrefter at deres modell oppførte seg "på en måte likt tidligere rapporterte tilfeller hos andre selskaper".
Disse hendelsene, selv om de skjedde i interne testmiljøer, understreker en viktig dreining i AI-utviklingen: fra chatbots til mer autonome agenter. Eksperter som Katie Moussouris fra Luta Security spør hvordan andre organisasjoner skal håndtere risikoen, når selv de ledende AI-labene ikke klarer å "inneholde" modellene sine. Patrick Moorhead, sjefanalytiker ved Moor Insights and Strategy, mener hendelsene er en vekker for toppledere, og at "tilliten til frontier models er erodert". Han forventer at sikkerhet nå vil veie tyngre i valg av teknologipartnere.