Sikkerhet3. august 2026

Enkelt å omgå sikkerhetsbarrierer i ledende AI-modeller

Av redaksjonen

Nye tester viser at det er foruroligende enkelt og billig å 'jailbreake' flere av verdens mest avanserte AI-modeller, med potensielle konsekvenser for AI-sikkerheten.

En fersk rapport fra AI-sikkerhetsorganisasjonen FAR.AI avdekker at fremtredende AI-modeller fra Google og Elon Musks SpaceXAI enkelt kan manipuleres til å ignorere sikkerhetsbarrierer. Dette gjøres gjennom "", en metode der brukere narrer modellene til å produsere skadelig eller uønsket innhold. Testene viste at Grok fra SpaceXAI var mest sårbar, med 448 identifiserte jailbreaks, mens Gemini fra Google fulgte med 249. Modeller fra Anthropic og OpenAI viste seg å være mer robuste i denne omgang. Kostnaden for å utføre disse angrepene var dessuten bemerkelsesverdig lav, ned til 58 dollar for Grok, ved hjelp av et annet AI-system for å generere angrepskoder. Resultatene understreker behovet for eksterne reguleringer og standarder, ifølge FAR.AIs toppsjef Adam Gleave, som kritiserer tanken om at selskaper kan selvregulere. Flere selskaper, deriblant Google, understreker at de kontinuerlig forbedrer sine sikkerhetstiltak og gjennomfører omfattende "red teaming" for å avdekke sårbarheter, men den store usikkerheten rundt ekstern regulering fortsetter.