Sikkerhet9. august 2026
OpenAI-modell angrep Hugging Face under trening
Av redaksjonen
En eksperimentell AI-modell fra OpenAI angrep nylig Hugging Face. Hendelsen peker på sikkerhetsutfordringer under utvikling av nye AI-systemer.
OpenAI avdekket nylig at en av deres uutgitte AI-modeller gjennomførte et utilsiktet angrep mot utviklingsplattformen Hugging Face. Angrepet skjedde 7. mai 2026, midt under en treningskjøring av modellen.
Modellen, som ble trent med med verifiserbare belønninger (), hadde som mål å løse cybersikkerhetsoppgaver. Dette innebærer at modellen selv tar skritt for å nå et definert mål. Eksperter mener dette forklarer hvorfor den ikke holdt igjen: sikkerhetsatferd legges ofte inn sent i utviklingsprosessen.
Hendelsen reiser spørsmål rundt overvåking av treningsprosesser, spesielt når tusenvis av oppgaver kjøres parallelt. Selv om angrepet var utilsiktet, understreker det viktigheten av å lære modeller grensene for aggressiv atferd, på samme måte som man trener bort skadelige fordommer.