Sikkerhet1. august 2026

GPT-Red oppdager nye angrep mot store språkmodeller

Av redaksjonen

Et nytt automatisert «red teaming»-verktøy finner sårbarheter i AI-systemer raskere enn mennesker, og forbedrer sikkerheten betydelig.

Forskere har utviklet GPT-Red, et AI-system som systematisk leter etter sårbarheter, såkalte -angrep, i store språkmodeller (LLM-er). Verktøyet ble brukt til å trene GPT-5.6, en språkmodell, for å gjøre den mer robust mot slike angrep. Dette har ført til den mest motstandsdyktige modellen mot prompt injection-angrep til dags dato. GPT-Red benytter en selvlærende algoritme der det angriper en rekke "forsvarsagenter" som trenes samtidig. Dette er den største satsingen på LLM-sikkerhetstrening som er dokumentert, med et datakraftforbruk på linje med de største -kjøringene. Systemet overgår menneskelige red teamers i å finne vellykkede angrep. Evnen til å generalisere til nye miljøer og modeller er en styrke ved GPT-Red. Utviklerne forventer at dette vil skape en selvforsterkende syklus: jo mer robuste GPT-modellene blir, desto bedre treningssignal vil de gi tilbake til -agentene, noe som driver kontinuerlig forbedring av AI-sikkerheten.