Sikkerhet1. august 2026
GPT-Red oppdager nye angrep mot store språkmodeller
Av redaksjonen
Et nytt automatisert «red teaming»-verktøy finner sårbarheter i AI-systemer raskere enn mennesker, og forbedrer sikkerheten betydelig.
Forskere har utviklet GPT-Red, et AI-system som systematisk leter etter sårbarheter, såkalte -angrep, i store språkmodeller (LLM-er). Verktøyet ble brukt til å trene GPT-5.6, en språkmodell, for å gjøre den mer robust mot slike angrep. Dette har ført til den mest motstandsdyktige modellen mot prompt injection-angrep til dags dato.
GPT-Red benytter en selvlærende algoritme der det angriper en rekke "forsvarsagenter" som trenes samtidig. Dette er den største satsingen på LLM-sikkerhetstrening som er dokumentert, med et datakraftforbruk på linje med de største -kjøringene. Systemet overgår menneskelige red teamers i å finne vellykkede angrep.
Evnen til å generalisere til nye miljøer og modeller er en styrke ved GPT-Red. Utviklerne forventer at dette vil skape en selvforsterkende syklus: jo mer robuste GPT-modellene blir, desto bedre treningssignal vil de gi tilbake til -agentene, noe som driver kontinuerlig forbedring av AI-sikkerheten.