Sikkerhet1. august 2026
LLM-er fundamentalt sårbare for angrep, hevder forskere
Av redaksjonen
Store språkmodeller (LLM-er) kan ha en grunnleggende feil som gjør dem umulige å sikre fullt ut mot angrep, med store konsekvenser for AI-sikkerhet i kritiske systemer.
En ny studie presentert ved International Conference on Machine Learning (ICML) viser at store språkmodeller (LLM-er) er svært sårbare for å manipuleres til å utføre uønskede handlinger. Årsaken er en fundamental svakhet i hvordan modellene identifiserer kilden til instruksjoner.
Forskere demonstrerte hvordan man kan få populære LLM-er til å gi ut informasjon de er trent til å unngå, som oppskrifter på narkotika eller sabotasjeinstruksjoner. Ifølge medforfatter Charles Ye, er problemet potensielt uløselig, og kan ha store implikasjoner for sikkerheten til AI-systemer i alt fra helsevesen til militæret.
Svakheten ligger i at LLM-er tolker tekstens stil og innhold, snarere enn de metadataene () som skal skille mellom brukerinput, systeminstruksjoner og modellens egen tankeprosess. Angripere kan dermed forfalske en «kjede av tanker» () – modellens interne notater – for å omgå sikkerhetsmekanismer. For eksempel kan en falsk notis som legitimerer ulovlige instruksjoner føre til at modellen handler mot sin hensikt.
Selv om AI-utviklere bruker avansert og spesielle «super-hackere» som GPT-Red for å finne sårbarheter, er denne tilnærmingen utilstrekkelig. Modellen lærer å motstå kjente angrep, men listen over ting den ikke skal gjøre er aldri komplett. Forskerne fremhever at modellens manglende evne til å skille mellom ulike "roller" i tekststrømmen er en dyp arkitektonisk feil. De fant at å bytte rundt på rollenes tags knapt påvirket hvordan LLM-en tolket teksten, noe som indikerer at den hovedsakelig baserer seg på tekstens utseende og ordvalg.
Konsekvensen er at angripere bare trenger å forfalske tekststilen til en bestemt rolle for å hacke en LLM. Eksperter, som Florian Tramèr ved ETH Zürich, bekrefter at angrepsmetoden er elegant og gir viktige innsikter. Selv om nye modeller er vanskeligere å manipulere, er det fortsatt usikkert om dette er tilstrekkelig for sensitive applikasjoner. Forskernes råd er derfor å behandle LLM-er med skepsis og forvente at de kan være usikre, særlig i kritiske systemer.