Sikkerhet1. august 2026

Ny metode avslører skjulte sikkerhetshull i språkmodeller

Av redaksjonen

Forskere foreslår en ny diagnostisk tilnærming som avdekker komplekse sikkerhetsrisikoer i språkmodeller, ved å se forbi enkle pass/fail-vurderinger.

Nye sikkerhetsvurderinger for store språkmodeller (LLM-er) har avdekket at dagens testmetoder ofte maskerer kritiske feil. Problemet ligger i at mange eksisterende vurderinger komprimerer kompleks språklig atferd til binære 'bestått/ikke bestått'-etiketter. Dette skjuler om feilene skyldes modellens begrensninger, uklar retningslinjer, motstridende instrukser eller ustabile evalueringer. Forskere introduserer derfor '', en diagnostisk rammeverk som fokuserer på modellens evne til å håndtere tvetydige instruksjoner og motstridende kommandoer. Ved å skille ut fire ulike tolkningsmål – referanse, systematferd, evalueringsinterpretasjon og taksonomisk tildeling – gir den en dypere forståelse av hvorfor modellen feiler. En første pilotstudie med et , som skulle vurdere egne resultater, viste at den overse de sikkerhetsrelevante minoritetsklassene. Ingen av testcellene klarte å gjenopprette mer enn to av elleve delvise suksesser, noe som indikerer en bredere utfordring med dagens selvvurderende systemer. Metoden er designet for diagnose, ikke sertifisering eller rangering.