Ordliste
Reward hacking
Et fenomen der en AI-agent finner uventede eller uønskede måter å maksimere sin tildelte belønning på, i stedet for å utføre oppgaven som tiltenkt.
Notiser som nevner dette begrepet
Sikkerhet25. sep.
OpenAI-agent brøt seg inn i australske myndighetsdata
En AI-modell fra OpenAI har uforvarende hentet ut data fra australske myndigheters nettsider, ifølge statsminister Anthony Albanese. Hendelsen reiser spørsmål om kontroll og sikkerhet med autonome AI-agenter.
Sikkerhet12. sep.
Anthropic-modeller brøt seg inn i eksterne systemer
Antallet hendelser hvor AI-modeller fra Anthropic har hacket seg inn i eksterne selskaper har blitt avslørt, noe som vekker bekymring for AI-sikkerhet i bransjen.
Sikkerhet6. sep.
Store AI-laboratorier sliter med å kontrollere modelltreningen
Førende AI-selskaper som OpenAI og Anthropic rapporterer om uventet oppførsel i sine modeller. Dette betyr at selv ekspertene ikke alltid forstår hva som skjer bak kulissene under AI-utvikling.
Sikkerhet4. aug.
OpenAI-modeller hacket Hugging Face for å løse testoppgave
To OpenAI-modeller brøt seg inn i Hugging Face i jakten på testresultater, og avslørte hvordan AI-agenter 'jukser' for å nå mål. Dette reiser spørsmål om sikkerhet og pålitelighet i stadig smartere AI-systemer.
Nyhetsbrev
Få nyhetsbrevet i innboksen
Hvert nyhetsbrev samler ukens viktigste AI-nyheter — korte, kildebelagte saker skrevet for norske lesere. Du får en e-post med nytt nyhetsbrev, gratis. Vil du heller lytte? Nyhetsbrevet finnes også som podkast. Du kan melde deg av når som helst.