Forskning3. august 2026
Nye tester avdekker at AI sliter med tvetydige retningslinjer
Av redaksjonen
En ny benchmark viser at selv avanserte AI-modeller fatter ulike beslutninger i situasjoner preget av tvetydige retningslinjer, noe som er vanlig i den virkelige verden.
Forskere har utviklet DRIP-R, en ny test () som vurderer hvordan håndterer uklare regler, særlig innen returordninger i varehandel. I motsetning til de fleste eksisterende tester, som forutsetter entydige regler, fokuserer DRIP-R på situasjoner der flere tolkninger er gyldige.
Modellene tar ulike beslutninger i identiske, tvetydige scenarier, noe som bekrefter at tvetydighet utgjør en systematisk utfordring for AI-basert beslutningstaking. Dette er viktig for AI-systemer som skal utføre rutineoppgaver i arbeidslivet, hvor retningslinjer ofte rommer gråsoner.