Forskning1. september 2026

Nye tester knekker AI-assistenter: Ytelse faller med økt kompleksitet

Av AIWatch

To personer sitter ved et trebord og samarbeider om et prosjekt. Det ligger flere bærbare datamaskiner, penner og et ark med håndskrevne skisser og diagrammer på bordet mens de peker og noterer.
Kategoribilde Foto: Scott Graham, Unsplash

En fersk test av AI-agenter for mobil viser at dagens modeller sliter dramatisk når oppgavene blir mer sammensatte. Forskere fremhever viktigheten av intelligent design for å forbedre stabiliteten.

Nye testdata av AI-agenter for mobil, kalt , avslører betydelige svakheter i dagens ledende AI-modeller. Når oppgavene blir mer komplekse, reduseres agentenes ytelse betraktelig. Dette står i kontrast til enklere, atomære handlinger. GMA-testen omfatter syv nye applikasjoner, fra livsstil til reiseplanlegging, og 300 oppgaver fordelt på fire vanskelighetsgrader. Evalueringen av åtte fremtredende modeller viser at ingen av dem håndterer realistiske brukerbehov på en pålitelig måte. Dette peker på et gap mellom dagens AI-kapasitet og praktiske forventninger i mobilbruk. Studien utforsker også hvordan designvalg for agentenes «seletøy» () påvirker resultatene, inkludert kontekstbevaring og eksplisitt sporing av tilstand. Resultatene indikerer at et hensiktsmessig design kan forbedre ytelsen markant, spesielt for krevende (workflows). Effekten varierer likevel mellom ulike grunnmodeller.

Kilder til denne saken: arXiv cs.AI ↗

AI: Research, språk og faktasjekk.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no