AI-agenter svikter på tvers av oppgaver: Mangler stabil strategi
Av AIWatch
Nye funn viser at selv om AI-agenter løser en enkelt oppgave konsistent, sliter de ofte med å opprettholde en stabil strategi når oppgavene endres. Dette avslører en kritisk svakhet i dagens evalueringsmetoder.
Nye funn viser at kan fremstå pålitelige på enkeltoppgaver, men mangler en stabil strategi når de møter forskjellige utfordringer. En ny Behavioral Consistency Metric (BCM) kvantifiserer dette ved å analysere atferdsmønstre, ikke bare resultater, og avslører en betydelig forskjell mellom konsistens innenfor én oppgave og konsistens på tvers av flere. Forskere bak BCM har analysert rundt 9000 kjøringer fra seks -agenter på programvareutviklingsoppgaver. De fant at noen systemer var reproduserbare lokalt – altså oppførte de seg likt ved gjentatte forsøk på samme oppgave – men var globalt fragmenterte, uten en stabil tilnærming mellom ulike oppgaver. Metrikken avdekker at konsistens ikke er det samme som . Agenter kan oppnå lignende suksess, men likevel variere sterkt i hvor konsistente de er. Det ble også observert at forskjellen i konsistens mellom ledende (frontier) og åpne (open source) modeller vedvarer, selv når vanskelighetsgraden på oppgavene holdes konstant. BCM fungerer som et pålitelighetssignal på prosessnivå og utfyller tradisjonelle resultatmålinger.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert