AI-agenter svikter med fersk kunnskap
Av AIWatch
Ny forskning viser at AI-agenter sliter med å oppdatere hukommelsen effektivt, noe som kan føre til feil i oppgaveløsning og unødvendig høye kostnader for bedrifter.
En ny analyse fra forskere bak benchmarken MERIT (Memory Evaluation for Realistic Instrumented Tasks) avslører at store språkmodeller (-er) som fungerer som , har uforutsigbare svakheter når de skal håndtere oppdatert informasjon. Studien målte hvor godt agenter bruker langtidshukommelse i verktøybaserte oppgaver, og fant at innhenting av data via "" – en teknikk for å representere tekst som tall for rask sammenligning – feilet i opptil 45 prosent av tilfellene når informasjonen var ny. For norske virksomheter betyr dette at AI-løsninger som baserer seg på slike agenter for å behandle dynamisk informasjon, risikerer å handle ut fra utdatert kunnskap. Studien testet modeller som GPT-4.1 og Claude Haiku 4.5, og fant at selv om hukommelse generelt øker suksessraten for agenter fra 0 til 55–100 prosent, er de uforutsigbare når faktum endres. Enkel summmering med LLM-er og strukturerte fakta-lagre viste seg derimot mer pålitelig, med 70–100 prosent suksessrate ved oppdatering. Ved å bytte minneimplementasjon kunne suksessraten forbedres med opptil 60 prosentpoeng.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert