Forskning6. august 2026

LLM-er feiler på persontilpasning i ny finans-test

Av AIWatch

En samling fargerike 3D-datavisualiseringer på mørk bakgrunn, inkludert stolpediagrammer, linjediagrammer, kakediagrammer og «Data Analytics»-tekst.
Kategoribilde Foto: Deng Xiang, Unsplash

En ny benchmark viser at de beste LLM-modellene sliter med å huske og tilpasse seg individuelle brukerpreferanser over tid, spesielt etter uforutsette hendelser. Dette utfordrer bruken av AI-agenter i høysikkerhetsdomener.

De beste språkmodellene (LLM) feiler på å vedlikeholde en personlig brukermodell over lengre tid, viser den nye FinPerMA. Ingen av de syv testede flaggskipmodellene oppnådde mer enn 47 prosent samlet nøyaktighet. Dette gjelder spesielt for preferansetilpasning basert på hendelser. FinPerMA tester evne til å integrere vesentlige hendelser i brukerprofilen, ved å spore 276 simulerte investorer. Etter sjokk, der markedet endrer seg brått, bevarer summariske minnemekanismer ofte fakta, men taper personlige preferansesignaler. Enkel informasjonsinnhenting (retrieval) presterer da bedre enn spesialbygde minnesystemer. Dette har konsekvenser for AI-agenter som brukes i for eksempel finansiell rådgivning.

Kilder til denne saken: arXiv cs.AI ↗

AI: Research, språk og faktasjekk.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no