Forskning1. august 2026
Ny metode halverer minnebruk for store språkmodeller
Av redaksjonen
Forskere har utviklet 'Keyless Attention', en ny mekanisme som reduserer minnebehovet for store språkmodeller med 50 prosent, uten å ofre ytelse.
En ny oppmerksomhetsmekanisme kalt Keyless Attention, presentert av Xin Gao Dr., lover å løse en flaskehals i moderne . Metoden halverer minnebehovet for , et kritisk komponent som lagrer tidligere beregnede representasjoner for å unngå redundante beregninger under . Dette er avgjørende for effektive store språkmodeller (LLM-er).
Keyless Attention erstatter den tradisjonelle nøkkelprojeksjonen med en dedikert projeksjon for «value-space routing». Det betyr at nøkkelrepresentasjonene fjernes fra oppmerksomhetsberegningen, noe som resulterer i en Value-Only Cache. Tester på tvers av fem modeller og fire arkitekturer viser at den nye metoden enten matcher eller overgår standard QKV-oppmerksomhet i nøyaktighet, samtidig som den forbedrer gjennomstrømningen.