Ny teknikk kutter språkmodellers responstid med nesten seks ganger
Av AIWatch
Forskere har utviklet RBS-Attention, en metode som vesentlig akselererer forbehandlingen av lange tekster i store språkmodeller, og gjør dem raskere å bruke.
En ny teknikk kalt RBS-Attention forbedrer responstiden for store språkmodeller betraktelig, spesielt når de behandler lange input-tekster. Metoden reduserer tiden det tar å forhåndsutfylle modellen før den begynner å generere svar, noe som kalles . RBS-Attention oppnår en nesten seksdobling (5.97x) av den totale tiden til første , altså hvor raskt modellen begynner å svare. Dette er særlig merkbart for modeller som Qwen3-30B-A3B-Instruct-2507-FP8 når de håndterer lange kontekster på 128 000 tokens, og er en treningsfri metode som bruker to seleksjonsmekanismer for å finne de mest relevante delene av teksten. For norske bedrifter med behov for å analysere lange dokumenter eller kundedialoger, kan dette bety mer effektive AI-assistenter og raskere saksbehandling.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert