Næringsliv1. august 2026
FinCacheServe reduserer RAG-kostnader med gjenbruk av svar
Av redaksjonen
Ny forskning viser hvordan en metode for å gjenbruke svar effektivt kan kutte kostnadene for RAG-tjenester, uten å ofre nøyaktighet ved endringer i data.
Å gjenbruke tidligere genererte svar kan halvere kostnadene ved bruk av store språkmodeller (LLM-er) i -systemer (Retrieval-Augmented Generation), ifølge en fersk studie. Metoden, kalt FinCacheServe, unngår at LLM-en må generere nye svar på identiske spørsmål, selv når underliggende dokumenter endres.
FinCacheServe fungerer ved å behandle hvert generert svar som et objekt, merket med all relevant informasjon som ble brukt for å skape det. Dette inkluderer blant annet hvilke dokumentversjoner, bevisbiter og verktøy som ble benyttet. Dersom et nytt spørsmål er semantisk identisk og de tilhørende dataene er uendret, kan systemet gjenbruke det lagrede svaret istedenfor å kjøre en ny LLM-kjøring. Dette reduserer behovet for -ressurser.
I tester på finansiell dokumentanalyse, der 2.230 spørsmål ble stilt til en Qwen2.5-modell, unngikk FinCacheServe hele 53,27 prosent av LLM-kjøringene. Dette oppnådde metoden uten å levere utdaterte svar, som ellers er en risiko ved av informasjon som baserer seg på dynamiske kilder. Metoden reduserer også energiforbruket betydelig sammenlignet med alternative caching-teknikker.