Produkt30. juli 2026
Gemma 4: ny generasjon multimodale språkmodeller fra Google
Google presenterer Gemma 4-serien, en ny generasjon åpne multimodale språkmodeller utviklet for forbedret effektivitet og komplekse resonnementer. Dette innebærer betydelige fremskritt for flermedial AI.
Google har lansert Gemma 4, en serie åpne multimodale språkmodeller. Disse modellene er utviklet med vekt på beregningseffektivitet og avanserte resonneringsevner, og representerer den fjerde generasjonen i Gemma-familien. Serien inkluderer modeller fra 2,3 milliarder til 31 milliarder parametere, med både tette nettverk og Mixture-of-Experts (MoE)-arkitekturer som sikter mot optimalisert ytelse.
En sentral nyvinning er innføringen av forbedrede bilde- og lydenkodere på tvers av alle modellstørrelser. For 12B-modellen har Google dessuten utviklet en enhetlig, enkoder-fri arkitektur. Denne arkitekturen kan behandle rå lyddata og bildefragmenter direkte, noe som potensielt forenkler og effektiviserer dataflyten for multimodale oppgaver.
En annen viktig funksjon er en integrert «tankemodus». Denne gjør det mulig for Gemma-modellene å generere resonnementspor før de formulerer et svar. Dette kan føre til mer logiske og konsistente utgivelser, og gir bedre innsikt i modellens tankeprosess. Denne tilnærmingen adskiller seg fra tradisjonelle språkmodeller som gjerne genererer svar direkte.
Optimeringer i modellens design har adressert forbedring av inferenshastighet, minnebruk, beregningseffektivitet og kapasitet for lange kontekster. Ifølge utviklerne gir dette Gemma 4 et betydelig løft i ytelse innen STEM-fag (vitenskap, teknologi, ingeniørfag og matematikk), multimodale applikasjoner og oppgaver som krever lang kontekstforståelse. Modellene hevdes å konkurrere med større, proprietære modeller når det gjelder menneskelig vurderbar ytelse. Disse fremskrittene underbygger en trend mot mer allsidige og effektive AI-systemer, særlig for oppgaver som krever integrert forståelse av ulike datatyper.