Annet17. september 2026

Har generativ AI blitt bedre i matematikk?

Av Redaksjonen

En robot-hånd trykker på en kalkulator, med tallene 1.2345678 på skjermen. I bakgrunnen vises en lys grønn overflate med diagramlinjer.
Foto: Pham Nhat, Unsplash

Både ja og nei. Og forskjellen mellom de to svarene avslører hvordan generativ AI faktisk fungerer i dag.

Spør du ChatGPT om hva 2+2 er, kan det se ut som ren matematikk. Men spørsmålet rommer egentlig to forskjellige problemstillinger: Har modellen lært å regne? Og gir den riktigere matematiske svar enn før? Det første svaret er nei. Det andre er ja. La oss ta dem hver for seg.

Nei: maskineriet regner fortsatt ikke

Når en språkmodell løser 2 + 2, skjer det i prinsippet noe helt annet enn i en tradisjonell kalkulator. Modellen «beregner» ikke matematisk; den forutsier det neste logiske tegnet () basert på mønstre den har analysert i treningsdataene. Modellen velger heller ikke nødvendigvis alltid det aller mest sannsynlige neste ordet deterministisk. I praksis trekkes utdataene fra en sannsynlighetsfordeling, styrt av en parameter ofte kalt «». Setter man temperaturen til null, blir valget tilnærmet deterministisk – men det underliggende maskineriet er fortsatt statistisk prediksjon, ikke aritmetikk. At 2 + 2 nesten alltid blir «4» skyldes ikke at modellen utfører addisjon, men at akkurat dette regnestykket er massivt representert i treningsmaterialet. Det forklarer også et velkjent fenomen: feilraten stiger raskt når utregningene blir mer komplekse. Ved store tall og flertrinns-beregninger møter modellen sekvenser den sjelden har sett, og en modell som gjetter på mønstre, har ingen indre garanti for at den følger regnereglene konsekvent. På dette nivået har ingenting endret seg – og kommer heller ikke til å gjøre det. Grunnprinsippet under panseret forblir prediksjon.

Ja: svaret du får ut, er blitt langt mer pålitelig

Og likevel er det utvilsomt sant at gir riktigere matematiske svar i dag enn for få år siden. Det skjer på to måter – begge reelle, men helt forskjellige. Den ene er verktøybruk. Når AI-verktøyet får tilgang til et programmeringsspråk (som Python) eller en innebygd kalkulator, endrer bildet seg dramatisk. Modellen kan skrive kode som regner ut svaret deterministisk, kjøre koden, og bruke resultatet videre i resonnementet. Flere forskningsprosjekter, som Intel Labs' DeepMath, bygger nettopp på dette: en finjustert språkmodell kombineres med en sandkasse-executor som kjører koden. Selve utregningen flyttes over til en kodebit som kjøres eksakt, og aritmetiske feil reduseres betydelig. Denne arbeidsdelingen – språkmodellen tolker problemet, verktøyet leverer det eksakte tallet – kalles ofte «». Her er det verdt å merke seg nyansen: når koden kjøres, er utregningen faktisk aritmetikk. Det er bare modellens beslutning om å kalle verktøyet som er prediksjon. Den andre er bedre resonnement. Selve modellene har også blitt målbart bedre på matematisk resonnement helt uten eksterne verktøy. Forbedringen stammer fra større modeller, bedre treningsdata, og ikke minst «Chain-of-Thought»-teknikker der modellene trenes til å tenke trinn for trinn. Et tydelig eksempel er dedikerte resonneringsmodeller som OpenAIs o1, trent med storskala for å bygge opp en indre tankeprosess før de svarer. Gjennom treningen lærer modellen å bryte problemer ned i deloppgaver, prøve ulike løsningsveier, og gjenkjenne og rette opp i egne feil underveis. Det har løftet ytelsen betydelig på komplekse oppgaver – ikke fordi maskinen har lært å regne, men fordi den er blitt en dramatisk bedre logisk resonnør.

Hvorfor både ja og nei er det riktige svaret

Her ligger kjernen. «Har blitt bedre i matte?» blander sammen to nivåer som det lønner seg å holde adskilt: - På mekanismenivå regner modellen fortsatt ikke. Den predikerer. Svaret er nei. - På resultatnivå får brukeren riktigere svar enn før, både fordi modellen kan delegere til et verktøy som regner eksakt, og fordi den resonnerer skarpere på egen hånd. Svaret er ja. For trivielle stykker spiller forskjellen liten rolle. For kompliserte utregninger er det fortsatt tryggest når modellen faktisk kjører koden framfor å gjette. Så generativ AI har blitt bedre i matte – uten at den egentlig har lært å regne. Begge deler er sant samtidig, og det er nettopp ved å holde fast på begge at man forstår hva teknologien faktisk gjør: den er blitt en langt dyktigere problemløser som fremdeles, i sin kjerne, gjetter seg fram til det neste tegnet – men som nå vet når den bør overlate regnestykket til en kalkulator.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no