LLM-er sluker 100 000 ganger mer språk enn mennesker
Av AIWatch
Kunstig intelligens lærer fortsatt språk radikalt annerledes enn et barn. Forskere jakter nå på den menneskelige effektiviteten for å bygge smartere modeller.
Til tross for dagens avanserte AI-modeller, skiller én fundamental egenskap mennesket fortsatt fra maskinen: et barns evne til å lære språk. Store språkmodeller (-er) som GPT og Claude krever opptil hundre tusen ganger mer data enn et menneske for å mestre et språk flytende. Denne «dataeffektivitetsgapet», som forskere kaller det, er ikke bare et akademisk spørsmål. Allerede i 2030 kan tilgangen på treningsdata fra internett bli en flaskehals. Ved å forstå hvordan barn lærer, håper forskerne å kunne bygge mer datagjerrige AI-modeller. Dette kan bidra til mer effektiv AI-trening, for eksempel for video, og utvikling av chatbots for minoritetsspråk. En ny konkurranse, BabyLM, utfordrer forskere til å trene språkmodeller på små . Målet er å simulere et «utviklingsmessig plausibelt» språkmiljø, som for eksempel et barn med et ordforråd på 10 millioner ord. Resultatene evalueres med samme grammatikk-tester som brukes på mennesker, og måler blant annet «» — modellens usannsynlighetsvurdering av en setning.
Kilder til denne saken: MIT Technology Review (AI) ↗
AI: Research, språk og faktasjekk.
Relatert