Nye AI-modeller utfordrer transformatorenes dominans: Lover raskere og billigere LLM-er
Av AIWatch
Startups tester nye arkitekturer som kan gjøre store språkmodeller raskere og billigere. De håper å løse begrensningene i dagens transformer-baserte modeller.
Transformatormodeller har drevet utviklingen av store språkmodeller (LLM-er) de siste ni årene, men begynner å vise sine begrensninger. Særlig sliter de med beregningskostnader for lang tekst, fordi den såkalte tette oppmerksomhetsmekanismen (dense attention) sammenligner hvert ord med alle andre ord. Dette bidrar til at OpenAI anslås å bruke 50 milliarder dollar på datakraft i år. Flere startups utvikler nå alternativer. Subquadratic tester (sparse attention), som utfører beregninger på færre ordpar og kan redusere databehovet betydelig. De hevder deres modell, SubQ, kan konkurrere med ledende LLM-er på oppgaver som søk og koding, selv om deler av industrien er skeptiske. Manifest AI introduserer et prinsipp de kaller «power retention». I stedet for å endre oppmerksomhetsmekanismen, erstatter den delvis tradisjonell oppmerksomhet med en teknikk som lagrer kun den mest relevante informasjonen. Dette gjør at modellen kan oppsummere konteksten og slippe å holde rede på alt i sitt kontekstvindu. Selskapet hevder deres teknikker kan tilpasses eksisterende transformermodeller med minimal omskriving og har vist dette med PowerCoder, en versjon av StarCoder, og Brumby, som utfordrer enkelte versjoner av Alibaba's Qwen. Andre går enda lenger. Liquid AI kombinerer transformere med sine flytende nevrale nettverk, som kan tilpasse atferd til ny informasjon. Dette gjør modellene mindre, mer energieffektive, og kan kjøres på svakere maskinvare. Inception bruker , kjent fra bildegenerering, for å la LLM-er produsere tekst i hele setninger eller avsnitt samtidig, i stedet for ord for ord. Deres modell Mercury 2 skal være ti ganger raskere enn GPT-4-modeller fra 2023. Pathway, en annen startup, bygger LLM-er som kan frigjøres fra språklige begrensninger og har løst komplekse sudoku-oppgaver der tradisjonelle LLM-er feilet. Utviklingen viser at det er en sterk drivkraft i AI-miljøet for å forbedre kjernekomponentene i LLM-er.
Kilder til denne saken: MIT Technology Review (AI) ↗
AI: Research, språk og faktasjekk.
Relatert
Næringsliv26. sep.
Microsoft dropper 'Copilot+ PC'-merkevare for AI-laptoper
Næringsliv26. sep.
OpenAI og Anthropic halverer kostnadene for utvalgte AI-modeller
Næringsliv25. sep.
AI-giganter øker modelltempoet tross advarsler
Næringsliv25. sep.
OpenAI og Anthropic senker prisene kraftig på nye AI-modeller