Næringsliv2. september 2026

Datoric løser AI-datafloke: Tilbyr skreddersydde treningsdata for krevende modeller

Av AIWatch

Keyboard with AI button
Kategoribilde Foto: Boliviainteligente, Unsplash

Med offentlige datakilder tømt, sliter de mest avanserte AI-modellene med å finne nok treningsdata. En ny aktør tilbyr nå spesialtilpassede datasett som er 'operasjonelt' vanskelig å kopiere.

Nye, avanserte AI-modeller, ofte kalt «», står overfor en kritisk utfordring: mangel på høykvalitets, menneskeskapte . Etter at standardkilder som Common Crawl og Reddit er «skrapt» tørre, er tilgangen på relevant data blitt en flaskehals for videre utvikling. Datoric (YC W26) fyller dette tomrommet ved å levere skreddersydde treningsdatasett, ikke fra offentlige kilder, men fra et nettverk av over 300 000 verifiserte bidragsytere. De tilbyr blant annet over 20 000 timer med flerspråklige samtaleopptak, 100 000 timer med førstepersons video fra hjemmemiljøer, og 250 000 eksempler på menneskelig programvarebruk. Dette inkluderer ikke-generisk innhold som er vanskelig å finne offentlig. Nøkkelen til Datorics modell er en «hard project isolation»-arkitektur. Hvert kundeprosjekt kjører i et helt separat miljø, med unike påloggingssystemer, noe som forhindrer automatiske angrep og garanterer revisjonsklar for hvert datasett. Dette betyr at samtykke og sporbarhet er ivaretatt fra kilden. Selskapet oppnådde en månedsinntekt i millionklassen kort tid etter lansering på Y Combinator, noe som understreker det presserende behovet i markedet. Konkurrenter kan kopiere den tekniske infrastrukturen på måneder, men nettverket av spesialiserte bidragsytere og deres grundige samtykkeinfrastruktur, bygget over år, er selskapets virkelige barriere mot kopiering. Datoric tilbyr altså ikke ny teknikk, men en operasjonell løsning på et voksende problem for AI-utviklingen.

Kilder til denne saken: startuphub.ai ↗

AI: Research, språk og faktasjekk.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no