Nytt datasett avslører: AI-forskere feiler ulikt
Av AIWatch
Et nytt datasett avdekker hvordan KI-modeller faktisk resonnerer når de løser komplekse forskningsoppgaver, og viser at selv toppmodeller har svært forskjellige feilmønstre.
Forskere har lansert OpenDiscoveryTrace, et offentlig datasett med over 550 fulle arbeidsforløp fra KI-forskere – såkalte . Dette viser hvordan modellene tenker, ikke bare hva de produserer. Målet er å kunne granske metodikk og diagnostisere feil, i stedet for kun å vurdere sluttresultatet. Datasettet inneholder detaljerte trinn-for-trinn-logger, inkludert modellens tanker, verktøy-kall, observasjoner og selvtillit, fra 124 vitenskapelige oppgaver innen blant annet medisin og materialvitenskap. Det dekker syv modeller, deriblant de kraftige GPT-5.4, Claude Opus 4.6 og Gemini 3.1 Pro, samt fire open source-modeller som Qwen2.5-7B. En foreløpig analyse viser store forskjeller selv der sluttresultatene er like. For eksempel hadde GPT-5.4 og Claude Opus 4.6 sammenlignbare suksessrater på rundt 84–89 prosent, men Claude gjorde 30 ganger flere feil underveis enn GPT-5.4 (2,5 mot 0,08 per forløp). Feiltypene var også forskjellige: Claude feilet mest på verktøybruk, mens GPT-5.4 slet med resonnering. Dette er viktig innsikt for norske utviklere og forskere som ønsker å bygge mer robuste og pålitelige KI-agenter.
Kilder til denne saken: arXiv cs.AI ↗
AI: Research, språk og faktasjekk.
Relatert