Generelle språkmodeller slår klinisk AI i medisinsk nøyaktighet
Av AIWatch
Uavhengig forskning viser at allmenne AI-modeller som GPT-5.2 og Gemini 3.1 Pro presterer bedre enn spesialiserte kliniske AI-verktøy i medisinske spørsmål, til tross for at de ikke er trent spesifikt for helsesektoren.
Fersk forskning publisert i Nature Medicine avslører at generelle, avanserte (LLM-er) som GPT-5.2, Gemini 3.1 Pro og Claude Opus 4.6, overgår spesialiserte kliniske AI-verktøy som OpenEvidence og UpToDate Expert AI i medisinsk nøyaktighet. Dette utfordrer antakelsen om at domenespesifikk trening nødvendigvis gir bedre resultater i klinisk praksis. Studien testet modellene på tre områder: 500 MedQA-spørsmål for medisinsk kunnskap, 500 HealthBench-spørsmål for å vurdere samsvar med klinisk ekspertise, og 100 virkelige kliniske spørsmål (RCQ) fra leger i praksis. I MedQA-testen oppnådde Gemini hele 97,4 % nøyaktighet, mens de kliniske verktøyene lå på rundt 88–89 %. Også på RCQ-målingene, som ble blindet og vurdert av 12 amerikanske klinikere, kom de generelle LLM-ene klart best ut. Funnene viser at Googles AI Overview, en vanlig søkefunksjon, presterte like godt som de spesialiserte kliniske AI-verktøyene i RCQ-testen. Dette tyder på at det brede grunnlaget og de raske utviklingssyklusene til de generelle LLM-ene kan gi en fordel. Mangelen på innsyn i arkitekturen og treningsdataene for de proprietære kliniske verktøyene gjør det vanskelig å fastslå hvorfor de underpresterer, men hypotesen er at deres -systemer (Retrieval-Augmented Generation) kan feile når de henter irrelevant informasjon eller integrerer den dårlig. For norske helseforetak og leger betyr dette at man ikke blindt bør stole på spesialiserte AI-produkter uten uavhengig verifisering. Investeringer i AI-verktøy bør ledsages av grundige evalueringer i praksis, og man kan se på bruken av bredere AI-modeller med justerte forhåndsinstrukser () som et kostnadseffektivt alternativ. Forskere understreker at dette er et øyeblikksbilde i et felt i rask utvikling. Samtidig peker de på at for spesielt dype, subspesialiserte medisinske oppgaver kan mer skreddersydd tilpasning fortsatt være overlegen.
Kilder til denne saken: nature.com ↗
AI: Research, språk og faktasjekk.
Relatert