Arbeidsliv13. august 2026

Frontier-modeller knuser spesial-AI i medisinsk diagnostikk

Av AIWatch

To personer ved et bord: en mann med macbook og en kvinne med kaffekopp, lattermildt pratende i et kafémiljø.
Kategoribilde Foto: Brooke Cagle, Unsplash

Nye studier viser at generelle AI-modeller som Gemini og GPT overgår spesialiserte kliniske verktøy i nøyaktighet for medisinsk diagnostikk, fra eksamensspørsmål til ekte kliniske forespørsler.

En fersk studie i Nature Medicine sammenligner ledende generalistmodeller (GPT-5.2, Gemini 3.1 Pro, Claude Opus 4.6) med to spesialiserte kliniske AI-verktøy, OpenEvidence og UpToDate Expert AI. Resultatene er entydige: de generelle modellene presterer bedre på tvers av alle tre evalueringskomponentene. På , en test basert på medisinske lisenseksamener, scoret Gemini hele 97,4 prosent, mens OpenEvidence og UpToDate landet på henholdsvis 89,6 og 88,4 prosent. Også i evalueringen av reelle kliniske spørsmål (RCQ), stilt av leger i en live klinisk setting, ledet Gemini med et gjennomsnitt på 3,62 av 4,0 i klinikerens vurdering, foran GPT-5.2 og Claude. OpenEvidence og UpToDate fikk betydelig lavere score. Funnene understreker at en helsespesifikk merkevare eller grensesnitt ikke automatisk sikrer bedre klinisk ytelse. Modellskala, generell resonneringsevne og tilpasning, ofte karakteristisk for de større modellene, ser ut til å gi mer verdi enn domenespesifikk posisjonering. Dette antyder at helseorganisasjoner bør evaluere AI-produkter uavhengig før innkjøp, fremfor å anta at spesialiserte verktøy er mer nøyaktige eller trygge.

Kilder til denne saken: aimultiple.com ↗

AI: Research, språk og faktasjekk.

Relatert

Annonse

Reklame for nyhetsbrev og podkast fra AIWatch.no