Frontier-modeller knuser spesial-AI i medisinsk diagnostikk
Av AIWatch
Nye studier viser at generelle AI-modeller som Gemini og GPT overgår spesialiserte kliniske verktøy i nøyaktighet for medisinsk diagnostikk, fra eksamensspørsmål til ekte kliniske forespørsler.
En fersk studie i Nature Medicine sammenligner ledende generalistmodeller (GPT-5.2, Gemini 3.1 Pro, Claude Opus 4.6) med to spesialiserte kliniske AI-verktøy, OpenEvidence og UpToDate Expert AI. Resultatene er entydige: de generelle modellene presterer bedre på tvers av alle tre evalueringskomponentene. På , en test basert på medisinske lisenseksamener, scoret Gemini hele 97,4 prosent, mens OpenEvidence og UpToDate landet på henholdsvis 89,6 og 88,4 prosent. Også i evalueringen av reelle kliniske spørsmål (RCQ), stilt av leger i en live klinisk setting, ledet Gemini med et gjennomsnitt på 3,62 av 4,0 i klinikerens vurdering, foran GPT-5.2 og Claude. OpenEvidence og UpToDate fikk betydelig lavere score. Funnene understreker at en helsespesifikk merkevare eller grensesnitt ikke automatisk sikrer bedre klinisk ytelse. Modellskala, generell resonneringsevne og tilpasning, ofte karakteristisk for de større modellene, ser ut til å gi mer verdi enn domenespesifikk posisjonering. Dette antyder at helseorganisasjoner bør evaluere AI-produkter uavhengig før innkjøp, fremfor å anta at spesialiserte verktøy er mer nøyaktige eller trygge.
Kilder til denne saken: aimultiple.com ↗
AI: Research, språk og faktasjekk.
Relatert
Arbeidsliv26. sep.
Kundeservice-AI feiler uten god forberedelse: Én uke kan spare store kostnader
Arbeidsliv25. sep.
RSNA starter AI-sertifisering for bildediagnostikk
Arbeidsliv25. sep.
Helse-AI gasser på mens tech-giganter vurderer bremsen
Arbeidsliv25. sep.
Ansatte frykter AI endrer jobben – ikke bare teknologien