Forskning31. juli 2026
LLM-diagnoser: Konsekvente, men åpne for feil
Av redaksjonen
Nye funn viser at store språkmodeller (LLM-er) gir pålitelig like diagnoser, men er sårbare for uvedkommende informasjon og responderer uforutsigbart på endret klinisk kontekst.
En ny studie utfordrer forestillingen om at konsistens beskytter store språkmodeller (-er) mot feil i medisinske diagnoser. Forskere ved Google og OpenAI testet Gemini 2.0 Flash og ChatGPT-4o på 52 kliniske scenarier, og fant like diagnoser ved omformulering av teksten.
Studiens viktigste funn er at modellene, til tross for 100% konsistens ved gjentatte spørringer med uendrede fakta, viste uforutsigbarhet når ledetråder i spørringen ble endret:
* **Irrelevante detaljer:** Gemini endret diagnose i 40% av tilfellene når uvedkommende, men plausible, detaljer ble lagt til. ChatGPT gjorde det samme i 30% av tilfellene. Dette viser hvordan irrelevante opplysninger kan påvirke modellens vurdering.
* **Kontekstuelle endringer:** ChatGPT reagerte på ny kontekst oftere enn Gemini (77,8% mot 55,6%), men en større andel av disse endringene ble vurdert som klinisk upassende av legespesialister (33,3% mot 22,2%).
Resultatene peker på at selv om LLM-er gir det samme svaret på det samme spørsmålet flere ganger, kan de mistolke kritisk informasjon. Før LLM-er kan brukes i klinisk diagnostikk, må de lære å skille relevant fra irrelevant informasjon, og vise at de mangler tilstrekkelig informasjon når det er tilfellet. Tett klinisk oppfølging og strenge sikkerhetsmekanismer er avgjørende.