Forskning3. august 2026
LLM-er sliter med detaljer i trafikkulykke-rapporter
Av redaksjonen
Nye tester viser at selv de beste språkmodellene, som GPT-4, strever med å tolke detaljer i fri tekst om trafikkulykker, og at enkle regler kan yte like bra.
Nylig forskning avslører at selv avanserte store språkmodeller (LLM-er), inkludert en kommende GPT-5.5 High, ikke klarer å reprodusere nøyaktige koder fra politirapporter om trafikkulykker like godt som mennesker. Tester i Arkansas koblet 5587 ulykkesbeskrivelser i fri tekst med 5889 strukturerte datafelt, der seks ledende LLM-er skulle kode ulykkestypen, forhold til ikke-motoriserte, kryss-type, arbeidsområde, veiforhold og lysforhold.
GPT-5.5 High oppnådde høyest samsvar blant LLM-ene, men dette var likevel lavere enn en «alltid-majoritet»-, som automatisk velger det vanligste svaret. En enkel nøkkelordsregel-baseline ga tilsvarende og -verdier som de beste LLM-ene, noe som viser at sofistikerte modeller ikke alltid overgår enklere løsninger for denne typen oppgaver.
Funnene understreker at nøyaktigheten varierer betydelig mellom ulike datakategorier. Språkmodellene presterte best på kategorier som «forhold til ikke-motoriserte» og «ulykkestype», men slet med «lysforhold», «veiforhold» og «arbeidsområde». Forskjellen i prestasjon mellom de ulike datakategoriene var større enn forskjellen mellom selve språkmodellene. Dette antyder at LLM-er bør evalueres og tas i bruk selektivt, avhengig av den spesifikke informasjonen de skal tolke, og med transparente sammenligningsgrunnlag og menneskelig kontroll.