Arbeidsliv30. juli 2026

Åpen LLM-koding for dataforberedelse uten skyavhengighet

Forskere har evaluert åpne språkmodeller for å automatisere datarens og harmonisering, noe som kan frigjøre forskning fra skytjenestenes begrensninger og forbedre personvern.

Nye studier viser at det er mulig å bruke åpne, lokalt kjørende store språkmodeller (LLM-er) og agenter for kodeutvikling, spesielt innenfor dataforberedelse. Dette åpner for AI-assistert arbeid i forskningsmiljøer der strenge personvernkrav forbyr overføring av sensitive data til tredjeparts skytjenester. En gruppe forskere har utviklet et rammeverk for å vurdere effektiviteten til slike modeller. Rammeverket består av et kuratert datasett med ferdige R-skript for å rense seks datainnsamlinger fra en britisk kohortstudie. Oppgavene inkluderer kategoriharmonisering og sammenslåing av data fra forskjellige tidspunkter. Evalueringen benytter automatiserte rutiner for å sjekke både den genererte R-koden og de resulterende dataene. Benchmarkingen omfattet en rekke LLM-er på tvers av forskjellige distribusjonsmoduser, fra lokale modeller på forbrukerklasse-maskinvare til skytjenester. Modellene ble testet på 20 dataforberedelsesoppgaver, som resulterte i prediksjon av 102 variabler. Resultatene viser at avanserte fritt tilgjengelige LLM-er med 31-35 milliarder parametere oppnådde en gjennomsnittlig oppgavefullføring på opptil 87,9 prosent, noe som indikerer et høyt ytelsesnivå for denne typen oppgaver. Dette tyder på at åpen kildekode LLM-er, som kan kjøres lokalt, representerer en levedyktig vei mot AI-assistert dataforberedelse i regulerte forskningsmiljøer. Evnen til å håndtere kompliserte datahåndteringsoppgaver uten å sende data utenfor forskerens egen infrastruktur kan redusere flaskehalser betydelig i longitudinelle befolkningsstudier og lignende prosjekter som involverer sensitive personopplysninger.