Android Bench 2.0 tester AI på ukelange kodeoppgaver
Av AIWatch
Googles nye testmetodikk, Android Bench 2.0, måler AI-modeller på koding av komplekse apper og funksjoner – oppgaver som tidligere krevde dager med menneskelig arbeid.
Google har oppdatert sin testplattform for kunstig intelligens, Android Bench, til versjon 2.0, for å bedre vurdere AI-modellers evne til å håndtere avanserte utviklingsoppgaver. Mens den første versjonen fokuserte på mindre endringer i eksisterende kode, utfordrer 2.0-utgaven AI-en med oppgaver som å bygge nye apper fra bunnen av eller konvertere kryssplattform-apper til Android. Disse oppgavene, som en ingeniør normalt ville brukt flere dager eller til og med en uke på å fullføre, krever en mer nyansert evaluering enn enkel bestått/ikke-bestått. Derfor har Google innført løpende poengsum for å vurdere funksjonalitet, visuell kvalitet og fravær av , altså feil i eksisterende funksjonalitet. På denne måten kan modeller rangeres basert på hvor komplette og feilfrie løsningene deres er. I de første testene topper GPT-6 Astra listen med en suksessrate på 28%, som er et relativt lavt tall sammenlignet med tidligere tester. Dette indikerer at feltet fortsatt har rom for forbedring. Mens AI-en er dyktig på å skrive ny kode og utføre etablerte, deterministiske transformasjoner – som å konvertere Java til Kotlin – sliter den mer med feilsøking og arkitekturarbeid som krever dypere forståelse. Dette gir norske utviklingsteam innsikt i hvor AI-en kan avlaste, og hvor menneskelig kompetanse fortsatt er uunnværlig.
Kilder til denne saken: 9to5Google ↗
AI: Research, språk og faktasjekk.
Relatert
Automasjon & robotikk26. sep.
Boston Dynamics trener Atlas for masseproduksjon i bilfabrikker
Automasjon & robotikk26. sep.
Hjemmeroboten Stretch 4 utsolgt før demo
Automasjon & robotikk25. sep.
Roboten Stretch 4 lover smartere AI-hjelp hjemme og på jobb
Automasjon & robotikk25. sep.
Roboten Stretch 4 selger ut og gir funksjonshemmede økt frihet