Tekoäly

GPT-5.4 päihitti ihmisen 44 ammatissa – paperilla

Testissä 83 prosentin tulos, mutta todellinen työelämä on eri asia

Aino AikajärviAino Aikajärvi
Jaa:
GPT-5.4 päihitti ihmisen 44 ammatissa – paperilla

OpenAI julkaisi maaliskuun alussa GPT-5.4:n, jota yhtiö kutsuu tehokkaimmaksi yleismallikseen ammatilliseen työhön. Väite perustuu kahteen tulokseen: GDPVal-ammattilaistestissä malli pärjäsi yhtä hyvin tai paremmin kuin ihmisasiantuntija 83 prosentissa tehtävistä, ja OSWorld-testissä se ylitti ihmistason tietokoneen käytössä ensimmäistä kertaa.

Numerot kuulostavat vakuuttavilta. Mutta kertovatko ne, että tekoäly on valmis korvaamaan tietotyöläisen?

1 320 tehtävää yhdeksältä toimialalta

GDPVal on OpenAI:n kehittämä vertailutesti, joka mittaa tekoälymallien kykyä tuottaa ammattilaistason tietotyötä. Testi kattaa 44 ammattia yhdeksältä toimialalta, jotka vastaavat suurimmasta osasta Yhdysvaltain bruttokansantuotetta. Ammattien kirjo ulottuu ohjelmistokehittäjistä ja lakimiehistä sairaanhoitajiin ja koneinsinööreihin.

Testin 1 320 tehtävää ovat suunnitelleet ammattilaiset, joilla on keskimäärin 14 vuoden kokemus omalta alaltaan. Tehtävät vaativat mallilta konkreettisia työtuotoksia: myyntiesityksiä, kirjanpidon taulukoita, päivystysaikatauluja ja tuotantokaavioita. Arvioinnissa ihmisasiantuntijat vertasivat sokkotestissä mallin tuotoksia ammattilaisten vastaaviin suorituksiin.

GPT-5.4 voitti ihmisasiantuntijan 70,8 prosentissa suorista vertailuista. Kun mukaan lasketaan tasapelit, luku nousee 83 prosenttiin. Edellinen versio GPT-5.2 ylsi 70,9 prosenttiin, joten parannus on yli 12 prosenttiyksikköä – OpenAI:n mukaan suurin yksittäinen hyppäys mallin historiassa.

Lakimies, pankkiiri vai kone

Erot ammattien välillä ovat huomattavia. Investointipankkialan mallinnustehtävissä GPT-5.4 saavutti 87,3 prosentin tuloksen, kun GPT-5.2 jäi 68,4 prosenttiin. Esitysten laatimisessa ihmisarvioijat suosivat mallin tuotoksia 68 prosentissa vertailuista vedoten parempaan visuaalisuuteen ja monipuolisuuteen. Oikeudellisissa tehtävissä malli ylsi 91 prosenttiin BigLaw Bench -testissä.

GPT-5.4 ei kuitenkaan hallitse kaikkea. Ohjelmointitehtävissä Anthropic:n Claude Opus 4.6 pitää kärkisijaa, ja abstraktissa päättelyssä Googlen Gemini 3.1 Pro ohittaa OpenAI:n mallin. Ammatillinen tietotyö on kuitenkin se alue, jossa GPT-5.4 erottuu selkeimmin kilpailijoistaan.

Toinen merkittävä tulos tuli OSWorld-testistä, joka mittaa mallin kykyä käyttää tietokonetta itsenäisesti: avata ohjelmia, navigoida valikoissa ja suorittaa monivaiheisia tehtäviä työpöydällä. GPT-5.4 saavutti 75 prosentin onnistumisprosentin, mikä ylittää ihmisten mitatun tason 72,4 prosenttia. Se on ensimmäinen yleismalli, joka rikkoo tämän rajan. GPT-5.2:n vastaava tulos oli 47,3 prosenttia.

“Tällä hetkellä se on kuin harjoittelija, joka osuu oikeaan neljänneksen ajasta.”

— Mercorin perustaja, tekoälypohjainen rekrytointialusta

Siisti testi, sotkuinen todellisuus

GDPVal-testin tehtävät ovat selkeästi rajattuja: mallille annetaan tarvittavat taustamateriaalit ja odotetaan yhtä tuotosta. Oikea työ harvoin toimii näin. Ammatti koostuu kokouksista, kontekstista, vastuusta ja hankalista erikoistilanteista, joihin ei ole valmista vastausta. Asiakkaan soittaessa paniikissa ei riitä, että osaa täyttää taulukon oikein.

Virhetilanteet paljastavat mallin heikkouden. Kun GPT-5.4 ei tiedä vastausta, se tuottaa varmalta kuulostavan mutta väärän vastauksen sen sijaan, että pysähtyisi. Rahoituksen ja oikeustieteen kaltaisilla aloilla yksittäinenkin vakava virhe voi kumota kymmenet onnistuneet suoritukset.

Testissä on muitakin rakenteellisia puutteita. Vertailukohtana on GPT-5.2, ei tuoreempi GPT-5.3, mikä suurentaa parannuksen vaikutelmaa. Tehtävien suunnittelu on väistämättä subjektiivista, sillä saman ammattinimikkeen alle mahtuu hyvin erilaisia työtehtäviä riippuen organisaatiosta ja roolista.

Suomessa joka toinen yritys käyttää tekoälyä

Suomessa tekoälyn hyödyntäminen etenee nopeasti. Vähintään kymmenen henkilön yrityksistä 51 prosenttia käyttää tekoälyä jossakin muodossa, ja maa sijoittuu EU:ssa neljänneksi. Silti vain 17 prosentilla yrityksistä on kirjallinen tekoälystrategia.

GPT-5.4:n kaltaiset mallit koskettavat suomalaista työelämää erityisesti taloushallinnossa, oikeudellisessa työssä ja konsultoinnissa – juuri niillä aloilla, joilla malli pärjäsi testissä parhaiten. Suomessa toimii tuhansia tilitoimistoja ja lakitoimistoja, joiden päivittäinen työ koostuu juuri sellaisista tehtävistä, joita GDPVal mittaa: raportteja, analyyseja ja dokumentteja.

Kriittinen kysymys koskee kuitenkin oppimista: jos tekoäly hoitaa rutiinitehtävät, miten juniorit oppivat ammattinsa? Rutiinityö on perinteisesti ollut nuorten ammattilaisten oppimispolku. Jos se katkeaa, alan osaaminen voi rapautua pidemmällä aikavälillä, vaikka yksittäiset tehtävät hoituisivat tehokkaammin.

GPT-5.4 on vakuuttava suorittaja laboratorio-olosuhteissa. Todellinen koetinkivi on se, miten malli pärjää silloin, kun tehtävänanto on epätäydellinen, konteksti puutteellinen ja vastuu todellinen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.