OpenAI julkaisi maaliskuun alussa GPT-5.4:n, jota yhtiö kutsuu tehokkaimmaksi yleismallikseen ammatilliseen työhön. Väite perustuu kahteen tulokseen: GDPVal-ammattilaistestissä malli pärjäsi yhtä hyvin tai paremmin kuin ihmisasiantuntija 83 prosentissa tehtävistä, ja OSWorld-testissä se ylitti ihmistason tietokoneen käytössä ensimmäistä kertaa.
Numerot kuulostavat vakuuttavilta. Mutta kertovatko ne, että tekoäly on valmis korvaamaan tietotyöläisen?
1 320 tehtävää yhdeksältä toimialalta
GDPVal on OpenAI:n kehittämä vertailutesti, joka mittaa tekoälymallien kykyä tuottaa ammattilaistason tietotyötä. Testi kattaa 44 ammattia yhdeksältä toimialalta, jotka vastaavat suurimmasta osasta Yhdysvaltain bruttokansantuotetta. Ammattien kirjo ulottuu ohjelmistokehittäjistä ja lakimiehistä sairaanhoitajiin ja koneinsinööreihin.
Testin 1 320 tehtävää ovat suunnitelleet ammattilaiset, joilla on keskimäärin 14 vuoden kokemus omalta alaltaan. Tehtävät vaativat mallilta konkreettisia työtuotoksia: myyntiesityksiä, kirjanpidon taulukoita, päivystysaikatauluja ja tuotantokaavioita. Arvioinnissa ihmisasiantuntijat vertasivat sokkotestissä mallin tuotoksia ammattilaisten vastaaviin suorituksiin.
GPT-5.4 voitti ihmisasiantuntijan 70,8 prosentissa suorista vertailuista. Kun mukaan lasketaan tasapelit, luku nousee 83 prosenttiin. Edellinen versio GPT-5.2 ylsi 70,9 prosenttiin, joten parannus on yli 12 prosenttiyksikköä – OpenAI:n mukaan suurin yksittäinen hyppäys mallin historiassa.
Lakimies, pankkiiri vai kone
Erot ammattien välillä ovat huomattavia. Investointipankkialan mallinnustehtävissä GPT-5.4 saavutti 87,3 prosentin tuloksen, kun GPT-5.2 jäi 68,4 prosenttiin. Esitysten laatimisessa ihmisarvioijat suosivat mallin tuotoksia 68 prosentissa vertailuista vedoten parempaan visuaalisuuteen ja monipuolisuuteen. Oikeudellisissa tehtävissä malli ylsi 91 prosenttiin BigLaw Bench -testissä.
GPT-5.4 ei kuitenkaan hallitse kaikkea. Ohjelmointitehtävissä Anthropic:n Claude Opus 4.6 pitää kärkisijaa, ja abstraktissa päättelyssä Googlen Gemini 3.1 Pro ohittaa OpenAI:n mallin. Ammatillinen tietotyö on kuitenkin se alue, jossa GPT-5.4 erottuu selkeimmin kilpailijoistaan.
Toinen merkittävä tulos tuli OSWorld-testistä, joka mittaa mallin kykyä käyttää tietokonetta itsenäisesti: avata ohjelmia, navigoida valikoissa ja suorittaa monivaiheisia tehtäviä työpöydällä. GPT-5.4 saavutti 75 prosentin onnistumisprosentin, mikä ylittää ihmisten mitatun tason 72,4 prosenttia. Se on ensimmäinen yleismalli, joka rikkoo tämän rajan. GPT-5.2:n vastaava tulos oli 47,3 prosenttia.
“Tällä hetkellä se on kuin harjoittelija, joka osuu oikeaan neljänneksen ajasta.”



