Tekoäly

GPT-5.4 käyttää tietokonettasi sinua paremmin

OSWorld-testissä 75 prosenttia – ihmisiltä vain 72,4

Aino AikajärviAino Aikajärvi
Jaa:
GPT-5.4 käyttää tietokonettasi sinua paremmin

OpenAI julkaisi eilen GPT-5.4:n, yhtiön toistaiseksi tehokkaimman kielimallin. Julkaisun keskiössä on ominaisuus, jota koko ala on odottanut: malli osaa käyttää tietokonetta itsenäisesti hiiren ja näppäimistön avulla. Ennakkoon vuotaneet tiedot antoivat esimakua, mutta viralliset speksit paljastavat mallin todellisen tason.

GPT-5.4 tulee kolmena versiona: perusmallina, päättelyyn erikoistuneena Thinking-versiona ja raskaaseen ammattikäyttöön suunniteltuna Pro-versiona. API-version konteksti-ikkuna on kasvanut miljoonaan tokeniin, mikä on yli kaksinkertainen edeltäjään verrattuna. Malli korvaa GPT-5.2:n oletuksena sekä ChatGPT:ssä että API:ssa.

Ihmisiä parempi tietokoneen käyttäjä

OSWorld-Verified-testissä, joka mittaa tekoälyn kykyä suoriutua työpöytätehtävistä kuvakaappausten ja hiiren avulla, GPT-5.4 saavuttaa 75 prosentin onnistumisasteen. Ihmisten tulos samassa testissä on 72,4 prosenttia. Edeltäjä GPT-5.2 jäi 47,3 prosenttiin, joten parannus on valtava.

Kyseessä on ensimmäinen kerta, kun yleiskäyttöinen kielimalli ylittää ihmistason itsenäisessä tietokoneen käytössä. GPT-5.4 pystyy navigoimaan ohjelmistoja, täyttämään lomakkeita, siirtymään sovellusten välillä ja suorittamaan monivaiheisia tehtäviä ilman jatkuvaa ohjausta. OpenAI korostaa, että koneenkäyttökyky on rakennettu suoraan malliin eikä toimi erillisenä lisäosana.

Tietokoneen käyttö ei ole ainoa parannus. GDPval-testissä, joka arvioi suoriutumista 44 ammattialan tehtävissä, malli saa 83 prosentin tuloksen. GPT-5.4 tekee 33 prosenttia vähemmän virheellisiä väitteitä ja 18 prosenttia vähemmän asiavirheitä kuin edeltäjänsä. Visuaalisessa ymmärryksessä MMMU-Pro-testin tulos on 81,2 prosenttia.

Huippumallien hinta ja vahvuudet

GPT-5.4

OpenAI:n uusin lippulaivamalli

Syötehinta
2,50 $ / 1M tokenia
Tulostehinta
15 $ / 1M tokenia
Konteksti-ikkuna
1 miljoona tokenia
Vahvin osa-alue
Tietokoneen käyttö (OSWorld 75 %)

Claude Opus 4.6

Anthropicin päättelymalli

Syötehinta
5 $ / 1M tokenia
Tulostehinta
25 $ / 1M tokenia
Konteksti-ikkuna
200 000 tokenia
Vahvin osa-alue
Koodin korjaus (SWE-Bench 80,8 %)

Gemini 3.1 Pro

Googlen edullisin huippumalli

Syötehinta
2 $ / 1M tokenia
Tulostehinta
12 $ / 1M tokenia
Konteksti-ikkuna
2 miljoonaa tokenia
Vahvin osa-alue
Päättely (GPQA Diamond 94,3 %)

OpenAI, Anthropic, Google, 2026

Miljoonan tokenin muisti

API-version konteksti-ikkuna yltää miljoonaan tokeniin. Se on OpenAI:n suurin koskaan ja mahdollistaa kokonaisten koodikantojen, pitkien sopimusten tai laajojen tutkimusaineistojen käsittelyn kerralla. Käytännössä miljoonaan tokeniin mahtuu karkeasti arvioituna noin 750 000 sanaa eli useita kokonaisia kirjoja.

Tokenien kulutuksessa GPT-5.4 on selvästi edeltäjäänsä tehokkaampi. Uusi tool search -järjestelmä hakee työkalumäärittelyt vasta tarvittaessa sen sijaan, että ne ladattaisiin kerralla. Tämä vähentää tokenien käyttöä 47 prosenttia vertailutehtävissä tarkkuuden kärsimättä. Koodaustehtävissä Codex-alustan fast-tila tuottaa tokeneita puolitoistakertaisella nopeudella.

Kolme hintapistettä, terävöityvä kilpailu

Perusmallin API-hinta on 2,50 dollaria miljoonaa syötetokenia kohden ja 15 dollaria tulostetokenia kohden. Pro-version hintalappu on selvästi korkeampi: 30 ja 180 dollaria vastaavasti.

Kilpailijoihin verrattuna perusmallin syötehinnoittelu on aggressiivinen. Anthropicin Claude Opus 4.6 maksaa 5 ja 25 dollaria miljoonaa tokenia kohden. Googlen Gemini 3.1 Pro on edullisin vaihtoehto hinnoin 2 ja 12 dollaria, ja sen konteksti-ikkuna on peräti kaksi miljoonaa tokenia.

Vertailuissa kukin malli hallitsee omaa osa-aluettaan. GPT-5.4 johtaa tietokoneen käytössä ja ammatillisissa tehtävissä. Claude Opus 4.6 on vahvin tuotantokoodin virheiden korjaamisessa SWE-Bench-testissä tuloksella 80,8 prosenttia. Gemini 3.1 Pro on ylivoimainen abstraktissa päättelyssä GPQA Diamond -testissä tuloksella 94,3 prosenttia.

Käytännössä yksittäisen mallin valinnalla ei ole enää niin suurta merkitystä kuin vuosi sitten. Tärkeämpää on ymmärtää kunkin mallin vahvuudet ja rakentaa työnkulut niiden mukaan.

Sanasto

Token
Tekstin perusyksikkö jonka kielimalli käsittelee. Yksi token on noin ¾ englanninkielistä sanaa eli suomeksi noin puoli sanaa.
Konteksti-ikkuna
Tekstin enimmäismäärä jonka kielimalli voi käsitellä kerralla. Mitä suurempi konteksti-ikkuna, sitä pidempiä dokumentteja tai keskusteluhistorioita mallille voi syöttää.

Suomalaisen kehittäjän näkymä

Computer use -ominaisuus siirtää tekoälyn roolia tekstin tuottajasta konkreettisten tehtävien tekijäksi. Suomalaisille kehittäjille ja tietotyöläisille tämä avaa mahdollisuuksia automatisoida toistuvia työnkulkuja – testien ajamista, järjestelmien välisten siirtojen hallintaa tai raporttien kokoamista useasta lähteestä.

Vielä syksyllä 2025 itsenäinen tietokoneen käyttö oli Anthropicin Claude-mallin erikoisuus. Nyt OpenAI, Anthropic ja Google kilpailevat samalla kentällä, ja OSWorld-tulokset osoittavat GPT-5.4:n ohittaneen ne kaikki tässä yksittäisessä vertailussa. Anthropicin Opus 4.6:n tulos on 72,7 prosenttia, eli niukasti alle ihmistason.

Hintaa kannattaa seurata tarkasti. Perusmallin syötehinta on kilpailukykyinen, mutta raskas computer use -käyttö kuluttaa tokeneita nopeasti kuvakaappausten vuoksi. Pro-version hinnoittelu rajaa sen käytännössä suurempien organisaatioiden budjetille.

Kolme suurinta tekoäly-yhtiötä kilpailee nyt siitä, kenen malli automatisoi arjen tehokkaimmin. Suomalaisten yritysten kannattaa arvioida, mitkä toistuvat tietotyöprosessit voisi jo nyt antaa tekoälyn hoidettavaksi – työkalut siihen ovat olemassa.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.