Lippulaiva sai apujoukot
OpenAI julkaisi maanantaina 17. maaliskuuta kaksi uutta mallia: GPT-5.4 minin ja GPT-5.4 nanon. Kyse ei ole pelkistä pienemmistä versioista lippulaivamallista, vaan kokonaan uudesta tavasta organisoida tekoälyn työtä. Molemmat mallit tukevat 400 000 tokenin konteksti-ikkunaa. Mini on käytössä API:n lisäksi Codexissa ja ChatGPT:ssä, joten myös ilmaiskäyttäjät pääsevät nyt hyödyntämään GPT-5.4-sukupolven osaamista. Nano on toistaiseksi saatavilla vain rajapinnan kautta.
Ideana on yksinkertainen: iso malli suunnittelee ja jakaa tehtävät, pienet mallit toteuttavat ne rinnakkain. OpenAI kutsuu rakennetta aliagenttiarkkitehtuuriksi. Ajatus on tuttu yritysmaailmasta – johtaja ei täytä itse Excel-taulukoita vaan delegoi ne eteenpäin. GPT-5.4 on käytännössä palkannut itselleen harjoittelijoita.
Pomo suunnittelee, harjoittelija koodaa
OpenAI:n Codex-ympäristössä GPT-5.4 toimii tiimin johtajana. Se analysoi kehittäjän antaman tehtävän, pilkkoo sen osiin ja delegoi rutiinityöt minille tai nanolle. Aliagentit voivat samanaikaisesti etsiä koodipohjasta virheitä, skannata suuria tiedostoja ja käsitellä dokumentaatiota, kun pääagentti keskittyy kokonaisuuden hallintaan.
Ajatellaan tilannetta, jossa kehittäjä pyytää Codexia korjaamaan bugin suuressa koodikannassa. Aiemmin GPT-5.4 olisi käynyt läpi kaiken yksin. Nyt lippulaiva voi lähettää kolme mini-agenttia samanaikaisesti: yksi etsii viittauksia bugin aiheuttavaan funktioon, toinen tarkistaa testit ja kolmas skannaa dokumentaation. Pääagentti kokoaa löydökset ja tekee korjauksen.
Mini suoriutuu SWE-Bench Pro -koodaustestissä 54,4 prosentin tarkkuudella, kun lippulaivan tulos on 57,7 prosenttia. Ero on pieni ottaen huomioon, että mini on kaksi kertaa nopeampi. Työkalukutsuissa parannus on vielä selvempi – Toolathlon-testissä tulos nousi edeltäjän 26,9 prosentista 42,9 prosenttiin.
Nanon rooli on kapeampi. OpenAI suosittelee sitä luokitteluun, datan poimintaan ja yksinkertaisiin koodaustehtäviin. Tietokonenäössä nano jää selvästi jälkeen: OSWorld-testissä se saa 39 prosenttia, kun mini yltää 72,1 prosenttiin. Se on kesäharjoittelija, joka lajittelee postit ja täyttää lomakkeet, mutta ei kirjoita strategiaraporttia.
Hinta kolmannekseen, nopeus kaksinkertaiseksi
Hinnoittelu tekee uusista malleista kiinnostavia erityisesti suurten volyymien sovelluksissa. GPT-5.4 minin syötetokeni maksaa 0,75 dollaria miljoonalta ja tulostetokeni 4,50 dollaria, kun lippulaivan hinnat ovat 2,50 ja 15 dollaria. Codexissa mini kuluttaa vain 30 prosenttia GPT-5.4:n kiintiöstä, mikä pudottaa kustannukset karkeasti kolmannekseen yksinkertaisemmissa tehtävissä.
Nano menee vielä pidemmälle. Kehittäjä Simon Willison laski, että nanolla voi kuvailla 76 000 valokuvaa 52 dollarilla – 0,20 dollarin syötetokenihinta avaa oven massiivisille eräajoille, joissa kalliimpien mallien käyttö ei olisi taloudellisesti järkevää.
Kääntöpuolena uudet mallit ovat selvästi kalliimpia kuin edeltäjänsä. GPT-5 mini maksoi syötetokenilta 0,25 dollaria, joten hintaa on kolminkertaistettu. Nano on neljä kertaa kalliimpi kuin edeltävä GPT-5 nano. OpenAI perustelee korotusta paremmalla suorituskyvyllä, mutta budjettiherkkien sovellusten kannalta vanhemmat mallit saattavat yhä olla järkevämpi valinta.
Kehittäjien arjessa kolmiportainen hinnoittelu tarkoittaa uudenlaista optimointia. Sovellus voi käyttää nanoa käyttäjien viestien luokitteluun, miniä koodikatselmoinnin tueksi ja lippulaivaa vain monimutkaisimpiin päätöksiin. Yhdistelmä voi pudottaa tekoälykuluja murto-osaan ilman, että loppukäyttäjä huomaa eroa.
Merkittävä heikkous piilee pitkän kontekstin käsittelyssä. Mini saa OpenAI:n MRCR v2 -testissä vain 47,7 prosenttia, kun lippulaiva yltää 86 prosenttiin. Pitkiä dokumentteja tai monimutkaisia koodikantoja ei siis kannata sysätä harjoittelijalle.
Sanasto
- Tokeni
- Tekstin perusyksikkö, jonka kielimalli käsittelee. Yksi tokeni vastaa noin kolmea neljäsosaa englanninkielisestä sanasta eli suomeksi noin puolta sanaa.
- Konteksti-ikkuna
- Tekstin enimmäismäärä, jonka kielimalli pystyy käsittelemään kerralla. Mitä suurempi ikkuna, sitä pidempiä dokumentteja tai keskusteluhistorioita malli voi huomioida.
Aliagentista alan standardi?
OpenAI ei ole ainoa, joka rakentaa hierarkkista tekoälyjärjestelmää. Anthropic käyttää Claude Codessa vastaavaa mallia: Opus 4.6 toimii pääagenttina ja delegoi alitehtävät Sonnet 4.6:lle. Anthropicin sisäisissä testeissä moniagenttijärjestelmä päihitti yksittäisen Opus-agentin lähes kaksinkertaisella tehokkuudella tutkimustehtävissä. Google puolestaan rakentaa Agent Development Kitiä, jossa Gemini 3 Pro ohjaa kevyempiä Flash-malleja.
Ero perinteiseen mallireititin-lähestymistapaan on merkittävä. Reitittimessä järjestelmä valitsee tehtävään sopivan mallin, mutta malli ei itse tiedä olevansa osa suurempaa kokonaisuutta. Aliagenttirakenne menee pidemmälle: pääagentti ymmärtää kokonaisuuden, jakaa työn tietoisesti ja kokoaa tulokset yhteen.
Suomalaisille ohjelmistotaloille ja tekoäly-yrityksille tämä tarkoittaa käytännössä sitä, että sovelluskehityksen kustannusrakenne muuttuu. Kun koodaustyökalut osaavat automaattisesti reitittää yksinkertaiset tehtävät halvemmille malleille, yksittäisen kehitysprojektin tekoälykulut voivat laskea merkittävästi ilman, että laatu kärsii. Massiiviset datan käsittelytehtävät, kuten kuvien luokittelu tai lokitiedostojen analyysi, tulevat taloudellisesti järkeviksi nanon hintatasolla.
Kolme suurta tekoäly-yhtiötä rakentavat nyt samankaltaista hierarkiaa, kukin omalla tavallaan. OpenAI tarjoaa kolmea kokoluokkaa samasta mallista, Anthropic yhdistää kahta erillistä malliperhettä ja Google automatisoi delegoinnin kehitystyökaluilla. Yksittäinen malli, joka hoitaa kaiken, on jäämässä menneisyyteen. Tilalle tulevat tekoälytiimit, joissa jokaisella jäsenellä on oma roolinsa ja hintansa.
Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta.
Lue lisää toimintaperiaatteistamme.