Kiinalaisen Z.ai:n uusi valtti
Kiinalainen tekoäly-yhtiö Z.ai, aiemmin Zhipu AI, julkaisi maanantaina GLM-5.1-mallin. Yhtiön mukaan malli pystyy koodaamaan itsenäisesti kahdeksan tuntia putkeen ja ohittaa SWE-Bench Pro -koodaustestissä sekä Claude Opus 4.6:n että OpenAI:n GPT-5.4:n.
GLM-5.1 on jatkokehitys helmikuussa julkaistusta GLM-5-perusmallista. Arkkitehtuuriltaan kyseessä on 744 miljardin parametrin MoE-malli, jossa noin 40 miljardia parametria aktivoituu kutakin tokenia kohden. Konteksti-ikkuna on 200 000 tokenia ja malli voi tuottaa jopa 128 000 tokenin vastauksia.
Koko malli on koulutettu Huawein Ascend-piireillä ilman Nvidian laitteistoa. Yhdysvaltain vientirajoitukset ovat pakottaneet kiinalaiset tekoäly-yhtiöt etsimään kotimaisia vaihtoehtoja, ja Z.ai:n mukaan GLM-5.1 osoittaa, että huipputason malleja voi kouluttaa ilman amerikkalaisia siruja. Tsinghua-yliopistosta vuonna 2019 ponnistaneen yhtiön markkina-arvo nousi tammikuun Hong Kongin pörssilistautumisessa 31,3 miljardiin dollariin.
Käytännössä tämä tarkoittaa
Ensimmäistä kertaa avoin ja ilmainen tekoälymalli pystyy kilpailemaan kaupallisten jättien kanssa pitkäkestoisessa koodaustyössä. Kuka tahansa kehittäjä voi ladata mallin ja käyttää sitä MIT-lisenssillä.
Kahdeksan tuntia – mitä se oikeasti tarkoittaa?
Z.ai:n demonstraatiossa GLM-5.1 rakensi kokonaisen Linux-työpöytäympäristön tyhjästä. Prosessiin kului 655 iteraatiota, joiden aikana malli suunnitteli, toteutti, testasi ja korjasi koodiaan toistuvasti. Toisessa kokeessa malli nosti vektoritietokannan kyselynopeuden 6,9-kertaiseksi alkuperäiseen verrattuna.
Nykyiset tekoälyagentit pystyvät tyypillisesti muutamien minuuttien tai korkeintaan tunnin mittaisiin tehtäviin. Ne vaativat säännöllistä ihmisohjausta ja menettävät kontekstin pitkissä sessioissa. GLM-5.1:n lupaus on, että malli ylläpitää ymmärrystään koko projektin laajuudelta tuntien ajan ja tunnistaa virheet itsenäisesti.
Lupaus on toistaiseksi lähinnä yhtiön omien demonstraatioiden varassa. Kontrolloiduissa olosuhteissa malli voi suoriutua erinomaisesti, mutta todellisissa ohjelmistoprojekteissa haasteet ovat toisenlaisia: epäselviä vaatimuksia, vanhaa koodia ja odottamattomia reunatapauksia. Kahdeksan tunnin autonomia tuotantoympäristössä vaatii vielä näyttöjä.
SWE-Bench Pro: yksi testi, monta tulkintaa
Z.ai:n mukaan GLM-5.1 saavutti SWE-Bench Pro -testissä tuloksen 58,4 prosenttia, mikä ohittaa GPT-5.4:n (57,7) ja Claude Opus 4.6:n (57,3). SWE-Bench Pro on Scale AI:n kehittämä koodaustesti, joka mittaa mallien kykyä ratkaista todellisia ohjelmistoinsinöörien ongelmia 41 ammattimaisessa koodipohjassa. Tehtävät vaativat keskimäärin muutoksia 4,1 tiedostoon ja noin sadan rivin koodaamista.
Testi on alalla arvostettu, koska se käyttää yksityisiä koodikantoja, joita mallit eivät todennäköisesti ole nähneet koulutuksensa aikana. GLM-5.1 ei kuitenkaan toistaiseksi näy Scale AI:n virallisella tulostaululla, jossa GPT-5.4-pro johtaa tuloksella 59,1 ja Claude Opus 4.6 on kolmantena tuloksella 51,9. Ero selittynee erilaisilla testiasetuksilla: iteraatioiden määrällä, kustannusrajoilla ja mallin käyttämillä resursseilla.
Riippumattomat arviot paljastavat selkeän kaavan: GLM-5.1 pärjää käytännön koodauksessa ja kyberturvallisuustesteissä, mutta jää jälkeen puhtaassa päättelyssä. HLE-päättelytestissä mallin tulos on 31,0 prosenttia, kun GPT-5.4 saavuttaa 39,8 prosenttia. Matematiikassa ero on pienempi mutta johdonmukainen. Kyseessä on siis erikoistunut koodausmalli, ei yleismalli, joka syrjäyttäisi kaupalliset kilpailijat kaikilla osa-alueilla.



