Koneoppiminen

Avoin malli koodaa kahdeksan tuntia putkeen

Z.ai:n MIT-lisensoitu GLM-5.1 haastaa alan huiput koodaustesteissä

Hanna HuulivuoHanna Huulivuo
Jaa:
Avoin malli koodaa kahdeksan tuntia putkeen

Kiinalaisen Z.ai:n uusi valtti

Kiinalainen tekoäly-yhtiö Z.ai, aiemmin Zhipu AI, julkaisi maanantaina GLM-5.1-mallin. Yhtiön mukaan malli pystyy koodaamaan itsenäisesti kahdeksan tuntia putkeen ja ohittaa SWE-Bench Pro -koodaustestissä sekä Claude Opus 4.6:n että OpenAI:n GPT-5.4:n.

GLM-5.1 on jatkokehitys helmikuussa julkaistusta GLM-5-perusmallista. Arkkitehtuuriltaan kyseessä on 744 miljardin parametrin MoE-malli, jossa noin 40 miljardia parametria aktivoituu kutakin tokenia kohden. Konteksti-ikkuna on 200 000 tokenia ja malli voi tuottaa jopa 128 000 tokenin vastauksia.

Koko malli on koulutettu Huawein Ascend-piireillä ilman Nvidian laitteistoa. Yhdysvaltain vientirajoitukset ovat pakottaneet kiinalaiset tekoäly-yhtiöt etsimään kotimaisia vaihtoehtoja, ja Z.ai:n mukaan GLM-5.1 osoittaa, että huipputason malleja voi kouluttaa ilman amerikkalaisia siruja. Tsinghua-yliopistosta vuonna 2019 ponnistaneen yhtiön markkina-arvo nousi tammikuun Hong Kongin pörssilistautumisessa 31,3 miljardiin dollariin.

Käytännössä tämä tarkoittaa

Ensimmäistä kertaa avoin ja ilmainen tekoälymalli pystyy kilpailemaan kaupallisten jättien kanssa pitkäkestoisessa koodaustyössä. Kuka tahansa kehittäjä voi ladata mallin ja käyttää sitä MIT-lisenssillä.

Kahdeksan tuntia – mitä se oikeasti tarkoittaa?

Z.ai:n demonstraatiossa GLM-5.1 rakensi kokonaisen Linux-työpöytäympäristön tyhjästä. Prosessiin kului 655 iteraatiota, joiden aikana malli suunnitteli, toteutti, testasi ja korjasi koodiaan toistuvasti. Toisessa kokeessa malli nosti vektoritietokannan kyselynopeuden 6,9-kertaiseksi alkuperäiseen verrattuna.

Nykyiset tekoälyagentit pystyvät tyypillisesti muutamien minuuttien tai korkeintaan tunnin mittaisiin tehtäviin. Ne vaativat säännöllistä ihmisohjausta ja menettävät kontekstin pitkissä sessioissa. GLM-5.1:n lupaus on, että malli ylläpitää ymmärrystään koko projektin laajuudelta tuntien ajan ja tunnistaa virheet itsenäisesti.

Lupaus on toistaiseksi lähinnä yhtiön omien demonstraatioiden varassa. Kontrolloiduissa olosuhteissa malli voi suoriutua erinomaisesti, mutta todellisissa ohjelmistoprojekteissa haasteet ovat toisenlaisia: epäselviä vaatimuksia, vanhaa koodia ja odottamattomia reunatapauksia. Kahdeksan tunnin autonomia tuotantoympäristössä vaatii vielä näyttöjä.

SWE-Bench Pro: yksi testi, monta tulkintaa

Z.ai:n mukaan GLM-5.1 saavutti SWE-Bench Pro -testissä tuloksen 58,4 prosenttia, mikä ohittaa GPT-5.4:n (57,7) ja Claude Opus 4.6:n (57,3). SWE-Bench Pro on Scale AI:n kehittämä koodaustesti, joka mittaa mallien kykyä ratkaista todellisia ohjelmistoinsinöörien ongelmia 41 ammattimaisessa koodipohjassa. Tehtävät vaativat keskimäärin muutoksia 4,1 tiedostoon ja noin sadan rivin koodaamista.

Testi on alalla arvostettu, koska se käyttää yksityisiä koodikantoja, joita mallit eivät todennäköisesti ole nähneet koulutuksensa aikana. GLM-5.1 ei kuitenkaan toistaiseksi näy Scale AI:n virallisella tulostaululla, jossa GPT-5.4-pro johtaa tuloksella 59,1 ja Claude Opus 4.6 on kolmantena tuloksella 51,9. Ero selittynee erilaisilla testiasetuksilla: iteraatioiden määrällä, kustannusrajoilla ja mallin käyttämillä resursseilla.

Riippumattomat arviot paljastavat selkeän kaavan: GLM-5.1 pärjää käytännön koodauksessa ja kyberturvallisuustesteissä, mutta jää jälkeen puhtaassa päättelyssä. HLE-päättelytestissä mallin tulos on 31,0 prosenttia, kun GPT-5.4 saavuttaa 39,8 prosenttia. Matematiikassa ero on pienempi mutta johdonmukainen. Kyseessä on siis erikoistunut koodausmalli, ei yleismalli, joka syrjäyttäisi kaupalliset kilpailijat kaikilla osa-alueilla.

MIT-lisenssi avaa ovet

GLM-5.1:n ehkä merkittävin piirre on sen MIT-lisenssi. Toisin kuin useat kilpailevat avoimet mallit, jotka rajoittavat kaupallista käyttöä, MIT-lisenssi sallii mallin vapaan käytön, muokkaamisen ja jakelun. Avoimen lähdekoodin yhteisölle tämä on iso asia: 744 miljardin parametrin malli, joka kilpailee kaupallisten huippumallien kanssa, on nyt kenen tahansa ladattavissa.

Mallin ajaminen vaatii tosin huomattavan laskentakapasiteetin – 744 miljardia parametria ei pyöritä läppärillä. Todellinen hyöty koituu yrityksille ja tutkimusryhmille, jotka voivat räätälöidä mallia omiin tarpeisiinsa ilman lisenssimaksuja. API-käyttö on edullista: miljoona syötetokenia maksaa dollarin ja miljoona tuotettua tokenia 3,20 dollaria, mikä tekee mallista 5–8 kertaa edullisemman kuin Claude Opus 4.6. Malli on yhteensopiva Claude Coden, OpenClaw:n ja muiden suosittujen kehitystyökalujen kanssa.

Sanasto

MoE-malli (Mixture of Experts)
Asiantuntijasekoitemalli – arkkitehtuuri jossa malli koostuu useista erikoistuneista osista ja vain osa niistä aktivoituu kullekin syötteelle. Tämä säästää laskentatehoa, koska koko mallia ei tarvitse käyttää joka kerta.
Token
Tekstin perusyksikkö jonka kielimalli käsittelee. Yksi token on noin ¾ englanninkielistä sanaa eli suomeksi noin puoli sanaa.
Konteksti-ikkuna
Tekstin enimmäismäärä jonka kielimalli pystyy huomioimaan kerralla. Mitä suurempi ikkuna, sitä pidempiä dokumentteja tai keskusteluhistorioita malli voi käsitellä.

Mitä seurata

GLM-5.1 on ensimmäinen avoin malli, joka pääsee lähelle kaupallisten mallien koodaustasoa. Seuraavaksi ratkaisevaa on, miten malli suoriutuu Scale AI:n virallisella tulostaululla ja laajemmissa riippumattomissa testeissä. Seuraamme myös Anthropicin ja OpenAI:n vastauksia – molemmat ovat perinteisesti reagoineet nopeasti kilpailijan tuloksiin. Z.ai:n pörssikurssi Hong Kongin pörssissä kertoo markkinoiden näkemyksen: ensimmäiset kaupankäyntipäivät julkaisun jälkeen paljastavat, uskovatko sijoittajat kahdeksan tunnin lupaukseen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Robotit hyppäsivät sulaan teräkseen Imatralla
  5. 5Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.