Kiinalainen tekoäly-yhtiö Z AI julkaisi tiistaina GLM-5.1-kielimallin, joka nousi SWE-Bench Pro -koodaustestin kärkeen tuloksella 58,4 prosenttia. Avoimen lähdekoodin malli ohitti OpenAI:n GPT-5.4:n ja Anthropicin Claude Opus 4.6:n, jotka ovat hallinneet vaativimpia koodausbenchmarkkeja.
SWE-Bench Pro mittaa kielimallien kykyä ratkaista todellisia ohjelmistokehityksen ongelmia: bugien korjauksia, ominaisuuksien toteutuksia ja koodin uudelleenjärjestelyä olemassa olevissa projekteissa. Testissä ei riitä, että malli tuottaa toimivaa koodia – sen pitää ymmärtää laajoja koodikantoja ja tehdä muutoksia, jotka eivät riko muuta toiminnallisuutta.
Erot huipulla ovat pieniä mutta merkityksellisiä. GLM-5.1:n etumatka GPT-5.4:ään on 0,7 prosenttiyksikköä ja Claude Opus 4.6:een 1,1 prosenttiyksikköä. Googlen Gemini 3.1 Pro jäi selvästi neljänneksi tuloksella 54,2 prosenttia. Alalla, jossa huippumallit eroavat toisistaan tyypillisesti kymmenyksinä, kyseessä on selvä kärkisija.
Käytännössä tämä tarkoittaa
Avoimen lähdekoodin tekoälymalli ratkaisee nyt ohjelmistokehityksen ongelmia yhtä hyvin tai paremmin kuin suljetut kilpailijansa. Kehittäjille tämä tarkoittaa halvempaa ja vapaampaa pääsyä huipputason koodaustyökaluihin.
Jättimalli, joka käyttää murto-osaa itsestään
GLM-5.1 perustuu MoE-arkkitehtuuriin (Mixture of Experts), jossa mallin 744 miljardia parametria on jaettu 256 erikoistuneeseen asiantuntijaan. Jokaista tokenia käsittelee kerrallaan vain kahdeksan asiantuntijaa, joten aktiivisten parametrien määrä putoaa noin 40 miljardiin. Tämä on MoE-mallien ydinajatus: valtava tietomäärä on käytettävissä, mutta laskentateho ei kasva samassa suhteessa.
Hinnoittelussa tämä näkyy suoraan. Z AI veloittaa miljoonasta syötetokenista dollarin ja miljoonasta tuotetusta tokenista 3,20 dollaria. Mallin ajaminen paikallisesti vaatii merkittävää laskentakapasiteettia, joten useimmat kehittäjät käyttänevät sitä API:n kautta.
Kahdeksan tuntia ilman taukoa
GLM-5.1:n erikoisuus on kyky työskennellä yksittäisen koodaustehtävän parissa jopa kahdeksan tuntia ilman ihmisen väliintuloa. Malli suunnittelee toteutuksen, kirjoittaa koodin, ajaa testit ja optimoi tulosta itsenäisesti. Aikaisemmat mallit ovat pystyneet autonomiseen työskentelyyn minuuttien tai korkeintaan tuntien ajan, joten kahdeksan tunnin yhtäjaksoinen työskentely on selvä parannus.
Z AI demonstroi kyvykkyyttä rakentamalla mallilla kokonaisen Linux-työpöytäjärjestelmän. Tehtävä vaati 655 iteraatiota ja tuotti 6,9-kertaisen suorituskyvyn parannuksen. Mallin 200 000 tokenin konteksti-ikkuna ja 128 000 tokenin tuotoskapasiteetti tukevat laajojen koodikantojen käsittelyä yhdellä istunnolla.
Koulutus ilman Nvidiaa
GLM-5.1 koulutettiin kokonaan 100 000 Huawein Ascend 910B -sirulla käyttäen MindSpore-ohjelmistokehystä. Nvidia-siruja ei käytetty lainkaan. Ascend 910B on Huawein vastine Nvidian A100- ja H100-sarjan siruille, ja vaikka yksittäisen sirun suorituskyvyssä Huawei jää kilpailijaansa, Z AI kompensoi eron volyymilla ja räätälöidyillä ohjelmisto-optimoinneilla.
Tulos on merkittävä teknologiapoliittisesti. Yhdysvaltojen vientirajoitukset estävät kiinalaisia yrityksiä hankkimasta Nvidian uusimpia tekoälysiruja, mutta GLM-5.1 osoittaa, etteivät rajoitukset ole pysäyttäneet kiinalaista tekoälykehitystä. Ne ovat pikemminkin pakottaneet yhtiöt rakentamaan omia vaihtoehtoja. Yrityksille ja kehittäjille tämä tarkoittaa, että huipputason koodausmalleja on nyt saatavilla myös Nvidia-ekosysteemin ulkopuolelta.
Sanasto
- Konteksti-ikkuna
- Tekstin enimmäismäärä jonka kielimalli pystyy käsittelemään kerralla. Mitä suurempi konteksti-ikkuna, sitä laajempia dokumentteja tai koodikantoja malli voi käsitellä yhdellä kertaa.
Avoimuuden rajat
Z AI julkaisi mallin painot MIT-lisenssillä, joka sallii vapaan käytön, muokkauksen ja kaupallisen hyödyntämisen. Painot ovat ladattavissa HuggingFace-palvelusta ja malli toimii useilla ajoympäristöillä kuten vLLM ja SGLang.
Täysin avoimesta mallista ei silti ole kyse. Z AI ei ole julkaissut koulutusaineistoa eikä yksityiskohtaista kuvausta koulutusprosessista. Avoimet painot tarkoittavat, että kuka tahansa voi käyttää ja muokata mallia, mutta sen toistaminen alusta asti on mahdotonta ilman samoja aineistoja. Myös SWE-Bench Pro -tulos perustuu toistaiseksi Z AI:n omiin mittauksiin, eikä riippumatonta kolmannen osapuolen vahvistusta ole vielä julkaistu.
Mitä seurata
Z AI listautui Hongkongin pörssiin tammikuussa 31,3 miljardin dollarin arvostuksella. Yhtiön seuraava askel ratkaisee, jääkö GLM-5.1 koodaukseen erikoistuneeksi malliksi vai laajentuuko osaaminen myös päättelyyn ja luovaan työhön.
SWE-Bench Pro -tuloksen riippumaton vahvistaminen on lähiviikkojen tärkein virstanpylväs. Jos kolmannen osapuolen arvioinnit vahvistavat tuloksen, avoimen lähdekoodin mallien rooli ammattimaisessa ohjelmistokehityksessä vahvistuu entisestään. Seuraamme myös Huawein siruekosysteemin kehitystä – GLM-5.1 voi olla alkusysäys laajemmalle siirtymälle pois Nvidia-riippuvuudesta kiinalaisessa tekoälykentässä.
Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta.
Lue lisää toimintaperiaatteistamme.