Yhtiö lupaa Claude Opuksen tason, mutta vain SpaceX ja Tesla saavat testata.
xAI on ottanut käyttöön uuden kielimallinsa tavalla, joka tekee sen arvioinnista lähes mahdotonta. Grok 4.5 siirtyi yksityiseen betaan 28. kesäkuuta, mutta testaajia on vain kaksi: SpaceX ja Tesla. Kumpikin on Elon Muskin oma yhtiö. Ulkopuolisilla tutkijoilla tai toimittajilla ei ole pääsyä malliin, joten yhtiön esittämiä lukuja ei voi todentaa.
Puolitoista biljoonaa parametria – väite, ei mittaus
xAI kertoo, että Grok 4.5 rakentuu V9-perusmallin päälle ja sisältää 1,5 biljoonaa parametria. Se olisi noin 50 prosenttia enemmän kuin edeltäjän Grok 4.4:n arvioitu biljoona parametria. Luku on kuitenkin pelkkä yhtiön oma ilmoitus. Kun malli pyörii vain Muskin omien yritysten suljetuissa ympäristöissä, sen kokoa ei pääse varmentamaan riippumaton taho.
Parametrien lukumäärä ei myöskään suoraan kerro mallin kyvykkyydestä. Suuri malli voi olla tehoton, jos arkkitehtuuri tai harjoitusdata ontuu. Ilman julkisia testituloksia luku jää markkinointipuheeksi.
Väitettä ei voi todentaa
Grok 4.5:n parametrimäärä ja Claude Opus -vertailu perustuvat yksinomaan xAI:n omiin ilmoituksiin. Malli ei ole ulkopuolisten testattavissa, joten lukuja ei voi varmentaa riippumattomasti.
Claude Opus -vertailu roikkuu ilmassa
Yhtiön mukaan varhaiset arviot viittaavat siihen, että Grok 4.5 yltää lähelle Anthropicin Claude Opusta tai ohittaa sen. Vertailu on rohkea, koska sitä ei voi tarkistaa. Anthropicin malleja arvioidaan avoimilla vertailutesteillä, ja tulokset ovat julkisia. Grok 4.5:stä on olemassa vain xAI:n oma lausunto siitä, että se pärjää hyvin.
Sisäiset arviot ovat mallin kehittäjälle luonnollisesti suotuisia. Ilman standardoituja ja julkisia testejä väite jää sanan varaan. Alalla on totuttu siihen, että uusi malli julkistetaan yhdessä vertailutulosten kanssa, joita muut voivat toistaa. Grok 4.5:n kohdalla tätä askelta ei ole otettu.
Cursorin data ja suljettu koeympäristö
Tekninen kiinnostavuus piilee harjoitusdatassa. xAI kertoo kouluttaneensa mallia todellisilla koodaustyönkuluilla ja virheenkorjauskuvioilla, jotka on kerätty Cursor-koodieditorista. Mukana on lisäksi jatkuva vahvistusoppiminen ja päivitetty Grok Build -harness.
Valinta testata mallia juuri SpaceX:llä ja Teslalla ei ole sattumaa. Yhtiöt työskentelevät laitteiston, ohjelmistojen ja reaaliaikaisen päätöksenteon rajapinnassa. Se on vaativa ympäristö, mutta myös suljettu. Mikään ulkopuolinen taho ei näe, miten malli siellä oikeasti suoriutuu.
Tavalliselle käyttäjälle tämä tarkoittaa, että Grok 4.5:n ympärille rakennettua hehkutusta kannattaa lukea varauksella. Kun mallia ei voi kokeilla eikä sen tuloksia toistaa, kuluttaja ostaa käytännössä lupauksen. Yrityksille, jotka harkitsevat tekoälytyökalujen hankintaa, suljettu beta tarkoittaa, ettei päätöstä voi perustaa riippumattomaan arvioon vaan pelkkään markkinointiin. Läpinäkyvyys on tekoälyalalla luottamuksen perusta, ja juuri se puuttuu tästä julkistuksesta.
Sanasto
- Vahvistusoppiminen
- Koneoppimisen tapa, jossa malli oppii yrityksen ja erehdyksen kautta: onnistumisista palkitaan ja epäonnistumisista rangaistaan, jolloin malli hakeutuu parempiin ratkaisuihin.
- Harness
- Ohjelmistokehys, joka ympäröi tekoälymallia ja hoitaa sen ajamisen, työkalujen käytön ja tehtävien suorittamisen käytännössä.
Kuukausittainen perusmalli ja suojattu väite
xAI aikoo Muskin mukaan julkaista SpaceX:llä alusta asti koulutetun uuden perusmallin joka kuukausi loppuvuoden ajan. Vauhti kuulostaa kovalta, mutta sama läpinäkyvyyden ongelma koskee näitäkin lupauksia. Mallien nopea sarjatuotanto ei merkitse paljon, jos yksikään niistä ei päädy riippumattomaan testiin.
Suljettu beta voi olla myös tietoinen strategia. Kun kilpailijat julkaisevat mallinsa avoimesti ja altistavat ne kritiikille, xAI kääntää mittaamattomuuden markkinointieduksi. Väite ilman vastanäyttöä säilyy voittamattomana niin kauan kuin kukaan ei pääse sitä kaatamaan. Se ei silti ole sama asia kuin paras malli, vaan hyvin suojattu väite.
Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta.
Lue lisää toimintaperiaatteistamme.