Tekoäly

Grok Build saapui terminaaliin – häviää silti Claudelle

xAI:n koodausagentti tuo 256K-kontekstin, mutta jää SWE-Benchissä kakkoseksi.

Aino AikajärviAino Aikajärvi
Jaa:
Grok Build saapui terminaaliin – häviää silti Claudelle

Plan mode kysyy ennen kuin koskee

xAI julkisti Grok Buildin SuperGrok-tilaajille toukokuun lopussa. Kyseessä on yhtiön ensimmäinen koodausagentti, joka asuu terminaalissa Claude Coden ja Codex CLI:n tapaan. Tärkein erottava piirre on plan mode: agentti ei kosketa tiedostoja ennen kuin se on näyttänyt täydellisen muutoslistan ja saanut nimenomaisen hyväksynnän.

Plan moden tarkoitus on rauhoittaa kehittäjä, joka on aiemmin polttanut sormensa autonomisten agenttien jälkien siivoamiseen. Käyttäjä voi hyväksyä suunnitelman sellaisenaan, kommentoida yksittäisiä vaiheita tai kirjoittaa ne kokonaan uudelleen ennen kuin yhtään riviä koodia syntyy. Idea ei ole täysin uusi, vaan Claude Coden ja Cursor Agentin käyttäjille tuttu, mutta xAI on tehnyt siitä työnkulun perustan eikä lisävalintaa.

256K-konteksti ja Arena Mode lupaavat lisää

Grok Build pyörittää 256 000 tokenin konteksti-ikkunaa. Se mahtuu useimpiin koodikantoihin ilman aggressiivista tiivistystä, mutta jää selvästi jälkeen Anthropicin ja Googlen miljoonan tokenin tarjouksista. Tämän kompromissin xAI on yrittänyt paikata moniagenttiarkkitehtuurilla: koordinaattoriagentti pilkkoo tehtävän ja jakaa sen jopa kahdeksalle rinnakkaiselle ala-agentille, jotka käyvät läpi kolmivaiheisen kierroksen suunnittele, etsi ja rakenna.

Markkinoinnin kruununjalokivenä xAI on esitellyt Arena Moden, jossa eri mallit kilpailisivat samasta tehtävästä rinnakkain ja kehittäjä valitsisi voittajan. Aikomus on lainattu suoraan LLM Arenan logiikasta. Käytännössä toiminto ei kuitenkaan ole vielä auki: koodijäljet paljastavat sen olleen kehitteillä jo helmikuussa, mutta ensimmäisessä beetaversiossa sitä ei pääse kokeilemaan.

Vertailu Claude Codeen, Codexiin ja Antigravityyn

Ratkaisevin kysymys koodaajien näkökulmasta on yksinkertainen: onko Grok Build tarpeeksi hyvä? Toukokuussa julkaistujen SWE-Bench Verified -tulosten valossa vastaus on toistaiseksi ei. Grok Build 0.1 yltää 70,8 prosenttiin, kun Claude Code saa 87,6 prosenttia ja Codex CLI 88,7 prosenttia. Ero on suuruusluokassa, jossa moni kehittäjä huomaa sen päivittäisessä työssä.

Grok Build (xAI): 256K-konteksti, plan mode, kahdeksan agentin rinnakkaisajo, SuperGrok-tilaus 99 dollaria kuussa introhintana tai 299 dollaria normaalisti.

Claude Code (Anthropic): 200K-konteksti, vakiintunut työnkulku, paras pistemäärä SWE-Benchissä, Pro-tason hinta noin 100 dollaria kuussa.

Codex CLI (OpenAI): 200K-konteksti, käyttöperusteinen hinnoittelu, kärkipistemäärä SWE-Benchissä, suosio kasvanut helmikuusta lähtien.

Antigravity (Google): yli miljoonan tokenin konteksti, moniagenttiarkkitehtuuri, Gemini-mallit, hintahaarukka 20–200 dollaria kuussa.

Vincit, Nitor ja Reaktor punnitsevat pinoaan

Suomalaisille koodausagentteja paketoiville taloille uusi tulokas on lähinnä lisävaihtoehto pinoon, jossa on jo Claude Code, Codex ja Googlen Antigravity. Vincit on ottanut digital solutions -yksikön johtajan Jarno Rikamanin mukaan agenttipohjaisen kehityksen nopeasti käyttöön, ja yhtiön mukaan tekoälyagentit tuottavat jo valtaosan sen koodista ja testeistä. Tällaisessa tilanteessa työkalupinon valinta on operatiivinen päätös, ei kokeilu.

Nitorin julkisissa kannanotoissa tekoälyä on lähestytty ohjelmoinnin apurina, ei korvaajana, ja painopiste on ollut työnkulun nopeuttamisessa eikä mallivendorin vaihtamisessa. Reaktor on pitänyt linjansa tarkemmin sisäisenä, mutta talojen yhteinen haaste on sama: minkä mallin taakse asiakaskoodi luovutetaan ja kuka kantaa vastuun, jos agentti tekee virheen tuotannossa.

Grok Buildin suurin etu kotimaiselle integraattorille on hinta ja avoin malliyhdistely OpenRouterin kautta: jos asiakas vaatii useamman vendorin rinnakkaista käyttöä tai kotimaista tiedonkäsittelyä, monimalliarkkitehtuuri voi olla helpompi perustella kuin yhden vendorin lukko. Heikoin kohta on suoritus, sillä 17 prosenttiyksikön ero SWE-Benchissä tarkoittaa käytännössä sitä, että integraattorin asiantuntijan pitää korjata enemmän virheitä jälkikäteen.

Sanasto

CLI (Command Line Interface)
Komentorivityökalu – ohjelma jota käytetään kirjoittamalla komentoja tekstipohjaiseen ikkunaan graafisen käyttöliittymän sijaan. Kehittäjien suosima tapa hallita työkaluja.
Konteksti-ikkuna
Se tekstimäärä jonka tekoälymalli pystyy käsittelemään kerralla. 256 000 tokenia vastaa karkeasti useita satoja sivuja tekstiä.
SWE-Bench Verified
Vertailutesti, jossa tekoälymallien koodaustaitoja mitataan oikeilla ohjelmistovirheillä GitHub-projekteista. Korkeampi prosenttiluku tarkoittaa parempaa kykyä korjata bugeja itsenäisesti.

Mitä Grok Build tarkoittaa kotimaiselle kehittäjälle

Tavalliselle koodaajalle Grok Buildin merkitys on toinen kuin agenttitaloille. Plan moden kaltaiset hyväksyntäportit nostavat kehittäjän takaisin ohjaajaksi sen sijaan, että jälkikäteen siivottaisiin agentin virheitä. Tämä on hyvä uutinen myös työnantajalle, joka pohtii kuka vastaa, jos agentti rikkoo tuotannon. Toinen seuraus on hintakilpailu: kun useampi vendori tarjoaa rajattoman käytön tilauksia alle satasella kuussa, yksittäisen kehittäjän työkalukustannus jää pienemmäksi kuin yhden lisenssimaksun perinteisessä mallissa.

Toistaiseksi Grok Build ei nouse kärkivalinnaksi suorituskykynsä takia, vaan siksi, että se laajentaa valinnanvapautta. Suomalaisten koodausagentteja paketoivien talojen on syytä kirjoittaa työkalupolitiikkansa auki: mistä mallista asiakas saa työnsä ja millä ehdoilla.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 520 vuotta koodaamatta, sitten 5,4 miljoonaa

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.