Tekoäly

Grok 4.20 laittaa neljä agenttia väittelemään

Sisäinen vertaisarviointi pudotti hallusinaatiot 65 prosenttia

Aino AikajärviAino Aikajärvi
Jaa:
Grok 4.20 laittaa neljä agenttia väittelemään

xAI julkaisi 17. helmikuuta Grok 4.20 -betaversion. Yhtiön uusin tekoälymalli poikkeaa edeltäjistään tavalla, jota kaupallisissa tuotteissa ei ole ennen nähty: vastauksen takana ei ole yksi malli vaan neljän erikoistuneen agentin yhteistyö.

Neljä agenttia, neljä roolia

Järjestelmän ytimessä toimii neljä nimitettyä agenttia. Grok on koordinaattori, joka pilkkoo käyttäjän kysymyksen osiin ja jakaa tehtävät eteenpäin. Harper vastaa tutkimuksesta ja faktojen tarkistuksesta – se hyödyntää reaaliaikaisesti muun muassa X-alustan noin 68 miljoonaa päivittäistä englanninkielistä viestiä. Benjamin hoitaa logiikan, matemaattisen päättelyn ja koodianalyysin. Lucas tuo joukkoon luovan ajattelun ja tunnistaa muiden agenttien katvealueita.

Roolijako ei ole pelkkä markkinointikikka. Jokainen agentti lähestyy samaa ongelmaa omasta erikoisalastaan, ja lopullinen vastaus syntyy vasta sisäisen väittelyn jälkeen.

Väittely ennen vastausta

Prosessi etenee neljässä vaiheessa. Ensin koordinaattori-Grok analysoi kysymyksen ja jakaa osatehtävät kolmelle erikoistuneelle agentille samanaikaisesti. Kukin agentti tuottaa oman analyysinsä rinnakkain, ei peräkkäin.

Sitten alkaa väittely. Harper nostaa esiin reaaliaikaiseen dataan perustuvia väitteitä, Benjamin tarkistaa päättelyn loogisuuden ja laskutoimitukset, Lucas etsii vaihtoehtoisia näkökulmia. Kierroksia jatketaan, kunnes agentit saavuttavat yhteisymmärryksen tai merkitsevät jäljelle jäävät epävarmuudet näkyviin. Lopuksi Grok kokoaa vahvimmat osat yhteen ja tuottaa käyttäjälle yhden yhtenäisen vastauksen.

xAI:n mukaan vertaisarviointi on pudottanut hallusinaatioasteen noin 12 prosentista 4,2 prosenttiin. Vähennys on 65 prosenttia, mikä on huomattava parannus yksittäiseen malliin verrattuna.

Grok 4.20 avainluvut

Malli perustuu arviolta noin kolmen biljoonan parametrin MoE-arkkitehtuuriin (Mixture of Experts). Koulutukseen käytettiin 200 000 GPU:ta xAI:n Colossus-supertietokoneessa. Konteksti-ikkuna on kaksi miljoonaa tokenia. Malli tukee tekstiä, kuvia ja videota.

Saatavilla SuperGrok-tilaajille (noin 30 dollaria kuukaudessa) ja X Premium+ -käyttäjille. API-hinnoittelua ei ole vielä vahvistettu.

Kilpailijoista poikkeava lähestymistapa

Moniagenttijärjestelmät eivät sinänsä ole uusia. Avoimen lähdekoodin kehykset kuten CrewAI ja AutoGen ovat tarjonneet kehittäjille työkaluja usean agentin orkestrointiin jo parin vuoden ajan. CrewAI jakaa agenteille selkeät roolit ja tavoitteet, AutoGen taas painottaa keskustelupohjaista yhteistyötä. Molempia käytetään tyypillisesti erillisinä sovelluksina kielimallin päällä.

Grok 4.20 eroaa näistä kahdella tavalla. Moniagenttijärjestelmä on rakennettu suoraan mallin sisään, ei erilliseksi sovelluskerrokseksi. Agentit jakavat saman mallin painot ja KV-välimuistin, joten lisäkustannus jää xAI:n mukaan 1,5–2,5-kertaiseksi yksittäiseen ajoon verrattuna. Yksinkertaisiin kysymyksiin järjestelmä ei aktivoi kaikkia neljää agenttia, vaan täysi neuvonpito käynnistyy vain monimutkaisissa tehtävissä.

Vertailun vuoksi OpenAI:n o-sarjan mallit käyttävät test-time compute -tekniikkaa, jossa yksi malli tuottaa pitkiä sisäisiä ajatteluketjuja. Grok 4.20 sen sijaan jakaa ajattelun neljälle agentille, joilla on omat erikoisalansa. Kummallakin lähestymistavalla on etunsa, mutta xAI:n ratkaisu on ensimmäinen, joka tuo erikoistuneen agenttineuvoston suoraan kuluttajatuotteeseen.

4

Erikoistunutta agenttia

–65 %↓

Hallusinaatioiden vähennys

~3 bilj.

Parametria (MoE)

2 milj.

Tokenin konteksti-ikkuna

xAI

Ensimmäiset tulokset lupaavia

Varhaisissa vertailuissa Grok 4.20 on pärjännyt hyvin. Alpha Arena -osakekaupankäyntitestissä se oli ainoa tekoälymalli, joka tuotti voittoa – muut mallit, mukaan lukien GPT-5 ja Gemini 3 Pro, jäivät tappiolle. ForecastBench-ennustetestissä malli sijoittui toiseksi.

Lukuihin kannattaa suhtautua varauksella, sillä malli on vasta betavaiheessa ja vertailutulokset voivat muuttua laajemman käytön myötä. Kiinnostavampi kysymys on, leviääkö moniagenttimalli laajemmin. Jos neljän agentin sisäinen väittely todella pitää hallusinaatiot alle viidessä prosentissa, lähestymistapa voi kiinnostaa erityisesti yrityksiä, jotka tarvitsevat tekoälyltä perusteltuja ja tarkistettuja vastauksia.

Kilpailijoiden reaktio ratkaisee paljon. Jos OpenAI, Google tai Anthropic lisäävät omiin mallehinsa vastaavan rakenteen, Grok 4.20 jää alaviitteeksi. Jos taas moniagenttiarkkitehtuuri osoittautuu selvästi yksittäistä mallia luotettavammaksi, xAI on tällä kertaa liikkeellä ensimmäisenä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.