Perinteiset kielimallit tuottavat tekstiä sana kerrallaan. Jokainen uusi token syntyy edellisen pohjalta, kuin kirjoituskoneella naputeltaisi kirjainta kerrallaan vasemmalta oikealle. Amerikkalainen Inception Labs väittää keksineensä paremman tavan.
Yhtiö julkaisi maanantaina Mercury 2:n, ensimmäisen kaupallisen diffuusiopohjaisen päättelykielimallin. Se tuottaa yli tuhat tokenia sekunnissa Nvidian Blackwell-suorittimilla – yli kymmenen kertaa enemmän kuin Anthropicin Claude 4.5 Haiku tai OpenAI:n GPT-5 Mini.
Käytännössä Mercury 2 vastaa vaativaan kysymykseen 1,7 sekunnissa. Claude 4.5 Haikun päättelyversiolla sama kestää 23 sekuntia, Googlen Gemini 3 Flashilla 14 sekuntia. Ero kuulostaa tekniseltä, mutta sillä on suora vaikutus siihen, mitä tekoälyllä voi tehdä.
Miten diffuusiokielimalli toimii?
Perinteinen kielimalli on autoregressiivinen: se ennustaa aina seuraavan sanan edellisten perusteella. Lähestymistapa on intuitiivinen – niin ihmisetkin kirjoittavat. Se on kuitenkin hidas, koska jokainen token joutuu odottamaan vuoroaan.
Diffuusiokielimalli lainaa toimintaperiaatteensa kuvageneraattoreilta. Samalla tavalla kuin Midjourney tai DALL-E aloittaa kohinasta ja kirkastaa kuvan vähitellen, Mercury 2 aloittaa karkeasta tekstiluonnoksesta ja hioo koko vastausta samanaikaisesti useassa kierroksessa.
Teksti syntyy kierros kierrokselta tarkemmaksi. Ensimmäisessä vaiheessa malli tuottaa karkean arvion koko vastauksesta, ja jokainen seuraava kierros tarkentaa sanavalintoja, kielioppia ja sisältöä. Koska malli käsittelee koko vastausta kerralla, se voi hyödyntää kontekstia molempiin suuntiin – toisin kuin perinteinen malli, joka näkee vain vasemmalle.
Inception Labsin toimitusjohtaja Stefano Ermon on yksi diffuusiotekniikan alkuperäisistä kehittäjistä – samat periaatteet toimivat Midjourneyn ja OpenAI:n Soran taustalla. Hänen vertauksensa kuvaa eroa osuvasti: perinteinen malli on kuin kirjuri, joka kirjoittaa tekstiä alusta loppuun pysähtymättä, diffuusiomalli on kuin toimittaja, joka hahmottelee koko jutun ja muokkaa kaikkia kappaleita rinnakkain.
Laatu pysyy, hinta putoaa
Nopeus ei auta, jos vastausten laatu romahtaa. Mercury 2:n tulokset standarditesteissä osoittavat, ettei näin käy – ainakaan kaikilta osin. AIME-matematiikkatestissä malli saa 91 pistettä, kun Googlen Gemini 3 Flash jää 78 pisteeseen. Koodausta mittaavassa LCB-testissä Mercury 2 ohittaa Claude Haikun tuloksella 67 vastaan 62.
Vaativimmissa päättelytehtävissä kuva on toinen. GPQA Diamond -testissä, joka mittaa asiantuntijatason tietämystä, Mercury 2 jää 74 pisteeseen Gemini 3 Flashin 90:stä. Malli ei siis ole paras kaikessa, mutta nopeusero on niin merkittävä, että monissa käyttötapauksissa kompromissi kannattaa.
Hinnoittelu korostaa eroa entisestään. Mercury 2 maksaa 0,25 dollaria miljoonalta syötetokenilta ja 0,75 dollaria miljoonalta tulostetokenilta – neljä kertaa halvempi kuin Claude Haiku syötteissä ja 2,5 kertaa halvempi tulosteissa. Konteksti-ikkuna ulottuu 128 000 tokeniin, ja malli tukee työkalukutsuja sekä JSON-muotoista tulostetta.
Miksi nopeus ratkaisee agenttityössä
Suurimmat käytännön vaikutukset näkyvät tekoälyagenteissa, jotka ketjuttavat mallipyyntöjä peräkkäin. Kun agentti hakee tietoa verkosta, analysoi tulokset, vertaa niitä aiempaan dataan ja kirjoittaa yhteenvedon, jokainen vaihe vaatii oman kutsun kielimallille. Kymmenen peräkkäistä vaihetta Claude Haikun 23 sekunnin vasteajalla vie lähes neljä minuuttia. Mercury 2:n 1,7 sekunnin vasteajalla sama ketju valmistuu alle puolessa minuutissa.
Viive ei ole pelkkä käyttömukavuuskysymys. Se määrittää, millaisia sovelluksia tekoälyllä voi ylipäänsä rakentaa. Reaaliaikaiset puheassistentit, koodaustyökalut jotka ehdottavat korjauksia lennossa ja hakujärjestelmät jotka kokoavat vastauksen useasta lähteestä hyötyvät kaikki nopeammasta päättelystä. Yrityksille halvempi ja nopeampi malli tarkoittaa myös sitä, että tekoälyä voi käyttää tehtäviin, joissa se ei aiemmin ollut taloudellisesti järkevää.
Inception Labsin perustivat vuonna 2024 Stanfordin, UCLA:n ja Cornellin tutkijat. Yhtiö keräsi viime marraskuussa 50 miljoonan dollarin rahoituksen, jonka sijoittajiin lukeutuvat Nvidian, Microsoftin ja Snowflaken pääomarahastot sekä tekoälyalan tunnetut nimet Andrew Ng ja Andrej Karpathy. Mercury 2 on saatavilla yhtiön rajapinnan kautta, joka on yhteensopiva OpenAI:n rajapinnan kanssa.



