Koneoppiminen

Kielimalli joka ei kirjoita sanaa kerrallaan

Yli tuhat tokenia sekunnissa – kymmenen kertaa nopeampi kuin GPT-5 Mini.

Hanna HuulivuoHanna Huulivuo
Jaa:
Kielimalli joka ei kirjoita sanaa kerrallaan

Perinteiset kielimallit tuottavat tekstiä sana kerrallaan. Jokainen uusi token syntyy edellisen pohjalta, kuin kirjoituskoneella naputeltaisi kirjainta kerrallaan vasemmalta oikealle. Amerikkalainen Inception Labs väittää keksineensä paremman tavan.

Yhtiö julkaisi maanantaina Mercury 2:n, ensimmäisen kaupallisen diffuusiopohjaisen päättelykielimallin. Se tuottaa yli tuhat tokenia sekunnissa Nvidian Blackwell-suorittimilla – yli kymmenen kertaa enemmän kuin Anthropicin Claude 4.5 Haiku tai OpenAI:n GPT-5 Mini.

Käytännössä Mercury 2 vastaa vaativaan kysymykseen 1,7 sekunnissa. Claude 4.5 Haikun päättelyversiolla sama kestää 23 sekuntia, Googlen Gemini 3 Flashilla 14 sekuntia. Ero kuulostaa tekniseltä, mutta sillä on suora vaikutus siihen, mitä tekoälyllä voi tehdä.

Miten diffuusiokielimalli toimii?

Perinteinen kielimalli on autoregressiivinen: se ennustaa aina seuraavan sanan edellisten perusteella. Lähestymistapa on intuitiivinen – niin ihmisetkin kirjoittavat. Se on kuitenkin hidas, koska jokainen token joutuu odottamaan vuoroaan.

Diffuusiokielimalli lainaa toimintaperiaatteensa kuvageneraattoreilta. Samalla tavalla kuin Midjourney tai DALL-E aloittaa kohinasta ja kirkastaa kuvan vähitellen, Mercury 2 aloittaa karkeasta tekstiluonnoksesta ja hioo koko vastausta samanaikaisesti useassa kierroksessa.

Teksti syntyy kierros kierrokselta tarkemmaksi. Ensimmäisessä vaiheessa malli tuottaa karkean arvion koko vastauksesta, ja jokainen seuraava kierros tarkentaa sanavalintoja, kielioppia ja sisältöä. Koska malli käsittelee koko vastausta kerralla, se voi hyödyntää kontekstia molempiin suuntiin – toisin kuin perinteinen malli, joka näkee vain vasemmalle.

Inception Labsin toimitusjohtaja Stefano Ermon on yksi diffuusiotekniikan alkuperäisistä kehittäjistä – samat periaatteet toimivat Midjourneyn ja OpenAI:n Soran taustalla. Hänen vertauksensa kuvaa eroa osuvasti: perinteinen malli on kuin kirjuri, joka kirjoittaa tekstiä alusta loppuun pysähtymättä, diffuusiomalli on kuin toimittaja, joka hahmottelee koko jutun ja muokkaa kaikkia kappaleita rinnakkain.

Laatu pysyy, hinta putoaa

Nopeus ei auta, jos vastausten laatu romahtaa. Mercury 2:n tulokset standarditesteissä osoittavat, ettei näin käy – ainakaan kaikilta osin. AIME-matematiikkatestissä malli saa 91 pistettä, kun Googlen Gemini 3 Flash jää 78 pisteeseen. Koodausta mittaavassa LCB-testissä Mercury 2 ohittaa Claude Haikun tuloksella 67 vastaan 62.

Vaativimmissa päättelytehtävissä kuva on toinen. GPQA Diamond -testissä, joka mittaa asiantuntijatason tietämystä, Mercury 2 jää 74 pisteeseen Gemini 3 Flashin 90:stä. Malli ei siis ole paras kaikessa, mutta nopeusero on niin merkittävä, että monissa käyttötapauksissa kompromissi kannattaa.

Hinnoittelu korostaa eroa entisestään. Mercury 2 maksaa 0,25 dollaria miljoonalta syötetokenilta ja 0,75 dollaria miljoonalta tulostetokenilta – neljä kertaa halvempi kuin Claude Haiku syötteissä ja 2,5 kertaa halvempi tulosteissa. Konteksti-ikkuna ulottuu 128 000 tokeniin, ja malli tukee työkalukutsuja sekä JSON-muotoista tulostetta.

Miksi nopeus ratkaisee agenttityössä

Suurimmat käytännön vaikutukset näkyvät tekoälyagenteissa, jotka ketjuttavat mallipyyntöjä peräkkäin. Kun agentti hakee tietoa verkosta, analysoi tulokset, vertaa niitä aiempaan dataan ja kirjoittaa yhteenvedon, jokainen vaihe vaatii oman kutsun kielimallille. Kymmenen peräkkäistä vaihetta Claude Haikun 23 sekunnin vasteajalla vie lähes neljä minuuttia. Mercury 2:n 1,7 sekunnin vasteajalla sama ketju valmistuu alle puolessa minuutissa.

Viive ei ole pelkkä käyttömukavuuskysymys. Se määrittää, millaisia sovelluksia tekoälyllä voi ylipäänsä rakentaa. Reaaliaikaiset puheassistentit, koodaustyökalut jotka ehdottavat korjauksia lennossa ja hakujärjestelmät jotka kokoavat vastauksen useasta lähteestä hyötyvät kaikki nopeammasta päättelystä. Yrityksille halvempi ja nopeampi malli tarkoittaa myös sitä, että tekoälyä voi käyttää tehtäviin, joissa se ei aiemmin ollut taloudellisesti järkevää.

Inception Labsin perustivat vuonna 2024 Stanfordin, UCLA:n ja Cornellin tutkijat. Yhtiö keräsi viime marraskuussa 50 miljoonan dollarin rahoituksen, jonka sijoittajiin lukeutuvat Nvidian, Microsoftin ja Snowflaken pääomarahastot sekä tekoälyalan tunnetut nimet Andrew Ng ja Andrej Karpathy. Mercury 2 on saatavilla yhtiön rajapinnan kautta, joka on yhteensopiva OpenAI:n rajapinnan kanssa.

Kokeile itse

Mercury 2:ta voi kokeilla Inception Labsin sivuilla osoitteessa inceptionlabs.ai – joko chat-käyttöliittymän kautta tai hakemalla API-käyttöoikeutta. Rajapinta on yhteensopiva OpenAI:n kirjastojen kanssa, joten käyttöönotto vaatii vain API-osoitteen vaihtamisen.

Sanasto

Token
Tekstin perusyksikkö jonka kielimalli käsittelee. Yksi token on noin ¾ englanninkielistä sanaa eli suomeksi noin puoli sanaa.
Konteksti-ikkuna
Tekstimäärä jonka kielimalli pystyy käsittelemään yhdellä kertaa. Mitä suurempi ikkuna, sitä pidempiä keskusteluja ja dokumentteja malli ymmärtää.

Riittävän hyvä, riittävän nopeasti

Diffuusiopohjaiset kielimallit ovat vielä tuore ilmiö, eikä Mercury 2 syrjäytä perinteisiä malleja kaikissa tehtävissä. Monimutkaisessa loogisessa päättelyssä autoregressiiviset mallit pitävät pintansa, koska vaiheittainen ajattelu sopii luonnostaan sana kerrallaan -arkkitehtuuriin. Inception Labs ei myöskään ole yksin kentällä – myös Apple ja useat yliopistojen tutkimusryhmät kehittävät omia diffuusiokielimallejaan.

Mercury 2 on kuitenkin ensimmäinen, joka on kaupallistettu ja jonka suorituskyky kestää vertailun vakiintuneiden mallien kanssa. Tekoälysovellukset siirtyvät yksittäisistä kyselyistä kohti monivaiheisia työnkulkuja, joissa malli tekee kymmeniä päätöksiä peräkkäin. Siinä kilpailussa ratkaisevaa ei ole pelkästään se, kuka ajattelee parhaiten, vaan kuka ajattelee riittävän hyvin riittävän nopeasti.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.