Tekoäly

Murati paljasti mallin, joka vastaa 0,4 sekunnissa

Thinking Machines Labin malli käsittelee puhetta ja kuvaa 200 ms paloina

Aino AikajärviAino Aikajärvi
Jaa:
Murati paljasti mallin, joka vastaa 0,4 sekunnissa

Thinking Machines Lab, entisen OpenAI:n teknologiajohtajan Mira Muratin viime vuonna perustama yritys, julkisti tiistaina ensimmäisen mallinsa. TML-Interaction-Small kuuntelee, katsoo ja vastaa samanaikaisesti 200 millisekunnin paloina, ja sen keskimääräinen vastausviive jää 0,40 sekuntiin.

Yhtiö kutsuu mallia "interaction modeliksi" ja väittää, että koko tähänastinen puhemalliarkkitehtuuri on perustunut väärälle oletukselle: että keskustelu olisi vuoropuhelua, jossa toinen vaikenee toisen puhuessa. Muratin tiimin mielestä luonteva keskustelu vaatii sitä, että malli kuuntelee ja vastaa samaan aikaan.

Realtime ja Live jäävät 0,4 sekuntiin

Vertailussa ero on selvä. OpenAI:n GPT Realtime-2.0:n kevyin variantti vastaa Thinking Machinesin omassa FD-bench V1 -mittauksessa 1,18 sekunnin viiveellä. Googlen Gemini Live -tila asettuu samoille seuduille. Muratin mallin 0,40 sekuntia on käytännössä kolme kertaa nopeampi, ja Audio MultiChallenge -testissä se pääsee 43,4 prosenttiin, kun OpenAI:n vastaava jää 37,6 prosenttiin.

Mittari ei ole neutraali, koska Thinking Machines on itse rakentanut FD-bench V1:n. Riippumattomia testituloksia ei vielä ole, ja niiden saaminen on lähikuukausien tärkein avoin kysymys.

200 millisekunnin pala on viidesosa sekuntia

Mallin sisällä syöte ja vastaus pilkotaan 200 millisekunnin paloihin. Kun käyttäjä aloittaa puheen, malli ei odota lauseen loppua vaan käsittelee jokaisen viidesosasekunnin pituisen palan välittömästi. Vastauksen tuottaminen alkaa samaan tahtiin, joten malli voi heittää lyhyitä myöntymisiä kuten "aivan" tai "mm" kesken käyttäjän puheen keskeyttämättä.

Tekninen rakenne yhdistää kolme ratkaisua. Ääni koodataan dMel-upotuksina ilman erillistä enkooderia, video pilkotaan 40 kertaa 40 pikselin paloiksi, ja kaikki modaliteetit koulutetaan yhtenä virtana alusta asti. Inferenssivaiheessa streamattu sessio kasaa palat pysyvään GPU-muistiin sen sijaan, että muisti varattaisiin aina uudelleen. Mallissa on 276 miljardia parametria, joista aktiivisia kerrallaan 12 miljardia – kyseessä on MoE-arkkitehtuuri (Mixture of Experts).

“Vuorovaikutuksen pitäisi skaalautua älykkyyden mukana. Tähänastinen kehitys on keskittynyt pidempiin agenttitehtäviin, ei luontevaan ihmisen ja koneen yhteistyöhön.”

— Thinking Machines Lab, Interaction Models -julkaisu

Ihmisen vuoropuhelutauko on 200 millisekuntia

Kahden ihmispuhujan välinen luonnollinen tauko on tutkimuksissa noin 200 millisekuntia ja venyy tilanteen mukaan vajaaseen sekuntiin. Muratin mallin 0,40 sekuntia osuu samaan haarukkaan ja tuntuu korvassa keskustelulta. OpenAI:n ja Geminin yli sekunnin viive kuulostaa sen rinnalla konemaiselta, kun tauko venyttää keskustelun rytmin nykäykseksi.

Pelkkä nopeus ei kuitenkaan riitä. Thinking Machines yhdistää reaaliaikaisen vastausmallin asynkroniseen päättelymalliin, joka pohtii monimutkaisia kysymyksiä taustalla samaan aikaan kun puhuminen jatkuu. Käyttäjä ei jää odottamaan pitkän kysymyksen kohdalla, vaan saa heti välivastauksen ja syvemmän analyysin perään.

Suomalaiselle puhepalvelulle kovempi rima

Suomessa on rakennettu reaaliaikaista ääniteknologiaa pidempään kuin moni muistaa. Helsinkiläinen Speechly kehitti vuosina 2016–2023 reaaliaikaisia ääniliittymiä ennen kuin Roblox osti yhtiön kolmen vuoden takaa. Aalto-yliopiston puheteknologian tutkimusryhmä on ollut keskeisessä asemassa eurooppalaisen puheentunnistuksen kehityksessä, ja sen oppilaita istuu nyt useassa suomalaisessa ääniteknologiayrityksessä.

Käytännön tasolla suomalainen pankin asiakaspalvelubotti tai apteekkiketjun reseptipuhelin, joka pyörii nyt vuoropuhelulogiikalla OpenAI:n Realtime-rajapinnan päällä, joutuu pian valitsemaan: pysyäkö yli sekunnin viiveessä vai siirtyä Muratin malliin sen avatessa rajapintansa. Ero kuuluu asiakkaan korvaan jokaisessa puhelussa, eikä robotti enää keskeytä luuria pitäessään liian aikaisin.

Mallista on luvassa rajoitettu ennakkojulkaisu lähikuukausien aikana ja laajempi avaus loppuvuonna 2026. Hinnoittelusta ja rajapinnan yksityiskohdista Thinking Machines ei vielä kerro.

Sanasto

MoE (Mixture of Experts)
Tekoälymalliarkkitehtuuri, jossa valtava malli on jaettu osiin ja kerralla aktivoituu vain pieni osa parametreista. Säästää laskentatehoa ilman että älykkyys kärsii.
Modaliteetti
Tiedon muoto, kuten teksti, ääni tai video. Multimodaalinen malli osaa käsitellä useita näistä samanaikaisesti.
Latenssi (vastausviive)
Aika, joka kuluu kysymyksen päättymisestä siihen, kun malli alkaa vastata. Puhelussa pieni latenssi tuntuu luontevalta, suuri kömpelöltä.

Muratin ensimmäinen ulospäin näkyvä siirto

Murati jätti OpenAI:n teknologiajohtajan paikan syksyllä 2024 ja perusti Thinking Machines Labin alkuvuodesta 2025. Yhtiö keräsi miljardiluokan alkurahoituksen ja palkkasi tusinoittain tutkijoita OpenAI:lta ja Anthropicilta. Interaction model on yhtiön ensimmäinen julkinen tuote noin puolentoista vuoden hiljaiselon jälkeen.

Argumentti Muratin takana puree, jos malli pitää lupauksensa todellisissa puheluissa eikä vain yhtiön omissa mittauksissa. Riippumattomat testit ratkaisevat lähikuukausina, onko OpenAI todella ohittanut sokean pisteen vai onko Muratin malli pieni parannus samaan kaavaan.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.