Thinking Machines Lab, entisen OpenAI:n teknologiajohtajan Mira Muratin viime vuonna perustama yritys, julkisti tiistaina ensimmäisen mallinsa. TML-Interaction-Small kuuntelee, katsoo ja vastaa samanaikaisesti 200 millisekunnin paloina, ja sen keskimääräinen vastausviive jää 0,40 sekuntiin.
Yhtiö kutsuu mallia "interaction modeliksi" ja väittää, että koko tähänastinen puhemalliarkkitehtuuri on perustunut väärälle oletukselle: että keskustelu olisi vuoropuhelua, jossa toinen vaikenee toisen puhuessa. Muratin tiimin mielestä luonteva keskustelu vaatii sitä, että malli kuuntelee ja vastaa samaan aikaan.
Realtime ja Live jäävät 0,4 sekuntiin
Vertailussa ero on selvä. OpenAI:n GPT Realtime-2.0:n kevyin variantti vastaa Thinking Machinesin omassa FD-bench V1 -mittauksessa 1,18 sekunnin viiveellä. Googlen Gemini Live -tila asettuu samoille seuduille. Muratin mallin 0,40 sekuntia on käytännössä kolme kertaa nopeampi, ja Audio MultiChallenge -testissä se pääsee 43,4 prosenttiin, kun OpenAI:n vastaava jää 37,6 prosenttiin.
Mittari ei ole neutraali, koska Thinking Machines on itse rakentanut FD-bench V1:n. Riippumattomia testituloksia ei vielä ole, ja niiden saaminen on lähikuukausien tärkein avoin kysymys.
200 millisekunnin pala on viidesosa sekuntia
Mallin sisällä syöte ja vastaus pilkotaan 200 millisekunnin paloihin. Kun käyttäjä aloittaa puheen, malli ei odota lauseen loppua vaan käsittelee jokaisen viidesosasekunnin pituisen palan välittömästi. Vastauksen tuottaminen alkaa samaan tahtiin, joten malli voi heittää lyhyitä myöntymisiä kuten "aivan" tai "mm" kesken käyttäjän puheen keskeyttämättä.
Tekninen rakenne yhdistää kolme ratkaisua. Ääni koodataan dMel-upotuksina ilman erillistä enkooderia, video pilkotaan 40 kertaa 40 pikselin paloiksi, ja kaikki modaliteetit koulutetaan yhtenä virtana alusta asti. Inferenssivaiheessa streamattu sessio kasaa palat pysyvään GPU-muistiin sen sijaan, että muisti varattaisiin aina uudelleen. Mallissa on 276 miljardia parametria, joista aktiivisia kerrallaan 12 miljardia – kyseessä on MoE-arkkitehtuuri (Mixture of Experts).
“Vuorovaikutuksen pitäisi skaalautua älykkyyden mukana. Tähänastinen kehitys on keskittynyt pidempiin agenttitehtäviin, ei luontevaan ihmisen ja koneen yhteistyöhön.”
Ihmisen vuoropuhelutauko on 200 millisekuntia
Kahden ihmispuhujan välinen luonnollinen tauko on tutkimuksissa noin 200 millisekuntia ja venyy tilanteen mukaan vajaaseen sekuntiin. Muratin mallin 0,40 sekuntia osuu samaan haarukkaan ja tuntuu korvassa keskustelulta. OpenAI:n ja Geminin yli sekunnin viive kuulostaa sen rinnalla konemaiselta, kun tauko venyttää keskustelun rytmin nykäykseksi.
Pelkkä nopeus ei kuitenkaan riitä. Thinking Machines yhdistää reaaliaikaisen vastausmallin asynkroniseen päättelymalliin, joka pohtii monimutkaisia kysymyksiä taustalla samaan aikaan kun puhuminen jatkuu. Käyttäjä ei jää odottamaan pitkän kysymyksen kohdalla, vaan saa heti välivastauksen ja syvemmän analyysin perään.



