Vuoro-ajattelun loppu
Mira Murati esitteli 11. toukokuuta Thinking Machines Labin ensimmäisen julkisen mallin nimeltä TML-Interaction-Small. Kyseessä on 276 miljardin parametrin Mixture-of-Experts -arkkitehtuuri, josta aktiivisena on kerrallaan 12 miljardia parametria. Yhtiön väite on terävä: nykyiset puhe-AI:t on rakennettu väärän idean varaan.
Tähän asti reaaliaikainen puhe-AI on tarkoittanut ketjua, jossa puheentunnistin litteroi äänen tekstiksi, kielimalli vastaa ja puhesynteesi lukee vastauksen ääneen. Kaiken yllä pyörii VAD-komponentti (Voice Activity Detection), joka päättelee milloin käyttäjä on lopettanut puhumisensa. Vasta sitten malli saa luvan vastata. Tätä rajaa kutsutaan puheentunnistuksessa nimellä turn boundary.
Thinking Machines väittää, että koko rakenne on virhe. Vuoron raja ei ole keskustelun perusyksikkö, vaan keinotekoinen sopimus, jonka tekstipohjaiset järjestelmät ovat jättäneet perinnöksi puheelle.
Miksi 0,4 sekuntia on iso luku
Mittauksissa TML-Interaction-Small vastaa keskimäärin 0,4 sekunnissa. OpenAI:n GPT-Realtime-2.0 tarvitsee samaan tehtävään 1,18 sekuntia. Kolminkertainen ero ei kuulosta dramaattiselta laboratoriossa, mutta keskustelussa raja kulkee noin 600 millisekunnin tienoilla: sen alapuolella vuorovaikutus tuntuu luontevalta puhelinpuhelulta, yläpuolella robotilta.
Thinking Machinesin ratkaisu ei ole pelkkä optimoitu putki vaan eri lähestymistapa. Malli käsittelee 200 millisekunnin mikrovuoroja, joissa se lukee syötteen ja tuottaa puhetta yhtaikaisesti. Vuororajaa ei määritä enää erillinen VAD-luokitin, vaan malli itse on opetettu päättämään milloin puhua, milloin pitää tauko ja milloin jatkaa kuuntelemista.
Yhtiön julkaisemassa FD-bench v1.5 -mittauksessa malli sai 77,8 pistettä, kun Gemini ylsi 54,3:een ja GPT-Realtime-2.0 jäi 47,8:aan. Audio MultiChallenge -älykkyystestissä tulos oli 43,4 prosenttia. Lukujen takana on toinenkin oivallus: malli on jaettu kahteen osaan. Vuorovaikutusmalli pysyy linjalla käyttäjän kanssa, taustamalli puolestaan hoitaa raskaamman päättelyn ja työkalukutsut omassa rauhassaan.
Mikä on turn boundary?
Puheentunnistuksessa turn boundary tarkoittaa hetkeä, jolloin järjestelmä päättää että puhuja on lopettanut ja toisen osapuolen vuoro alkaa. Perinteinen VAD-luokitin etsii puheesta riittävän pitkää hiljaista jaksoa. Ihmiset tunnistavat vuoron loppumisen kuitenkin myös intonaatiosta, sisällöstä ja kontekstista – usein jo ennen kuin viimeinen sana on lausuttu.
Mitä Speechlystä jäi
Suomesta katsottuna käännekohta on tylysti ohi. Helsinkiläinen Speechly, jonka perustivat Siri- ja Alexa-taustaiset insinöörit, oli vuosina 2016–2023 Euroopan kunnianhimoisin streaming-puheentunnistuksen kehittäjä. Yhtiön Spoken Language Understanding -rajapinta perustui juuri siihen ajatukseen, että äänestä saa merkityksiä irti jo ennen kuin lause loppuu. Roblox osti Speechlyn syyskuussa 2023 vahvistaakseen pelialustansa ääniviestien moderointia.
Speechlyn alkuperäinen arkkitehtuuri oli kuitenkin edelleen ketjumalli – tehokkaampi versio samasta vuoropohjaisesta logiikasta, jonka Thinking Machines nyt julistaa vanhentuneeksi. Suomalainen osaaminen reaaliaikaisesta puheentunnistuksesta ei katoa minnekään, mutta sen kaupallinen ydin on siirtynyt yhden ison toimijan sisälle ja toiseen ongelmakenttään. Jos uusi laite tai sovellus rakennetaan vuonna 2026, kysymys ei enää ole miten saamme litteroinnin tarpeeksi nopeaksi, vaan saammeko yhden mallin, joka osaa puhua ja kuunnella samalla kertaa.



