Tutkimus

Muratin AI puhuu ja kuuntelee yhtä aikaa

TML-Interaction-Small vastaa 0,4 sekunnissa – kolme kertaa nopeammin kuin GPT-Realtime-2.0.

Hanna HuulivuoHanna Huulivuo
Jaa:
Muratin AI puhuu ja kuuntelee yhtä aikaa

Vuoro-ajattelun loppu

Mira Murati esitteli 11. toukokuuta Thinking Machines Labin ensimmäisen julkisen mallin nimeltä TML-Interaction-Small. Kyseessä on 276 miljardin parametrin Mixture-of-Experts -arkkitehtuuri, josta aktiivisena on kerrallaan 12 miljardia parametria. Yhtiön väite on terävä: nykyiset puhe-AI:t on rakennettu väärän idean varaan.

Tähän asti reaaliaikainen puhe-AI on tarkoittanut ketjua, jossa puheentunnistin litteroi äänen tekstiksi, kielimalli vastaa ja puhesynteesi lukee vastauksen ääneen. Kaiken yllä pyörii VAD-komponentti (Voice Activity Detection), joka päättelee milloin käyttäjä on lopettanut puhumisensa. Vasta sitten malli saa luvan vastata. Tätä rajaa kutsutaan puheentunnistuksessa nimellä turn boundary.

Thinking Machines väittää, että koko rakenne on virhe. Vuoron raja ei ole keskustelun perusyksikkö, vaan keinotekoinen sopimus, jonka tekstipohjaiset järjestelmät ovat jättäneet perinnöksi puheelle.

Miksi 0,4 sekuntia on iso luku

Mittauksissa TML-Interaction-Small vastaa keskimäärin 0,4 sekunnissa. OpenAI:n GPT-Realtime-2.0 tarvitsee samaan tehtävään 1,18 sekuntia. Kolminkertainen ero ei kuulosta dramaattiselta laboratoriossa, mutta keskustelussa raja kulkee noin 600 millisekunnin tienoilla: sen alapuolella vuorovaikutus tuntuu luontevalta puhelinpuhelulta, yläpuolella robotilta.

Thinking Machinesin ratkaisu ei ole pelkkä optimoitu putki vaan eri lähestymistapa. Malli käsittelee 200 millisekunnin mikrovuoroja, joissa se lukee syötteen ja tuottaa puhetta yhtaikaisesti. Vuororajaa ei määritä enää erillinen VAD-luokitin, vaan malli itse on opetettu päättämään milloin puhua, milloin pitää tauko ja milloin jatkaa kuuntelemista.

Yhtiön julkaisemassa FD-bench v1.5 -mittauksessa malli sai 77,8 pistettä, kun Gemini ylsi 54,3:een ja GPT-Realtime-2.0 jäi 47,8:aan. Audio MultiChallenge -älykkyystestissä tulos oli 43,4 prosenttia. Lukujen takana on toinenkin oivallus: malli on jaettu kahteen osaan. Vuorovaikutusmalli pysyy linjalla käyttäjän kanssa, taustamalli puolestaan hoitaa raskaamman päättelyn ja työkalukutsut omassa rauhassaan.

Mikä on turn boundary?

Puheentunnistuksessa turn boundary tarkoittaa hetkeä, jolloin järjestelmä päättää että puhuja on lopettanut ja toisen osapuolen vuoro alkaa. Perinteinen VAD-luokitin etsii puheesta riittävän pitkää hiljaista jaksoa. Ihmiset tunnistavat vuoron loppumisen kuitenkin myös intonaatiosta, sisällöstä ja kontekstista – usein jo ennen kuin viimeinen sana on lausuttu.

Mitä Speechlystä jäi

Suomesta katsottuna käännekohta on tylysti ohi. Helsinkiläinen Speechly, jonka perustivat Siri- ja Alexa-taustaiset insinöörit, oli vuosina 2016–2023 Euroopan kunnianhimoisin streaming-puheentunnistuksen kehittäjä. Yhtiön Spoken Language Understanding -rajapinta perustui juuri siihen ajatukseen, että äänestä saa merkityksiä irti jo ennen kuin lause loppuu. Roblox osti Speechlyn syyskuussa 2023 vahvistaakseen pelialustansa ääniviestien moderointia.

Speechlyn alkuperäinen arkkitehtuuri oli kuitenkin edelleen ketjumalli – tehokkaampi versio samasta vuoropohjaisesta logiikasta, jonka Thinking Machines nyt julistaa vanhentuneeksi. Suomalainen osaaminen reaaliaikaisesta puheentunnistuksesta ei katoa minnekään, mutta sen kaupallinen ydin on siirtynyt yhden ison toimijan sisälle ja toiseen ongelmakenttään. Jos uusi laite tai sovellus rakennetaan vuonna 2026, kysymys ei enää ole miten saamme litteroinnin tarpeeksi nopeaksi, vaan saammeko yhden mallin, joka osaa puhua ja kuunnella samalla kertaa.

Sanasto

Mixture-of-Experts (MoE)
Arkkitehtuuri jossa malli koostuu useasta erikoistuneesta 'asiantuntijasta', joista vain pieni osa aktivoituu kerrallaan. Tämä tekee suuristakin malleista nopeampia ja halvempia ajaa.
VAD (Voice Activity Detection)
Puheentunnistuksen osa, joka päättelee koska puhuja on aloittanut tai lopettanut puhumisen. Perinteisesti se etsii ääniraidasta hiljaisia jaksoja.
Latenssi (vastausviive)
Aika joka kuluu käyttäjän kysymyksen ja tekoälyn vastauksen alkamisen välillä. Alle 600 millisekunnin viive tuntuu keskustelussa luontevalta.

Kenelle tällä on väliä

Tavalliselle käyttäjälle muutos näkyy siinä, että ääniavustajan kanssa voi vihdoin keskeyttää, palata aiheeseen tai puhua päälle ilman että koko vuorovaikutus rikkoutuu. Kontaktikeskuksille ja terveydenhuollon sanelupalveluille muutos on perustavanlaatuisempi: jos sama malli hoitaa kuuntelun, ymmärtämisen ja vastaamisen yhdessä, nykyinen toimittajaketju Deepgramista AssemblyAI:hin ja ElevenLabsiin joutuu miettimään asemansa uudelleen.

Suomessa tämä koskee erityisesti yrityksiä, jotka rakentavat sote-sektorin sanelu- ja päivystystyökaluja Whisper-pohjaisten putkien päälle. Heille Muratin julkaisu on muistutus, että seuraavan 18 kuukauden aikana ostaminen voi olla fiksumpaa kuin rakentaminen. Thinking Machines lupaa rajatun tutkimuskäytön kesän aikana ja laajemman julkaisun loppuvuodesta 2026.

Yksi olennainen kysymys jää avoimeksi: mitä kieliä malli osaa. Toistaiseksi julkisissa demoissa on kuultu vain englantia. Suomi on edelleen tukirakenteiden varassa, ja siinä riittää työtä myös vuoroperiaatteen jälkeen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  4. 4Datakeskus söisi Lapinlahdella kokonaisen kaupungin sähköt
  5. 5Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.