Tekoäly

Alibaban malli koodaa pelkällä puheella

Qwen 3.5-Omni ymmärtää ääntä, kuvaa ja videota – ja päihittää Geminin

Aino AikajärviAino Aikajärvi
Jaa:
Alibaban malli koodaa pelkällä puheella

Puheella koodausta ja 10 tunnin ääniraitoja

Alibaba julkaisi 30. maaliskuuta Qwen 3.5-Omni -mallin, joka yhdistää tekstin, kuvien, äänen ja videon käsittelyn yhteen järjestelmään. Kiinalainen teknologiajätti haastaa sillä suoraan Googlen Gemini 3.1 Pron, ja ainakin äänen ymmärtämisessä tulos on selvä: Qwen voittaa.

Mallin kiinnostavin uutuus on niin sanottu audio-visuaalinen koodaus. Käyttäjä voi kuvata ideansa puheella, näyttää näyttötallenteen ja saada mallilta toimivan koodin. Alibaban tutkijat kertovat, ettei ominaisuutta erikseen opetettu – se syntyi sivutuotteena, kun mallia koulutettiin yli sadalla miljoonalla tunnilla audio-visuaalista dataa.

Näytä video, kerro ääneen – koodi syntyy

Perinteinen koodaus tekoälyllä toimii niin, että kirjoitat tekstikehotteen ja malli tuottaa koodin. Qwen 3.5-Omni rikkoo tämän kaavan. Sen audio-visuaalinen koodaus yhdistää puheen ja videon: voit tallentaa näyttövideon ohjelmasta, selittää ääneen mikä siinä on vialla ja pyytää mallia korjaamaan ongelman.

Alibaban demoissa malli rakentaa toimivan matopelin pelkän suullisen kuvauksen ja videoklippin perusteella. Toinen esimerkki näyttää, miten kehittäjä tallentaa videon käyttöliittymästä, kuvailee puheella halutut muutokset, ja malli tuottaa korjatun koodin. Näppäimistöön ei tarvitse koskea.

Käytännössä tämä madaltaa koodaamisen kynnystä entisestään. Jos osaat selittää ongelman ääneen ja näyttää sen ruudulta, malli hoitaa loput. Ominaisuus on vielä varhainen, mutta suunta on selvä: ohjelmointityöstä on tulossa yhä enemmän vuoropuhelua koneen kanssa.

Ajattelija ja puhuja yhteistyössä

Qwen 3.5-Omni koostuu kahdesta osasta. Ajattelija (Thinker) vastaanottaa kaiken syötteen – tekstin, kuvat, äänen ja videon – ja tuottaa päättelyketjun. Puhuja (Talker) muuntaa päättelyn luonnolliseksi puheeksi reaaliajassa. Viive on parhaimmillaan vain 234 millisekuntia.

Plus-versio hyödyntää Mixture of Experts -tekniikkaa, jossa vain osa mallin parametreista aktivoituu kerrallaan. Tämä säästää muistia ja nopeuttaa päättelyä ilman, että laatu kärsii.

Mallin 256 000 tokenin konteksti-ikkuna mahdollistaa yli 10 tunnin ääniraidan tai noin kuuden ja puolen minuutin 720p-videon käsittelyn kerralla. Mallille voi siis syöttää kokonaisen podcastin tai pitkän kokouksen nauhoitteen ja pyytää tiivistelmää, käännöstä tai analyysia yhdellä kehotteella.

Puheentunnistus toimii 113 kielellä ja murteella, kun edellisessä versiossa kieliä oli vain 19. Malli tuottaa puhetta 36 kielellä. Mukana on myös äänen kloonaus: käyttäjä voi ladata ääninäytteen, ja malli vastaa samalla äänellä.

Gemini häviää äänessä, voittaa videossa

Alibaban mukaan Qwen 3.5-Omni Plus saavuttaa parhaan tuloksen 215 vertailukokeessa. Ääniymmärryksessä malli ohittaa Googlen Gemini 3.1 Pron useissa testeissä: MMAU-testissä tulos on 82,2 vastaan 81,1 ja VoiceBench-testissä 93,1 vastaan 88,9.

Puheentunnistuksessa ero on paikoin valtava. Kiinan kantonin murteessa Qwenin virheprosentti on 1,95, kun Geminin luku on 13,40. Laajemmassa 60 kielen vertailussa Qwen pärjää niin ikään paremmin: 6,55 vastaan 7,32.

Videopuolella tilanne tasoittuu. Gemini 3.1 Pro johtaa esimerkiksi VideoMME-testissä äänen kanssa (89,0 vs. 83,7) ja WorldSense-testissä (65,5 vs. 62,8). Kyseessä ei siis ole yksipuolinen voitto – molemmat mallit ovat vahvoja eri osa-alueilla.

Sanasto

Token
Tekstin perusyksikkö, jonka kielimalli käsittelee. Yksi token on noin ¾ englanninkielistä sanaa eli suomeksi noin puoli sanaa.
Konteksti-ikkuna
Tietomäärä, jonka tekoälymalli pystyy käsittelemään kerralla. Mitä suurempi ikkuna, sitä pidempiä tekstejä, ääniraitoja tai videoita malli voi vastaanottaa yhdellä kertaa.
Mixture of Experts
Asiantuntijasekoitus – tekoälymallitekniikka, jossa malli koostuu useista erikoistuneista osista ja vain osa niistä aktivoituu kullekin tehtävälle. Tekee mallista nopeamman ilman laadun heikkenemistä.

Kolme versiota, kolme käyttötarkoitusta

Qwen 3.5-Omni on avoimen lähdekoodin malli, ja se on saatavilla kolmena versiona. Plus on tarkoitettu vaativimpiin tehtäviin ja vaatii vähintään 40 gigatavua videomuistia. Flash on optimoitu reaaliaikaiseen vuorovaikutukseen ja tuotantokäyttöön. Light on kevyin versio, joka soveltuu mobiililaitteille ja reunalaskentaan.

Suomalaisille kehittäjille ja yrityksille malli avaa käytännön mahdollisuuksia. Pitkä konteksti-ikkuna tekee siitä käyttökelpoisen kokousten ja haastattelujen käsittelyyn. Puhekoodaus voi madaltaa kynnystä erityisesti niille, jotka eivät ole ammattiohjelmoijia mutta haluavat automatisoida rutiinitehtäviään.

Alibaban julkaisu kertoo, mihin multimodaalimallien kilpailu on menossa. Ääni ja video ovat nousemassa tekstin rinnalle ensisijaisiksi syötteiksi. Google, OpenAI ja Alibaba kilpailevat nyt siitä, kenen malli ymmärtää parhaiten maailmaa, jossa tieto tulee yhtä aikaa monessa muodossa – ja kenen malli osaa toimia sen perusteella.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.