Puheella koodausta ja 10 tunnin ääniraitoja
Alibaba julkaisi 30. maaliskuuta Qwen 3.5-Omni -mallin, joka yhdistää tekstin, kuvien, äänen ja videon käsittelyn yhteen järjestelmään. Kiinalainen teknologiajätti haastaa sillä suoraan Googlen Gemini 3.1 Pron, ja ainakin äänen ymmärtämisessä tulos on selvä: Qwen voittaa.
Mallin kiinnostavin uutuus on niin sanottu audio-visuaalinen koodaus. Käyttäjä voi kuvata ideansa puheella, näyttää näyttötallenteen ja saada mallilta toimivan koodin. Alibaban tutkijat kertovat, ettei ominaisuutta erikseen opetettu – se syntyi sivutuotteena, kun mallia koulutettiin yli sadalla miljoonalla tunnilla audio-visuaalista dataa.
Näytä video, kerro ääneen – koodi syntyy
Perinteinen koodaus tekoälyllä toimii niin, että kirjoitat tekstikehotteen ja malli tuottaa koodin. Qwen 3.5-Omni rikkoo tämän kaavan. Sen audio-visuaalinen koodaus yhdistää puheen ja videon: voit tallentaa näyttövideon ohjelmasta, selittää ääneen mikä siinä on vialla ja pyytää mallia korjaamaan ongelman.
Alibaban demoissa malli rakentaa toimivan matopelin pelkän suullisen kuvauksen ja videoklippin perusteella. Toinen esimerkki näyttää, miten kehittäjä tallentaa videon käyttöliittymästä, kuvailee puheella halutut muutokset, ja malli tuottaa korjatun koodin. Näppäimistöön ei tarvitse koskea.
Käytännössä tämä madaltaa koodaamisen kynnystä entisestään. Jos osaat selittää ongelman ääneen ja näyttää sen ruudulta, malli hoitaa loput. Ominaisuus on vielä varhainen, mutta suunta on selvä: ohjelmointityöstä on tulossa yhä enemmän vuoropuhelua koneen kanssa.
Ajattelija ja puhuja yhteistyössä
Qwen 3.5-Omni koostuu kahdesta osasta. Ajattelija (Thinker) vastaanottaa kaiken syötteen – tekstin, kuvat, äänen ja videon – ja tuottaa päättelyketjun. Puhuja (Talker) muuntaa päättelyn luonnolliseksi puheeksi reaaliajassa. Viive on parhaimmillaan vain 234 millisekuntia.
Plus-versio hyödyntää Mixture of Experts -tekniikkaa, jossa vain osa mallin parametreista aktivoituu kerrallaan. Tämä säästää muistia ja nopeuttaa päättelyä ilman, että laatu kärsii.
Mallin 256 000 tokenin konteksti-ikkuna mahdollistaa yli 10 tunnin ääniraidan tai noin kuuden ja puolen minuutin 720p-videon käsittelyn kerralla. Mallille voi siis syöttää kokonaisen podcastin tai pitkän kokouksen nauhoitteen ja pyytää tiivistelmää, käännöstä tai analyysia yhdellä kehotteella.
Puheentunnistus toimii 113 kielellä ja murteella, kun edellisessä versiossa kieliä oli vain 19. Malli tuottaa puhetta 36 kielellä. Mukana on myös äänen kloonaus: käyttäjä voi ladata ääninäytteen, ja malli vastaa samalla äänellä.
Gemini häviää äänessä, voittaa videossa
Alibaban mukaan Qwen 3.5-Omni Plus saavuttaa parhaan tuloksen 215 vertailukokeessa. Ääniymmärryksessä malli ohittaa Googlen Gemini 3.1 Pron useissa testeissä: MMAU-testissä tulos on 82,2 vastaan 81,1 ja VoiceBench-testissä 93,1 vastaan 88,9.
Puheentunnistuksessa ero on paikoin valtava. Kiinan kantonin murteessa Qwenin virheprosentti on 1,95, kun Geminin luku on 13,40. Laajemmassa 60 kielen vertailussa Qwen pärjää niin ikään paremmin: 6,55 vastaan 7,32.
Videopuolella tilanne tasoittuu. Gemini 3.1 Pro johtaa esimerkiksi VideoMME-testissä äänen kanssa (89,0 vs. 83,7) ja WorldSense-testissä (65,5 vs. 62,8). Kyseessä ei siis ole yksipuolinen voitto – molemmat mallit ovat vahvoja eri osa-alueilla.



