Microsoft julkaisi tiistaina kolme omaa perusmallia, jotka kattavat puheentunnistuksen, äänigeneroinnin ja kuvien luonnin. Mallit syntyivät Mustafa Suleymanin vetämässä MAI Superintelligence -tiimissä, joka perustettiin vasta viime marraskuussa.
Kolmikko koostuu puheentunnistusmalli MAI-Transcribe-1:stä, äänigenerointimalli MAI-Voice-1:stä ja kuvagenerointimalli MAI-Image-2:sta. Ne ovat heti kehittäjien saatavilla Microsoft Foundry -alustan ja uuden MAI Playground -ympäristön kautta.
Julkaisun strateginen viesti on selvä: Microsoft ei aio jäädä riippuvaiseksi OpenAI:sta. Viime syksynä uusittu kumppanuussopimus antoi Microsoftille vapauden kehittää omia malleja, ja nyt ensimmäiset tulokset ovat pöydällä.
Puheentunnistus lyö Whisperin selvästi
MAI-Transcribe-1 tunnistaa puhetta 25 kielellä, mukaan lukien suomeksi. FLEURS-vertailussa sen sanavirheprosentti on 3,9, kun OpenAI:n Whisper Large v3 yltää vain 7,6 prosenttiin. Myös OpenAI:n uudempi GPT-Transcribe jää 4,2 prosenttiin ja Googlen Gemini 3.1 Flash 4,9 prosenttiin.
Malli toimii Microsoftin mukaan 2,5 kertaa nopeammin kuin yhtiön oma Azure Fast -palvelu ja noin 50 prosenttia pienemmillä GPU-kustannuksilla. Se on suunniteltu selviytymään taustameluista, heikosta äänenlaadusta ja päällekkäisestä puheesta. Käytännössä tämä tarkoittaa halvempaa ja tarkempaa litterointia yrityksille, jotka käsittelevät suuria määriä äänitallenteita.
Suomen kielen tuki tekee mallista kiinnostavan vaihtoehdon kotimaisille yrityksille. Kokousten litterointi, asiakaspalvelun automaatio ja tekstittäminen ovat alueita, joilla Whisper on tähän asti ollut hallitseva vaihtoehto. Microsoft käyttää mallia jo itse – Copilot Voice Mode pyörii sen päällä.
Ääni ja kuva samassa paketissa
MAI-Voice-1 tuottaa 60 sekuntia puhetta alle sekunnissa yhdellä GPU:lla. Mallilla voi luoda räätälöityjä ääniä minuutin ääninäytteestä, mikä avaa ovia yritysten omille äänille. Hinta alkaa 22 dollarista miljoonaa merkkiä kohden.
MAI-Image-2 nousi Arena.ai-vertailun kolmanneksi heti Googlen Gemini 3.1 Flashin ja OpenAI:n GPT Image 1.5:n jälkeen. Microsoft korostaa mallin luonnollista valaistusta, tarkkoja ihonsävyjä ja kykyä tuottaa luettavaa tekstiä kuvien sisällä. Kuvamallista pyydetään 5 dollaria miljoonalta tekstisyötetokenilta ja 33 dollaria kuvatulostetokenilta.
Molemmat mallit ovat jo tuotantokäytössä. MAI-Voice-1 pyörittää Copilotin Audio Expressions -ominaisuutta, ja MAI-Image-2 on tulossa Bingiin ja PowerPointiin satojen miljoonien käyttäjien ulottuville.



