Nimetön malli nousi kärkeen kolmessa päivässä
Huhtikuun 7. päivänä Artificial Analysis -videovertailun tulostaulukolle ilmestyi tuntematon nimi: HappyHorse-1.0. Tekijästä ei ollut tietoa, verkkosivuilla ei mainittu yritystä ja malli oli merkitty vertailuun pseudonyyminä. Kolmessa päivässä se nousi ykköseksi sekä tekstistä videoksi- että kuvasta videoksi -kategorioissa.
Artificial Analysis on alusta, jossa käyttäjät vertailevat tekoälymallien tuottamia videoita sokkotestillä tietämättä mallien nimiä. HappyHorse-1.0 keräsi tekstistä videoksi -kategoriassa 1 383 Elo-pistettä, kun aiempi ykkönen ByteDancen Seedance 2.0 jäi lukemaan 1 273. Ero on 74 pistettä – suurin koskaan mitattu kahden kärkimallin välillä kyseisellä alustalla.
HappyHorse-1.0:n tulokset sokkotestissä
Tekstistä videoksi (ilman ääntä): Elo 1 383 – ykkönen. Kuvasta videoksi (ilman ääntä): Elo 1 413 – alustan kaikkien aikojen ennätys. Tekstistä videoksi (äänellä): Elo 1 233 – kakkonen Googlen Veo 3.1:n jälkeen.
Alibaban sisäinen tiimi paljastui tekijäksi
Torstaina 10. huhtikuuta mysteeri ratkesi. HappyHorse-1.0:n taustalta paljastui Alibaban Taotian-ryhmän alainen Future Life Laboratory. Tiimiä johtaa Zhang Di, joka toimi aiemmin Kuaishoun varapääjohtajana ja vastasi suositun Kling-videomallin teknisestä kehityksestä.
Zhang siirtyi Alibabaan vuoden 2025 lopussa, kun yhtiö perusti uuden Alibaba Token Hub -liiketoimintayksikön kokoamaan tekoälystrategiansa yhteen. Yksikön tehtävä on kaupallistaa Alibaban tekoälyhankkeita, ja HappyHorse on sen ensimmäinen julkinen näyttö.
Valinta julkaista malli ensin nimettömänä ei ole sattumaa. Sokkotesti pakottaa mallit kilpailemaan pelkällä laadulla ilman brändien vaikutusta. Alibaba sai näin uskottavan todisteen siitä, että HappyHorse-1.0 pärjää markkinoiden parhaimmistolle – ei markkinointipuheiden vaan käyttäjäarvioiden perusteella.
1080p-videota ääniraidalla yhdestä kehotteesta
HappyHorse-1.0:n arkkitehtuuri perustuu 40-kerroksiseen Transformer-malliin. Se eroaa useimmista kilpailijoistaan siinä, että teksti, kuva, video ja ääni käsitellään kaikki samassa prosessissa eikä erillisissä vaiheissa. Malli tuottaa 1080p-tarkkuudella videota, johon syntyy samanaikaisesti ääniraita: puhe, ympäristöäänet ja tehosteäänet.
Malli tukee kuutta kieltä, ja sen huulisynkronointi on kehittäjien mukaan alan parasta erityisesti kiinan kielellä. H100-laitteistolla viiden sekunnin videopätkän tuottaminen kestää noin 38 sekuntia täydellä 1080p-laadulla. Matalammalla resoluutiolla sama pätkä syntyy kahdessa sekunnissa.
Kuvasta videoksi -kategoriassa HappyHorse-1.0 saavutti 1 413 Elo-pisteen tuloksen, mikä on Artificial Analysis -alustan kaikkien aikojen ennätys. Ääniraidallisten videoiden vertailussa malli sijoittui toiseksi Googlen Veo 3.1:n jälkeen, mutta ero oli kapea.



