Tutkimus

Tekoälyvideo oppi korjaamaan itsensä

EPFL:n menetelmä eliminoi ajautumisen, joka pilaa generatiiviset videot sekunneissa.

Hanna HuulivuoHanna Huulivuo
Jaa:
Tekoälyvideo oppi korjaamaan itsensä

Muutama sekunti ja kaikki hajoaa

Jokainen tekoälyvideoita kokeillut tietää ongelman: video näyttää ensin uskottavalta, mutta muutamassa sekunnissa kasvot vääristyvät, esineet sulautuvat toisiinsa ja fysiikka lakkaa toimimasta. Ilmiön nimi on ajautuminen, ja se on generatiivisen videon keskeisin tekninen haaste.

Ongelma johtuu siitä, miten videomallit toimivat. Ne generoivat kuvan kerrallaan ja käyttävät edellistä kuvaa syötteenä seuraavalle. Pienetkin virheet kertautuvat kehys kehykseltä, kunnes lopputulos on käyttökelvoton. OpenAI:n Sora 2 tuottaa enimmillään 10–25 sekunnin pätkiä, ja ByteDancen Seedance kamppailee saman rajoitteen kanssa.

Nyt sveitsiläisestä EPFL-yliopistosta tulee menetelmä, joka ratkaisee ongelman juurisyyn.

Malli joka opettaa itse itseään

EPFL:n VITA-laboratorion tutkijat lähestyivät ongelmaa kahdesta suunnasta. Ensimmäinen innovaatio on virheenkierrätys: mallin tuottamat virheet tallennetaan ja syötetään takaisin koulutukseen, jotta malli oppii toipumaan omista epätarkkuuksistaan. Ajatus on yksinkertainen mutta tehokas – sen sijaan että malli näkee koulutuksessa vain täydellisiä esimerkkejä, se harjaantuu käsittelemään myös rikkinäistä syötettä.

Toinen ja merkittävämpi läpimurto on LayerSync. Se hyödyntää diffuusiomallin sisäisiä kerroksia: syvemmät kerrokset ymmärtävät kuvan merkityksen paremmin kuin pintakerrokset. LayerSync pakottaa nämä asiantuntijakerrokset ohjaamaan heikompia kerroksia koulutuksen aikana. Malli siis opettaa itse itseään sisältäpäin, ilman ulkoista dataa tai valmiita malleja.

Menetelmä toimii lisäosana, joka voidaan kytkeä mihin tahansa diffuusiomalliin ilman laskennallista lisärasitetta.

“Ongelma on, että mallit koulutetaan vain täydellisillä aineistoilla, mutta reaalimaailmassa niiden pitää osata käsitellä syötettä joka sisältää niiden omia virheitä.”

— Alexandre Alahi, Professori, EPFL VITA Lab

8,75-kertainen nopeutus

LayerSyncin tulokset ovat vakuuttavia eri modaliteeteissa. ImageNet-kuvadatalla menetelmä nopeutti koulutusta 8,75-kertaisesti ja paransi kuvanlaatua 23,6 prosenttia FID-mittarilla. Äänigeneroinnissa laatu parantui 24 prosenttia ja liikegeneroinnissa 7,7 prosenttia.

Tutkijat rakensivat LayerSyncin päälle myös Stable Video Infinity -järjestelmän, joka tuottaa useita minuutteja pitkiä videoita. Avoimen lähdekoodin projekti keräsi nopeasti yli 1 900 GitHub-tähteä ja 150 000 katselukertaa YouTubessa.

Tutkimus esitellään huhtikuussa ICLR 2026 -konferenssissa, joka on yksi koneoppimisen arvostetuimmista foorumeista. Tutkimusryhmää johtaa professori Alexandre Alahi, ja päätutkijana toimii Yasaman Haghighi.

Perustutkimuksesta käytäntöön

LayerSync ei ole kaupallinen tuote vaan perustutkimustulos, ja juuri siksi se on merkittävä. Menetelmä ei ratkaise vain videogenerointia vaan tarjoaa yleiskäyttöisen tavan tehostaa diffuusiomallien koulutusta kaikissa modaliteeteissa.

Kuilu laboratoriodemon ja tuotantokäytön välillä on silti leveä. EPFL:n tulokset osoittavat, että ajautumisongelma on ratkaistavissa, mutta todellinen testi on se, skaalautuuko menetelmä Soran ja Seedancen kaltaisiin kaupallisiin järjestelmiin. Vastaus saadaan todennäköisesti jo tämän vuoden aikana.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.