Muutama sekunti ja kaikki hajoaa
Jokainen tekoälyvideoita kokeillut tietää ongelman: video näyttää ensin uskottavalta, mutta muutamassa sekunnissa kasvot vääristyvät, esineet sulautuvat toisiinsa ja fysiikka lakkaa toimimasta. Ilmiön nimi on ajautuminen, ja se on generatiivisen videon keskeisin tekninen haaste.
Ongelma johtuu siitä, miten videomallit toimivat. Ne generoivat kuvan kerrallaan ja käyttävät edellistä kuvaa syötteenä seuraavalle. Pienetkin virheet kertautuvat kehys kehykseltä, kunnes lopputulos on käyttökelvoton. OpenAI:n Sora 2 tuottaa enimmillään 10–25 sekunnin pätkiä, ja ByteDancen Seedance kamppailee saman rajoitteen kanssa.
Nyt sveitsiläisestä EPFL-yliopistosta tulee menetelmä, joka ratkaisee ongelman juurisyyn.
Malli joka opettaa itse itseään
EPFL:n VITA-laboratorion tutkijat lähestyivät ongelmaa kahdesta suunnasta. Ensimmäinen innovaatio on virheenkierrätys: mallin tuottamat virheet tallennetaan ja syötetään takaisin koulutukseen, jotta malli oppii toipumaan omista epätarkkuuksistaan. Ajatus on yksinkertainen mutta tehokas – sen sijaan että malli näkee koulutuksessa vain täydellisiä esimerkkejä, se harjaantuu käsittelemään myös rikkinäistä syötettä.
Toinen ja merkittävämpi läpimurto on LayerSync. Se hyödyntää diffuusiomallin sisäisiä kerroksia: syvemmät kerrokset ymmärtävät kuvan merkityksen paremmin kuin pintakerrokset. LayerSync pakottaa nämä asiantuntijakerrokset ohjaamaan heikompia kerroksia koulutuksen aikana. Malli siis opettaa itse itseään sisältäpäin, ilman ulkoista dataa tai valmiita malleja.
Menetelmä toimii lisäosana, joka voidaan kytkeä mihin tahansa diffuusiomalliin ilman laskennallista lisärasitetta.
“Ongelma on, että mallit koulutetaan vain täydellisillä aineistoilla, mutta reaalimaailmassa niiden pitää osata käsitellä syötettä joka sisältää niiden omia virheitä.”



