Kun pyydät tekoälyä luomaan videon, tulos näyttää vakuuttavalta pari sekuntia. Sen jälkeen värit alkavat valua, kasvot vääristyvät ja kohtauksen logiikka katoaa. Ilmiötä kutsutaan ajautumiseksi, ja se on generatiivisen videon perustavanlaatuisin ongelma. Yksikään kaupallinen palvelu ei ole ratkaissut sitä kunnolla, minkä vuoksi tekoälyvideot ovat jumittuneet muutaman sekunnin pätkiin. Sveitsiläisen EPFL:n tutkijat väittävät nyt löytäneensä ratkaisun.
Miksi tekoälyvideo hajoaa?
Generatiiviset videomallit tuottavat kuvia peräkkäin. Jokainen uusi kehys perustuu edelliseen, ja jokainen sisältää pieniä virheitä. Virheet kertautuvat kehys kehykseltä. Muutaman sekunnin jälkeen kasauma on niin suuri, että video muuttuu käsittämättömäksi.
Ongelma näkyy suoraan kaupallisten palveluiden rajoituksissa. OpenAI:n Sora tuottaa enimmillään 15–25 sekunnin videoita, Runwayn Gen-4 pysyy 10–16 sekunnissa. Pidempien videoiden tekeminen vaatii klippien manuaalista ketjuttamista, eikä saumoja saa helposti piiloon.
Virheiden kierrätys ratkaisuna
EPFL:n VITA-laboratorion tutkijat, professori Alexandre Alahi ja tutkijatohtori Wuyang Li, lähestyivät ongelmaa vastaintuitiivisesti. Sen sijaan, että mallia opetettaisiin pelkästään virheettömillä aineistoilla, he syöttivät sille tarkoituksella sen itsensä tuottamia virheellisiä kuvia.
Menetelmän nimi on virheiden kierrätys (error recycling). Järjestelmä mittaa, miten generoitu kuva poikkeaa ihanteesta, tallentaa poikkeamat ja syöttää ne takaisin opetusaineistoon. Näin malli oppii tunnistamaan ja korjaamaan omat virheensä, vaikka se saisi lähtötiedoksi epätäydellisen kuvan.
Alahin mukaan malleja opetetaan perinteisesti vain täydellisillä aineistoilla, mutta todellisissa käyttötilanteissa mallin pitää osata käsitellä myös omia virheitään sisältävää syötettä. Virheiden kierrätys pakottaa mallin kohtaamaan epätäydelliset syötteet jo oppimisvaiheessa.
“Se on vähän kuin kouluttaisi lentäjää myrskyisässä säässä kirkkaansinisen taivaan sijaan.”
Avoin järjestelmä keräsi tuhansia seuraajia
Menetelmä on integroitu avoimeen Stable Video Infinity -järjestelmään, joka tuottaa minuuttien mittaisia videoita ilman, että laskentakustannukset kasvavat videon pidentyessä. Järjestelmä on julkaistu avoimena lähdekoodina, ja sen GitHub-repositorio on kerännyt yli 1 900 tähteä. Esittelyvideo keräsi YouTubessa yli 150 000 katselukertaa muutamassa viikossa.
Tutkijat kehittivät myös LayerSync-nimisen täydentävän tekniikan, jossa neuroverkon sisäiset kerrokset ohjaavat toisiaan oppimisprosessin aikana. Molemmat menetelmät esitellään ICLR 2026 -konferenssissa huhtikuussa. Virheiden kierrätys sai konferenssissa suullisen esitelmäpaikan – tunnustus, joka myönnetään tyypillisesti vain pienelle osalle hyväksytyistä tutkimuksista.
Tutkijatohtori Li tiivistää lähestymistavan: "Toisin kuin ihmiset, generatiivinen tekoäly harvoin osaa toipua virheistään. Siksi opetamme malleja tekemään juuri sen."
Sekuntirajat murtumassa
Kaupallisten videopalveluiden aikarajat heijastavat ajautumisongelmaa, eivät niinkään laskentatehon puutetta. Jos Sora tai Runway integroisi virheiden kierrätyksen omiin malliinsa, klippien kesto voisi moninkertaistua. EPFL:n menetelmä ei vaadi valtavia aineistoja eikä merkittävää lisälaskentaa, mikä tekee siitä käytännöllisen vaihtoehdon myös kaupallisille toimijoille.
Avoimena lähdekoodina julkaistuna ratkaisu on jo kaikkien käytettävissä. Videotuotantoyhtiöille, mainostoimistoille ja pelinkehittäjille tämä tarkoittaa, että tekoälyllä tuotettu raakamateriaali voi olla minuuttien eikä sekuntien mittaista. Pienemmille studioille ja yksittäisille tekijöille kynnys pitkien tekoälyvideoiden tuottamiseen madaltuu, kun kallis infrastruktuuri ei ole enää este.
Kokeile itse
Stable Video Infinityn lähdekoodi, dokumentaatio ja ComfyUI-työnkulut löytyvät GitHubista: github.com/vita-epfl/Stable-Video-Infinity
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.