Netflix julkaisi torstaina ensimmäisen julkisen tekoälymallinsa. VOID – lyhenne sanoista Video Object and Interaction Deletion – poistaa kohteita videosta ja rakentaa puuttuvaan kohtaan fysiikan lakien mukaisen jatkumon. Suomeksi nimi tarkoittaa tyhjyyttä, ja se kuvaa mallin toimintaa osuvasti: kohde katoaa, mutta kohtaus pysyy ehjänä.
Malli on saatavilla Hugging Facessa Apache 2.0 -lisenssillä, mikä tarkoittaa vapaata kaupallista käyttöä. Netflixiltä tämä on poikkeuksellinen avaus – yhtiö tunnetaan suljetusta kehityksestään, ei avoimen lähdekoodin projekteista.
Pelkkä kohteiden poistaminen videosta ei ole uutta. Runway, ProPainter ja DiffuEraser osaavat täyttää aukon uskottavasti, ja tulokset näyttävät hyviltä staattisissa kohtauksissa. VOID:n ero on siinä, mitä tapahtuu poiston jälkeen: jos kuvasta katoaa henkilö, joka piteli kitaraa, kitara putoaa maahan. Jos poistetaan auto kolaritilanteesta, muut autot jatkavat ajamista häiriöttä. Aiemmat mallit jättävät kitaran leijumaan ilmaan tai häivyttävät senkin. VOID ymmärtää kausaalisuutta – se ei vain maalaa pikseleitä, vaan päättelee fysiikan seuraukset.
Neliarvoiset maskit ratkaisevat fysiikan ongelman
Tavanomaiset videotyökalut käyttävät binäärisiä maskeja: pikseli joko poistetaan tai säilytetään. VOID käyttää neliarvoista maskijärjestelmää – niin sanottua quadmaskia – jossa jokainen pikseli saa yhden neljästä arvosta. Arvo 0 merkitsee poistettavan kohteen, 63 kuvaa päällekkäisyysaluetta, 127 osoittaa fyysisesti vaikutetun alueen ja 255 tarkoittaa taustaa, jota ei muuteta.
Neliarvoinen kartta kertoo mallille, mitkä alueet tarvitsevat fysiikan uudelleenlaskentaa. Perinteisessä inpaintingissa malli arvaa, mitä poistetun kohteen tilalle tulee. VOID:ssa malli tietää myös, mihin poistettu kohde vaikutti, ja generoi niille alueille fysiikan mukaisen jatkumon.
Teknisesti VOID perustuu Alibaban CogVideoX-malliin, jossa on viisi miljardia parametria. Googlen Gemini 3 Pro analysoi kohtauksen ja tunnistaa vaikutetut alueet, ja Metan SAM2 segmentoi poistettavat kohteet. Kokonaisuus toimii 384 × 672 pikselin resoluutiolla ja käsittelee enintään 197 ruutua kerrallaan.
Päättely tapahtuu kahdessa vaiheessa. Ensimmäisessä malli generoi videon, jossa kohde on poistettu ja fysiikka korjattu. Toisessa vaiheessa järjestelmä tarkistaa, ovatko jäljelle jääneet esineet säilyttäneet muotonsa. Jos havaitaan morfautumista – tunnettu ongelma pienemmissä videodiffuusiomalleissa – toinen ajo korjaa vääristymät optiseen virtaukseen perustuvalla kohinalla.
Mallin koulutuksessa käytettiin synteettistä dataa kahdesta lähteestä. Googlen Kubric-kehyksessä luotiin esineiden välisiä vuorovaikutustilanteita, ja Adoben HUMOTO-aineistossa simuloitiin ihmisen ja esineen välistä fysiikkaa Blenderissä. Kummassakin tapauksessa sama kohtaus kuvattiin kahdesti: kerran kohteen kanssa ja kerran ilman. Näin malli oppi, miltä fysiikan pitäisi näyttää poiston jälkeen.
Selkeä voitto ihmisarvioinnissa
Tutkijat vertasivat VOID:tä kuuteen kilpailevaan menetelmään: Runway, ProPainter, DiffuEraser, ROSE, MiniMax-Remover ja Generative Omnimatte. Ryhmä 25 ihmisarvioijaa katsoi synteettisissä ja todellisissa videoissa tuotettuja tuloksia ja valitsi parhaalta näyttävän version.
VOID:tä suosittiin 64,8 prosentissa tapauksista. Runway sai 18,4 prosenttia, ja loput jakautuivat neljän muun menetelmän kesken. Ero on selvä, vaikka otoskoko on pieni – tutkijat myöntävät sen itsekin. Suuntaa tulos kuitenkin näyttää, ja ero on niin suuri, ettei satunnaisvaihtelu yksin selitä sitä.



