Koneoppiminen

Netflix julkaisi tekoälyn joka ymmärtää painovoiman

Avoin VOID-malli poistaa kohteita videolta – ja fysiikka toimii.

Hanna HuulivuoHanna Huulivuo
Jaa:
Netflix julkaisi tekoälyn joka ymmärtää painovoiman

Netflix julkaisi torstaina ensimmäisen julkisen tekoälymallinsa. VOID – lyhenne sanoista Video Object and Interaction Deletion – poistaa kohteita videosta ja rakentaa puuttuvaan kohtaan fysiikan lakien mukaisen jatkumon. Suomeksi nimi tarkoittaa tyhjyyttä, ja se kuvaa mallin toimintaa osuvasti: kohde katoaa, mutta kohtaus pysyy ehjänä.

Malli on saatavilla Hugging Facessa Apache 2.0 -lisenssillä, mikä tarkoittaa vapaata kaupallista käyttöä. Netflixiltä tämä on poikkeuksellinen avaus – yhtiö tunnetaan suljetusta kehityksestään, ei avoimen lähdekoodin projekteista.

Pelkkä kohteiden poistaminen videosta ei ole uutta. Runway, ProPainter ja DiffuEraser osaavat täyttää aukon uskottavasti, ja tulokset näyttävät hyviltä staattisissa kohtauksissa. VOID:n ero on siinä, mitä tapahtuu poiston jälkeen: jos kuvasta katoaa henkilö, joka piteli kitaraa, kitara putoaa maahan. Jos poistetaan auto kolaritilanteesta, muut autot jatkavat ajamista häiriöttä. Aiemmat mallit jättävät kitaran leijumaan ilmaan tai häivyttävät senkin. VOID ymmärtää kausaalisuutta – se ei vain maalaa pikseleitä, vaan päättelee fysiikan seuraukset.

Neliarvoiset maskit ratkaisevat fysiikan ongelman

Tavanomaiset videotyökalut käyttävät binäärisiä maskeja: pikseli joko poistetaan tai säilytetään. VOID käyttää neliarvoista maskijärjestelmää – niin sanottua quadmaskia – jossa jokainen pikseli saa yhden neljästä arvosta. Arvo 0 merkitsee poistettavan kohteen, 63 kuvaa päällekkäisyysaluetta, 127 osoittaa fyysisesti vaikutetun alueen ja 255 tarkoittaa taustaa, jota ei muuteta.

Neliarvoinen kartta kertoo mallille, mitkä alueet tarvitsevat fysiikan uudelleenlaskentaa. Perinteisessä inpaintingissa malli arvaa, mitä poistetun kohteen tilalle tulee. VOID:ssa malli tietää myös, mihin poistettu kohde vaikutti, ja generoi niille alueille fysiikan mukaisen jatkumon.

Teknisesti VOID perustuu Alibaban CogVideoX-malliin, jossa on viisi miljardia parametria. Googlen Gemini 3 Pro analysoi kohtauksen ja tunnistaa vaikutetut alueet, ja Metan SAM2 segmentoi poistettavat kohteet. Kokonaisuus toimii 384 × 672 pikselin resoluutiolla ja käsittelee enintään 197 ruutua kerrallaan.

Päättely tapahtuu kahdessa vaiheessa. Ensimmäisessä malli generoi videon, jossa kohde on poistettu ja fysiikka korjattu. Toisessa vaiheessa järjestelmä tarkistaa, ovatko jäljelle jääneet esineet säilyttäneet muotonsa. Jos havaitaan morfautumista – tunnettu ongelma pienemmissä videodiffuusiomalleissa – toinen ajo korjaa vääristymät optiseen virtaukseen perustuvalla kohinalla.

Mallin koulutuksessa käytettiin synteettistä dataa kahdesta lähteestä. Googlen Kubric-kehyksessä luotiin esineiden välisiä vuorovaikutustilanteita, ja Adoben HUMOTO-aineistossa simuloitiin ihmisen ja esineen välistä fysiikkaa Blenderissä. Kummassakin tapauksessa sama kohtaus kuvattiin kahdesti: kerran kohteen kanssa ja kerran ilman. Näin malli oppi, miltä fysiikan pitäisi näyttää poiston jälkeen.

Selkeä voitto ihmisarvioinnissa

Tutkijat vertasivat VOID:tä kuuteen kilpailevaan menetelmään: Runway, ProPainter, DiffuEraser, ROSE, MiniMax-Remover ja Generative Omnimatte. Ryhmä 25 ihmisarvioijaa katsoi synteettisissä ja todellisissa videoissa tuotettuja tuloksia ja valitsi parhaalta näyttävän version.

VOID:tä suosittiin 64,8 prosentissa tapauksista. Runway sai 18,4 prosenttia, ja loput jakautuivat neljän muun menetelmän kesken. Ero on selvä, vaikka otoskoko on pieni – tutkijat myöntävät sen itsekin. Suuntaa tulos kuitenkin näyttää, ja ero on niin suuri, ettei satunnaisvaihtelu yksin selitä sitä.

Netflixin ensimmäinen avoin tekoälymalli

Netflix ei ole aiemmin julkaissut tekoälymalleja avoimella lisenssillä. VOID:n julkaisu Apache 2.0 -lisenssillä tarkoittaa, että kuka tahansa voi käyttää, muokata ja kaupallistaa mallia vapaasti.

Miksi Netflix jakaa tällaista osaamista? Todennäköisin selitys on rekrytointivaltti ja asemointi: yhtiö haluaa profiloitua tekoälyn kehittäjänä pelkän sisällöntuottajan sijaan. Netflixin tutkimusosasto on kasvanut viime vuosina, mutta tutkimusyhteisö tuntee sen lähinnä suosittelualgoritmeistaan. VOID syntyi yhteistyössä INSAIT-yliopiston kanssa Sofiassa, ja tutkimustiimiin kuuluvat muun muassa Saman Motamed, William Harvey ja tunnustettu konenäkötutkija Luc Van Gool.

Käytännössä VOID voi muuttaa jälkituotannon työnkulkuja. Jos elokuvan leikkausvaiheessa huomataan, ettei kohtaus toimi, voidaan yksittäinen elementti poistaa ilman kallista uusintakuvausta. Sama pätee televisiotuotantoon: jos sarjan jakso vaatii muutoksia jälkikäteen, VOID tarjoaa keinon tehdä ne nopeammin. Myös pienille YouTube-tuottajille ja indie-elokuvantekijöille malli voi olla kiinnostava, kunhan laitteistovaatimukset täyttyvät. Se ei korvaa ammattitaitoista VFX-työtä monimutkaisten efektien osalta, mutta arkisemmissa poistoissa se voi säästää tuntien käsityön.

Rajoituksia on silti. Malli vaatii vähintään 40 gigatavua grafiikkamuistia, mikä käytännössä tarkoittaa A100-tason laitteistoa. Resoluutio on rajattu, ja pidempiä videoita pitää käsitellä paloissa.

Sanasto

Inpainting
Tekniikka, jossa tekoäly täyttää kuvasta tai videosta poistetun alueen ympäristöön sopivalla sisällöllä – ikään kuin maalaamalla puuttuvan kohdan umpeen.

Mitä seurata

VOID:n tutkimuspaperi julkaistiin 2. huhtikuuta arXiv-palvelussa, ja malli on nyt vapaasti kokeiltavissa Hugging Facessa. Ensimmäinen konkreettinen seurantakohde on kehittäjäyhteisön reagointi: syntyykö VOID:n ympärille aktiivista jatkokehitystä, kuten tukea korkeammalle resoluutiolle ja pidemmille videoille? Netflixin seuraava siirto paljastaa, onko kyse yksittäisestä kokeilusta vai laajemmasta linjamuutoksesta yhtiön tekoälystrategiassa.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.