Tekoäly

Gemini Omni vuoti – Google iskee Soraan tiistaina

'Powered by Omni' -merkintä paljastaa yhtenäisen kuva- ja videomallin ennen I/O:ta.

Aino AikajärviAino Aikajärvi
Jaa:
Gemini Omni vuoti – Google iskee Soraan tiistaina
Kuva: The Pancake of Heaven! / CC BY-SA 4.0

Vuoto kahta viikkoa ennen lavaesitystä

Googlen Gemini-sovellukseen ilmestyi 2. toukokuuta merkkijono 'Start with an idea or try a template. Powered by Omni'. X-käyttäjä huomasi rivin sovelluksen videogenerointivälilehdessä, ja Google-vuotoja seuraava TestingCatalog vahvisti löydön. Pian sen jälkeen Reddit-käyttäjä jakoi varhaisen pääsyn Omniksi nimettyyn malliin ja julkaisi siitä demovideoita.

Ajoitus on yhtiölle hankala. Google I/O 2026 alkaa tiistaina 19. toukokuuta ja jatkuu seuraavana päivänä. Pääpuheenvuoro lähetetään klo 20 Suomen aikaa, ja Gemini-päivitykset on listattu agendan keskiöön.

Mitä Omni voisi olla

Vuodon perusteella on kolme uskottavaa tulkintaa. Ensimmäinen: Omni on pelkkä uusi tuotemerkki olemassa olevalle Veo-pohjalle. Toinen: Omni on Geminin pohjalta koulutettu erillinen videomalli, joka kulkee Veon rinnalla. Kolmas: Omni on yhtenäinen malli, joka käsittelee sekä kuvan että videon samassa järjestelmässä.

Sovelluksen metadatassa Omni näkyy Veon laajennoksena, mikä viittaa kolmanteen tulkintaan. Yhtenäinen malli olisi linjassa toimialan suuntauksen kanssa: yksi arkkitehtuuri, joka käsittelee kaikki modaaliteetit. OpenAI:n GPT-perhe ja Anthropicin Claude ovat liikkuneet samaan suuntaan tekstin, kuvan ja äänen yhdistämisessä.

Demoissa loistoa ja kömmähdyksiä

Reddit-käyttäjän jakamissa videoissa Omni näytti vahvuutensa matemaattisessa todistuksessa. Malli säilytti logiikan tarkkuuden pidemmälle kuin aiemmat videomallit, mikä on ollut alan perinteinen kompastuskivi. Realistisuus oli silminnähden askel Veon nykyversiota edellä.

Kömpelyyttä riitti silti. Monimutkaisemmassa illalliskohtauksessa esineitä ilmestyi tyhjästä ilmaan, ja liitu katosi kesken matemaattista esitystä. Puremaliikkeet eivät vastanneet ruoan rakennetta. Yhden objektin fysiikka onnistuu, mutta kun kohtauksessa on monta toimijaa, malli sekoaa.

Käyttörajoituksista paljastui kova luku. Kahden videon generointi kulutti 86 prosenttia käyttäjän Google AI Pro -tilauksen päivärajasta. Lukua Googlen on venytettävä reilusti ennen kuin Omni siirtyy laajempaan jakeluun.

Videomallien asetelma toukokuussa 2026

OpenAI Sora 2: yksittäiset klipit jopa 20 sekuntia, ilman ääntä. Vahvuus motorisessa koherenssissa.

Google Veo 3: kahdeksan sekuntia, mutta synkronoitu puhe, ympäristöäänet ja musiikki samalla ajolla.

Gemini Omni: kesto ja ääniominaisuudet vahvistamatta. Metadatan mukaan rakentuu Veon päälle.

Veo ja Sora vertailussa

Tällä hetkellä OpenAI:n Sora 2 tuottaa pisimmät yksittäiset klipit, mutta ilman ääntä. Hahmot säilyttävät mittasuhteensa ja liikkeen luonnollisuuden koko klipin ajan. Veo 3 leikkaa kahdeksaan sekuntiin, mutta generoi videon yhteyteen synkronoidun puheen, ympäristöäänet ja musiikin yhdellä ajolla. Sora 2:n API on edelleen rajoitettu, Veo 3 on jaossa Gemini-rajapinnan ja Vertex AI:n kautta.

Jos Omni todella on yhtenäinen malli, Googlen peliliike on selvä. Yhdistämällä Veon ääniominaisuudet pidempään kestoon ja parempaan kuvaymmärrykseen Omni voi hakea sitä, mitä kummallakaan kilpailijalla ei vielä ole: täysi paketti yhdellä komennolla.

Mitä I/O:ssa odotetaan

Tiistain pääpuheenvuorossa Google julkistanee uuden Gemini-version, joka voi kantaa numeroa 3.8 tai 4.0. Agenttinen suunta jatkuu: malleja, jotka tekevät monivaiheisia tehtäviä ilman jatkuvaa ohjausta. Android-puolen uutiset, mukaan lukien Android 17 ja Android XR -lasit, kuultiin jo viime viikon Android Show'ssa, joten lavalle jää tilaa puhtaasti tekoälypainotteiselle ohjelmistolle.

Omnin asema esityksessä on epäselvä. Vuoto pakottaa Googlen kommentoimaan jotain, joko paljastamaan koko mallin tai vähintään selittämään, miksi sovelluksen koodissa lukee toinen tuotenimi.

Sanasto

Modaliteetti
Tiedon esitysmuoto kuten teksti, kuva, ääni tai video. Multimodaalinen malli osaa käsitellä useaa muotoa samassa järjestelmässä.
Metadata
Tieto tiedosta – esimerkiksi sovelluksen koodissa olevat kuvaukset, jotka kertovat mitä taustalla pyörii ilman että se näkyy käyttäjälle.

Suomalaiselle yritykselle, joka tekee somemainoksia tai opetusvideoita, kahdeksan sekunnin Veo-klipit ovat olleet kelpo apuväline mutta usein liian lyhyitä yhdellä ajolla. Jos Omni venyttää kestoa ja säilyttää äänen, kynnys ulkoistaa tuotantotyö tekoälylle laskee taas askeleen alemmas. Tiukat käyttörajat tarkoittavat silti, että huipputeknologia jää alkuvaiheessa harvojen käsiin.

Googlen maksumalli ratkaisee, syntyykö Omnista Pro-tilaajien työkalu vai laajemmin jaettu kuluttajatoiminto. Tiistain jälkeen tiedämme, oliko Omni vuotoa enemmän vai vähemmän kuin mainostettu.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä
  5. 5Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.