Koneoppiminen

Yksi malli, viisi aistia – Googlen uusi upotusmalli

Gemini Embedding 2 kartoittaa tekstin, kuvan, videon, äänen ja dokumentit samaan vektoriavaruuteen.

Hanna HuulivuoHanna Huulivuo
Jaa:
Yksi malli, viisi aistia – Googlen uusi upotusmalli

Google julkaisi 10. maaliskuuta Gemini Embedding 2:n, yhtiön ensimmäisen natiivisti multimodaalisen upotusmallin. Toisin kuin aiemmat upotusmallit, jotka käsittelevät tyypillisesti vain tekstiä tai korkeintaan tekstiä ja kuvia, uusi malli kartoittaa tekstin, kuvat, videon, äänen ja dokumentit samaan vektoriavaruuteen. Kyseessä on merkittävä harppaus siinä, miten koneoppimismallit ymmärtävät ja vertailevat eri tyyppistä sisältöä.

Käytännössä tämä tarkoittaa, että haku ei ole enää sidottu yhteen mediamuotoon. Käyttäjä voi etsiä tekstikyselyllä relevanttia videota, äänileikettä tai kuvaa, ja tulos perustuu semanttiseen ymmärrykseen – ei avainsanoihin tai metatietoihin. Malli on saatavilla julkisena esikatseluna Gemini API:n ja Vertex AI:n kautta.

Eroon erillisistä putkista

Tähän asti multimodaalinen haku on vaatinut erillisiä malleja eri mediatyypeille. Tyypillinen ratkaisu on ollut käyttää CLIP-tyyppistä mallia kuville ja erillistä tekstiupotusmallia dokumenteille. Nämä mallit tuottavat vektoreita, jotka elävät eri avaruuksissa, ja niiden yhdistäminen vaatii monimutkaista orkestrointia. Kehittäjän näkökulmasta se tarkoittaa erillisiä indeksejä, erillisiä hakuputkia ja raskasta ylläpitoa.

CLIP-tyyppisillä malleilla on tunnettu tekninen rajoitus: modaliteettikuilu. Vaikka malli on koulutettu yhdistämään kuvia ja tekstiä, eri mediamuotojen vektorit klusteroituvat eri alueille vektoriavaruudessa. Semanttisesti samankaltainen kuva ja teksti voivat silti olla geometrisesti kaukana toisistaan, mikä heikentää hakutarkkuutta. CLIP:n tekstinkäsittely rajoittuu myös tyypillisesti lyhyisiin kuvateksteihin, jolloin pidempiä dokumentteja ei voi upottaa luotettavasti.

Gemini Embedding 2 kiertää nämä ongelmat kouluttamalla yhden mallin käsittelemään kaikkia viittä modaliteettia alusta asti. Malli perustuu Gemini-transformer-arkkitehtuuriin, jossa syöte kulkee kaksisuuntaisen attention-kerroksen läpi, aggregoidaan keskiarvopoolilla ja projisoidaan kohdeulottuvuuteen. Koska koulutus tapahtuu yhdessä avaruudessa, modaliteettikuilu pienenee merkittävästi.

Matrjoška pitää kustannukset kurissa

Yksi Gemini Embedding 2:n käytännöllisimmistä ominaisuuksista on Matryoshka Representation Learning. Tekniikan nimi viittaa matrjoška-nukkeihin, joissa pienempi sisältyy suurempaan. Vastaavasti malli kouluttaa vektorin niin, että tärkeimmät piirteet ovat alussa. Oletusulottuvuus on 3 072, mutta sen voi pudottaa tasoille 1 536, 768 tai jopa 128 ilman uudelleenkoulutusta.

768-ulotteisten vektoreiden tallentaminen maksaa 75 prosenttia vähemmän kuin täysmittaisten, ja samankaltaisuushaku nopeutuu vastaavasti. MTEB-mittauksissa malli säilyttää lähes huipputason suorituskyvyn pienennetylläkin ulottuvuudella: 68,17 pistettä 1 536 ulottuvuudella verrattuna 68,32 pisteeseen täydellä 3 072 ulottuvuudella.

Laajemmassa vertailussa malli hallitsee. Monikielisellä MTEB-listalla Gemini Embedding 2 johtaa yli viiden pisteen erolla toiseen sijaan nähden. Englanninkielisessä MTEB v2 -mittauksessa tulos on 73,30 pistettä, ja koodihaussa 74,66 – kummassakin listan kärjessä.

Miten malli muuttaa hakua ja suosittelua

Yhdistetty vektoriavaruus muuttaa erityisesti RAG-järjestelmien toimintaa. Aiemmin RAG-putkeen piti rakentaa erilliset hakuindeksit tekstille ja kuville. Gemini Embedding 2:n myötä kaikki sisältö voidaan indeksoida samaan vektoritietokantaan, ja haku palauttaa relevanteimmat tulokset mediamuodosta riippumatta. Se yksinkertaistaa arkkitehtuuria ja vähentää ylläpitokustannuksia.

Suosittelujärjestelmille tämä avaa mahdollisuuden yhdistää käyttäjän tekstimuotoiset preferenssit suoraan visuaaliseen tai auditiiviseen sisältöön. Verkkokaupassa asiakas voisi kuvailla sanallisesti haluamaansa tuotetta ja saada tuloksena kuvia, videoarvosteluja ja tuotetekstejä samalla haulla. Podcastien ja videoiden hakeminen onnistuu suoraan äänisignaalista ilman erillistä transkriptiota.

Malli tukee yli sataa kieltä, mukaan lukien suomea. Monikielisen MTEB-listan kärkisija kertoo, ettei tuki ole vain nimellinen – malli ymmärtää myös pienten kielten semantiikkaa. Suomalaisille yrityksille tämä on olennaista: hakujärjestelmiä voi rakentaa omalla kielellä ilman englanninkielistä välikäännöstä.

Malli käsittelee yhdessä pyynnössä jopa 8 192 tekstisyöketokenia, kuusi kuvaa, 128 sekuntia videota tai 80 sekuntia ääntä. Äänen osalta malli analysoi signaalin suoraan ilman erillistä puheentunnistusvaihetta, mikä vähentää viivettä ja virhelähteitä.

Tekniset tiedot

Syöte: 8 192 tokenia tekstiä, 6 kuvaa, 128 s videota, 80 s ääntä, 6 PDF-sivua. Ulottuvuudet: 128–3 072 (oletus 3 072). Kielet: yli 100. Hinta: 0,20 $/miljoona tokenia. Saatavuus: julkinen esikatselu (gemini-embedding-2-preview).

5

Modaliteettia yhdessä mallissa

#1↑

Monikielinen MTEB – yli 5 pisteen johto

75 %↑

Säästö tallennuksessa 768 ulottuvuudella

100+

Tuettua kieltä

Google Blog, arXiv, 2026

Sanasto

Upotus (embedding)
Tapa muuttaa tekstiä, kuvia tai muuta sisältöä numerosarjaksi (vektoriksi), joka tiivistää sisällön merkityksen. Samankaltaiset sisällöt saavat samankaltaiset numerosarjat, mikä mahdollistaa merkityspohjaisen haun.
Vektoriavaruus
Matemaattinen tila, johon upotukset sijoitetaan. Mitä lähempänä kaksi vektoria ovat toisiaan tässä tilassa, sitä samankaltaisempia niiden edustama sisältö on merkitykseltään.
RAG (Retrieval-Augmented Generation)
Hakutäydenteinen generointi – tekniikka jossa tekoäly hakee ensin tietoa ulkoisesta lähteestä ja käyttää sitä vastauksen pohjana sen sijaan, että luottaisi pelkkään oppimaansa.

Rajoitukset ja saatavuus

Gemini Embedding 2 on vielä julkisessa esikatselussa, mikä tarkoittaa, että API voi muuttua ennen lopullista versiota. Google varoittaa, että aiemman gemini-embedding-001-mallin tuottamat vektorit eivät ole yhteensopivia uuden mallin kanssa. Koko tietokanta on upotettava uudelleen, jos haluaa siirtyä käyttämään uutta mallia – ja suurilla datamäärillä se voi olla mittava operaatio.

Hinnoittelu on maltillinen: tekstiupotukset maksavat 0,20 dollaria miljoonaa tokenia kohden, ja eräajossa hinta puolittuu. Median osalta sovelletaan Gemini API:n vakiohintoja.

Vektorihakuyhtiö Qdrant julkaisi jo integraatio-ohjeet Gemini Embedding 2:lle, mikä viittaa ekosysteemin nopeaan reagointiin. Kehittäjille malli lupaa yksinkertaisempaa arkkitehtuuria: yhden mallin ja yhden indeksin sijaan erillisten putkien ylläpitoa. Esikatselu-status tarkoittaa kuitenkin, ettei tuotantokäyttöön kannata vielä rynnätä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.