Google julkaisi 10. maaliskuuta Gemini Embedding 2:n, yhtiön ensimmäisen natiivisti multimodaalisen upotusmallin. Toisin kuin aiemmat upotusmallit, jotka käsittelevät tyypillisesti vain tekstiä tai korkeintaan tekstiä ja kuvia, uusi malli kartoittaa tekstin, kuvat, videon, äänen ja dokumentit samaan vektoriavaruuteen. Kyseessä on merkittävä harppaus siinä, miten koneoppimismallit ymmärtävät ja vertailevat eri tyyppistä sisältöä.
Käytännössä tämä tarkoittaa, että haku ei ole enää sidottu yhteen mediamuotoon. Käyttäjä voi etsiä tekstikyselyllä relevanttia videota, äänileikettä tai kuvaa, ja tulos perustuu semanttiseen ymmärrykseen – ei avainsanoihin tai metatietoihin. Malli on saatavilla julkisena esikatseluna Gemini API:n ja Vertex AI:n kautta.
Eroon erillisistä putkista
Tähän asti multimodaalinen haku on vaatinut erillisiä malleja eri mediatyypeille. Tyypillinen ratkaisu on ollut käyttää CLIP-tyyppistä mallia kuville ja erillistä tekstiupotusmallia dokumenteille. Nämä mallit tuottavat vektoreita, jotka elävät eri avaruuksissa, ja niiden yhdistäminen vaatii monimutkaista orkestrointia. Kehittäjän näkökulmasta se tarkoittaa erillisiä indeksejä, erillisiä hakuputkia ja raskasta ylläpitoa.
CLIP-tyyppisillä malleilla on tunnettu tekninen rajoitus: modaliteettikuilu. Vaikka malli on koulutettu yhdistämään kuvia ja tekstiä, eri mediamuotojen vektorit klusteroituvat eri alueille vektoriavaruudessa. Semanttisesti samankaltainen kuva ja teksti voivat silti olla geometrisesti kaukana toisistaan, mikä heikentää hakutarkkuutta. CLIP:n tekstinkäsittely rajoittuu myös tyypillisesti lyhyisiin kuvateksteihin, jolloin pidempiä dokumentteja ei voi upottaa luotettavasti.
Gemini Embedding 2 kiertää nämä ongelmat kouluttamalla yhden mallin käsittelemään kaikkia viittä modaliteettia alusta asti. Malli perustuu Gemini-transformer-arkkitehtuuriin, jossa syöte kulkee kaksisuuntaisen attention-kerroksen läpi, aggregoidaan keskiarvopoolilla ja projisoidaan kohdeulottuvuuteen. Koska koulutus tapahtuu yhdessä avaruudessa, modaliteettikuilu pienenee merkittävästi.
Matrjoška pitää kustannukset kurissa
Yksi Gemini Embedding 2:n käytännöllisimmistä ominaisuuksista on Matryoshka Representation Learning. Tekniikan nimi viittaa matrjoška-nukkeihin, joissa pienempi sisältyy suurempaan. Vastaavasti malli kouluttaa vektorin niin, että tärkeimmät piirteet ovat alussa. Oletusulottuvuus on 3 072, mutta sen voi pudottaa tasoille 1 536, 768 tai jopa 128 ilman uudelleenkoulutusta.
768-ulotteisten vektoreiden tallentaminen maksaa 75 prosenttia vähemmän kuin täysmittaisten, ja samankaltaisuushaku nopeutuu vastaavasti. MTEB-mittauksissa malli säilyttää lähes huipputason suorituskyvyn pienennetylläkin ulottuvuudella: 68,17 pistettä 1 536 ulottuvuudella verrattuna 68,32 pisteeseen täydellä 3 072 ulottuvuudella.
Laajemmassa vertailussa malli hallitsee. Monikielisellä MTEB-listalla Gemini Embedding 2 johtaa yli viiden pisteen erolla toiseen sijaan nähden. Englanninkielisessä MTEB v2 -mittauksessa tulos on 73,30 pistettä, ja koodihaussa 74,66 – kummassakin listan kärjessä.
Miten malli muuttaa hakua ja suosittelua
Yhdistetty vektoriavaruus muuttaa erityisesti RAG-järjestelmien toimintaa. Aiemmin RAG-putkeen piti rakentaa erilliset hakuindeksit tekstille ja kuville. Gemini Embedding 2:n myötä kaikki sisältö voidaan indeksoida samaan vektoritietokantaan, ja haku palauttaa relevanteimmat tulokset mediamuodosta riippumatta. Se yksinkertaistaa arkkitehtuuria ja vähentää ylläpitokustannuksia.
Suosittelujärjestelmille tämä avaa mahdollisuuden yhdistää käyttäjän tekstimuotoiset preferenssit suoraan visuaaliseen tai auditiiviseen sisältöön. Verkkokaupassa asiakas voisi kuvailla sanallisesti haluamaansa tuotetta ja saada tuloksena kuvia, videoarvosteluja ja tuotetekstejä samalla haulla. Podcastien ja videoiden hakeminen onnistuu suoraan äänisignaalista ilman erillistä transkriptiota.
Malli tukee yli sataa kieltä, mukaan lukien suomea. Monikielisen MTEB-listan kärkisija kertoo, ettei tuki ole vain nimellinen – malli ymmärtää myös pienten kielten semantiikkaa. Suomalaisille yrityksille tämä on olennaista: hakujärjestelmiä voi rakentaa omalla kielellä ilman englanninkielistä välikäännöstä.
Malli käsittelee yhdessä pyynnössä jopa 8 192 tekstisyöketokenia, kuusi kuvaa, 128 sekuntia videota tai 80 sekuntia ääntä. Äänen osalta malli analysoi signaalin suoraan ilman erillistä puheentunnistusvaihetta, mikä vähentää viivettä ja virhelähteitä.



