Google julkaisi keskiviikkona Gemma 4 -malliperheen, joka haastaa käsityksen siitä, että tekoälymallin suorituskyky vaatii valtavaa kokoa. Malliperheen lippulaiva, 31 miljardin parametrin tiheä malli, kipusi LMArena-listalla maailman kolmanneksi parhaaksi avoimeksi malliksi Elo-pisteillä 1 452. Se päihittää malleja, joissa on 20 kertaa enemmän parametreja.
Julkaisu merkitsee Googlelle käännekohtaa kahdesta syystä. Gemma 4 on ensimmäinen Gemma-malli, joka julkaistaan aidosti avoimella Apache 2.0 -lisenssillä. Samalla se on ensimmäinen Gemma, joka ymmärtää natiivisti tekstin lisäksi videota, kuvia ja puhetta.
31 miljardia parametria riittää voittamaan jätit
Gemma 4:n benchmark-tulokset ovat poikkeuksellisia mallin kokoon nähden. MMLU Pro -testissä, joka mittaa yleistä päättelykykyä, 31B-malli saavuttaa 85,2 prosenttia. Matematiikassa AIME 2026 -kokeessa tulos on 89,2 prosenttia, ja koodauksessa LiveCodeBench v6 -testissä 80 prosenttia. Codeforces-kilpailukoodauksen Elo-luokitus nousi edellisen Gemma-sukupolven 110 pisteestä 2 150 pisteeseen eli asiantuntijatasolle.
Erityisen kiinnostava on malliperheen 26 miljardin parametrin MoE-versio (Mixture of Experts), jossa aktiivisia parametreja on kerrallaan vain 3,8 miljardia. Se saavuttaa 97 prosenttia tiheän 31B-mallin suorituskyvystä murto-osalla laskentatehoista. AIME 2026 -testissä MoE-malli yltää 88,3 prosenttiin.
Tehokkuuden taustalla on useita arkkitehtuuriuudistuksia. Malli käyttää vuorottelevaa huomiorakennetta, joka yhdistää paikallisen liu'ikkuna-kontekstin ja globaalin täyden kontekstin. Jaettu KV-välimuisti vähentää muistinkäyttöä, mikä on ratkaisevaa reunalaitteilla. Nämä optimoinnit selittävät osaltaan, miksi MoE-malli pärjää niin hyvin vain 3,8 miljardilla aktiivisella parametrilla.
Alibaban samaa kokoluokkaa oleva Qwen 3.5 27B jää LiveCodeBench-koodauksessa noin 43 prosenttiin, ja matematiikkavertailuissa ero on vieläkin suurempi. OpenAI:n 120 miljardin parametrin gpt-oss-malli häviää Gemma 4:n 26B MoE -versiolle useissa vertailuissa, vaikka parametreja on yli 30-kertainen määrä.
Video, kuvat ja puhe yhdessä mallissa
Gemma 4 on ensimmäinen Gemma-sukupolven malli, joka käsittelee useita mediamuotoja natiivisti. Neljästä mallikoosta kaikki ymmärtävät kuvia ja videota. Reunalaitteiden pienimmät versiot, E2B ja E4B, tukevat lisäksi puheen tunnistusta ja ymmärtämistä.
Visuaalisessa päättelyssä tulokset ovat vakuuttavia. MATH-Vision-testissä 31B-malli saavuttaa 85,6 prosenttia, mikä on lähes kaksinkertainen edellisen Gemma 3:n 46 prosenttiin nähden. MMMU Pro -visuaalisen päättelyn testissä tulos on 76,9 prosenttia.
Mallit tukevat yli 140 kieltä, mikä tekee niistä käyttökelpoisia myös pienempien kielialueiden sovelluksissa. Suomalainen kehittäjä voi periaatteessa rakentaa sovelluksen, joka ymmärtää puhuttua suomea, analysoi kuvia ja tuottaa tekstiä – yhdellä mallilla, joka pyörii paikallisella laitteistolla ilman pilviyhteyttä.



