Tekoäly

Gemini 3.5 Flash kaatoi Pron koodibenchmarkeissa

Halpa pikamalli päihittää raskaamman Pron koodaus- ja agenttitesteissä.

Nelli NelisanomaNelli Nelisanoma
Jaa:
Gemini 3.5 Flash kaatoi Pron koodibenchmarkeissa
Kuva: The Pancake of Heaven! / CC BY-SA 4.0

Kevyt malli kiilasi raskaamman ohi

Google julkaisi Gemini 3.5 Flashin ja nosti sen saman tien oletusmalliksi miljardeille Gemini-sovelluksen käyttäjille. Aiemmin Flash-sarja on tarkoittanut kevyttä ja karsittua pikaversiota, mutta nyt halpa malli kiilasi raskaamman Gemini 3.1 Pron ohi useissa koodaus- ja agenttitesteissä.

Terminal-Bench 2.1 -testissä Flash ylsi 76,2 prosenttiin, kun Pro jäi 70,3 prosenttiin. Finanssiagenttia mittaavassa Finance Agent v2 -testissä ero oli vielä selvempi: 57,9 vastaan 43,0 prosenttia. Koodausbenchmark SWE-Bench Prossa Flash kirjasi 55,1 prosenttia ja työkalujen käyttöä mittaavassa MCP Atlasissa 83,6 prosenttia.

Nopeampi token-tuotanto kuin muut huippumallit

−40 %

Halvempi kuin Gemini 3.1 Pro

1 M

Tokenin konteksti-ikkuna säilyy

Google / DataNorth

Neljä kertaa nopeampi token-tuotanto

Pelkkä benchmark-voitto ei ole tässä olennaisin asia. Google ilmoittaa, että Flash tuottaa tokeneita noin neljä kertaa nopeammin kuin muut frontier-tason mallit. Malli säilyttää silti miljoonan tokenin konteksti-ikkunan. Käyttäjälle nopeus tarkoittaa vastauksia, jotka ilmestyvät ruudulle lähes välittömästi.

Nopeus ratkaisee erityisesti agenttisovelluksissa. Tekoälyagentti ei tuota yhtä vastausta vaan pyörii silmukassa: se lukee, päättelee, kutsuu työkaluja ja korjaa virheitään kymmeniä tai satoja kertoja peräkkäin. Jokainen kierros odottaa edellisen tokeneita, joten nopeampi malli lyhentää koko ketjun läpimenoaikaa.

Agenttitalouden kustannuslaskelmat menevät uusiksi

Hinta tekee uutisesta merkittävän. Flashin syötetokenit maksavat 1,50 dollaria miljoonalta ja ulostulotokenit 9 dollaria miljoonalta. Välimuistista luettu syöte putoaa 0,15 dollariin. Kokonaisuutena malli on noin 40 prosenttia halvempi kuin Gemini 3.1 Pro.

Agenttien rakentajille yhtälö muuttuu olennaisesti. Tähän asti kehittäjät ovat joutuneet valitsemaan: halpa ja nopea malli yksinkertaisiin tehtäviin, kallis huippumalli vaativaan päättelyyn. Jos kevyt malli yltää huipputasolle koodaus- ja agenttitehtävissä murto-osalla hinnasta, raja näiden välillä katoaa.

Konkreettisesti agentti, joka kuluttaa miljoonia tokeneita päivässä, maksaa nyt selvästi vähemmän ajaa ja valmistuu nopeammin. Se laskee kynnystä rakentaa tekoälyagentteja, jotka hoitavat oikeaa työtä taustalla, eivät vain vastaa yksittäisiin kysymyksiin.

Mitä tämä tarkoittaa tavalliselle käyttäjälle?

Gemini-sovellus vaihtoi oletusmallinsa Flashiin, joten miljardit käyttäjät saavat nopeammat vastaukset ilman erillistä valintaa. Yrityksille halpeneva agenttilasku tarkoittaa, että asiakaspalvelua, koodausta ja raporttien koostamista automatisoivat työkalut tulevat aiempaa edullisemmiksi tarjota.

Frontier-tason älykkyyttä nelinkertaisella ulostulonopeudella verrattuna muihin huippumalleihin.

Google, Gemini 3.5 Flash -julkaisu

Sanasto

Token
Tekstin perusyksikkö jonka kielimalli käsittelee ja tuottaa. Yksi token vastaa suunnilleen puolta suomenkielistä sanaa, ja mallin käyttö laskutetaan usein tokenien määrän mukaan.
Konteksti-ikkuna
Tekstimäärä jonka malli pystyy pitämään kerralla muistissaan ja huomioimaan vastatessaan. Miljoonan tokenin ikkunaan mahtuu esimerkiksi useita kirjoja yhtä aikaa.
Frontier-malli
Alan kehittyneimpiin kuuluva huippumalli, joka edustaa tekoälyn nykyistä eturintamaa suorituskyvyssä.

Mihin Pro vielä tarvitaan?

Avoimeksi jää, mihin raskaampaa Pro-mallia enää tarvitaan. Google ei ole haudannut sitä, ja todennäköisesti Pro pitää pintansa kaikkein pisimmissä päättelyketjuissa ja monimutkaisimmassa tieteellisessä työssä. Mutta jos kevyt malli vie valtaosan arkikäytöstä, hintahaarukan yläpää kapenee koko alalla.

Sama logiikka painaa kilpailijoita. OpenAI:n ja Anthropicin on vastattava paitsi älykkyydellä myös tokenin hinnalla ja vasteajalla, kun Google asettaa nopean ja halvan mallin uudeksi vertailukohdaksi.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.