Kevyt malli kiilasi raskaamman ohi
Google julkaisi Gemini 3.5 Flashin ja nosti sen saman tien oletusmalliksi miljardeille Gemini-sovelluksen käyttäjille. Aiemmin Flash-sarja on tarkoittanut kevyttä ja karsittua pikaversiota, mutta nyt halpa malli kiilasi raskaamman Gemini 3.1 Pron ohi useissa koodaus- ja agenttitesteissä.
Terminal-Bench 2.1 -testissä Flash ylsi 76,2 prosenttiin, kun Pro jäi 70,3 prosenttiin. Finanssiagenttia mittaavassa Finance Agent v2 -testissä ero oli vielä selvempi: 57,9 vastaan 43,0 prosenttia. Koodausbenchmark SWE-Bench Prossa Flash kirjasi 55,1 prosenttia ja työkalujen käyttöä mittaavassa MCP Atlasissa 83,6 prosenttia.
Nopeampi token-tuotanto kuin muut huippumallit
Halvempi kuin Gemini 3.1 Pro
Tokenin konteksti-ikkuna säilyy
Neljä kertaa nopeampi token-tuotanto
Pelkkä benchmark-voitto ei ole tässä olennaisin asia. Google ilmoittaa, että Flash tuottaa tokeneita noin neljä kertaa nopeammin kuin muut frontier-tason mallit. Malli säilyttää silti miljoonan tokenin konteksti-ikkunan. Käyttäjälle nopeus tarkoittaa vastauksia, jotka ilmestyvät ruudulle lähes välittömästi.
Nopeus ratkaisee erityisesti agenttisovelluksissa. Tekoälyagentti ei tuota yhtä vastausta vaan pyörii silmukassa: se lukee, päättelee, kutsuu työkaluja ja korjaa virheitään kymmeniä tai satoja kertoja peräkkäin. Jokainen kierros odottaa edellisen tokeneita, joten nopeampi malli lyhentää koko ketjun läpimenoaikaa.
Agenttitalouden kustannuslaskelmat menevät uusiksi
Hinta tekee uutisesta merkittävän. Flashin syötetokenit maksavat 1,50 dollaria miljoonalta ja ulostulotokenit 9 dollaria miljoonalta. Välimuistista luettu syöte putoaa 0,15 dollariin. Kokonaisuutena malli on noin 40 prosenttia halvempi kuin Gemini 3.1 Pro.
Agenttien rakentajille yhtälö muuttuu olennaisesti. Tähän asti kehittäjät ovat joutuneet valitsemaan: halpa ja nopea malli yksinkertaisiin tehtäviin, kallis huippumalli vaativaan päättelyyn. Jos kevyt malli yltää huipputasolle koodaus- ja agenttitehtävissä murto-osalla hinnasta, raja näiden välillä katoaa.
Konkreettisesti agentti, joka kuluttaa miljoonia tokeneita päivässä, maksaa nyt selvästi vähemmän ajaa ja valmistuu nopeammin. Se laskee kynnystä rakentaa tekoälyagentteja, jotka hoitavat oikeaa työtä taustalla, eivät vain vastaa yksittäisiin kysymyksiin.



