Päättelykyvyssä yli kaksinkertainen harppaus
Google julkaisi keskiviikkona Gemini 3.1 Pron, yhtiön ensimmäisen .1-päivityksen Gemini-mallisarjaan. Versionumerosta huolimatta kyseessä on merkittävä uudistus. ARC-AGI-2-testissä, joka mittaa mallien kykyä ratkaista uudenlaisia logiikkaongelmia, Gemini 3.1 Pro saavutti 77,1 prosentin tuloksen. Edeltäjä Gemini 3 Pro jäi 31,1 prosenttiin.
Kilpailijavertailussa tulos on yhtä vakuuttava. Anthropicin Opus 4.6 yltää samassa testissä 68,8 prosenttiin ja OpenAI:n GPT-5.2 jää 52,9 prosenttiin. Vielä vuoden 2025 puolella ARC-AGI-2 pidettiin testinä, jossa tekoälymallit eivät pärjää. Nyt kärkimallit ovat rikkoneet 75 prosentin rajan.
Kaikilla mittareilla Gemini ei kuitenkaan johda. Chatbot Arenan tekstitehtävissä Opus 4.6 pitää kärkipaikkaa, ja Humanity's Last Exam -kokeessa työkalujen kanssa Anthropicin malli yltää 53,1 prosenttiin Geminin 44,4 prosenttia vastaan. Tieteellisen tietämyksen GPQA Diamond -testissä Gemini 3.1 Pro tosin loistaa 94,3 prosentin tuloksella.
Säädettävä päättely ja parantunut agenttisuorituskyky
Tärkein käytännön uutuus on kolmitasoinen päättelyjärjestelmä nimeltä Deep Think Mini. Kehittäjä voi valita matalan, keskitason tai korkean päättelytehon tehtävän mukaan. Ero aiemmin julkaistuun Gemini 3 Deep Think -malliin on selvä: Deep Think on erillinen, raskas päättelymalli, kun taas Deep Think Mini on Gemini 3.1 Proon sisäänrakennettu ominaisuus. Korkeimmalla tasolla se tarjoaa syvällistä päättelyä ilman erillistä mallikutsua.
Mallin konteksti-ikkuna on miljoona tokenia, ja vastaus voi olla enimmillään 64 000 tokenia pitkä. Käytännössä kehittäjä voi syöttää mallille satoja sivuja dokumentaatiota kerralla ilman, että tekstiä tarvitsee pilkkoa osiin.
Agenttisuorituskyvyssä parannus edeltäjään nähden on selkeä. MCP Atlas -testissä, joka mittaa työkalujen koordinointia, tulos nousi 54,1 prosentista 69,2 prosenttiin. BrowseComp-verkkohakutestissä hyppy oli vielä suurempi: 59,2 prosentista 85,9 prosenttiin. SWE-Bench Verified -koodaustestissä malli saavutti 80,6 prosenttia, ja LiveCodeBench Pro -kilpakoodaustestissä Elo-luku nousi 2 887 pisteeseen.



