Tekoäly

Gemini 3.1 Pro tuplasi päättelynsä – ja nousi ykköseksi

Googlen uutuusmalli ohitti Opuksen ja GPT-5.2:n, hinta ei noussut.

Aino AikajärviAino Aikajärvi
Jaa:
Gemini 3.1 Pro tuplasi päättelynsä – ja nousi ykköseksi

Päättelykyvyssä yli kaksinkertainen harppaus

Google julkaisi keskiviikkona Gemini 3.1 Pron, yhtiön ensimmäisen .1-päivityksen Gemini-mallisarjaan. Versionumerosta huolimatta kyseessä on merkittävä uudistus. ARC-AGI-2-testissä, joka mittaa mallien kykyä ratkaista uudenlaisia logiikkaongelmia, Gemini 3.1 Pro saavutti 77,1 prosentin tuloksen. Edeltäjä Gemini 3 Pro jäi 31,1 prosenttiin.

Kilpailijavertailussa tulos on yhtä vakuuttava. Anthropicin Opus 4.6 yltää samassa testissä 68,8 prosenttiin ja OpenAI:n GPT-5.2 jää 52,9 prosenttiin. Vielä vuoden 2025 puolella ARC-AGI-2 pidettiin testinä, jossa tekoälymallit eivät pärjää. Nyt kärkimallit ovat rikkoneet 75 prosentin rajan.

Kaikilla mittareilla Gemini ei kuitenkaan johda. Chatbot Arenan tekstitehtävissä Opus 4.6 pitää kärkipaikkaa, ja Humanity's Last Exam -kokeessa työkalujen kanssa Anthropicin malli yltää 53,1 prosenttiin Geminin 44,4 prosenttia vastaan. Tieteellisen tietämyksen GPQA Diamond -testissä Gemini 3.1 Pro tosin loistaa 94,3 prosentin tuloksella.

Säädettävä päättely ja parantunut agenttisuorituskyky

Tärkein käytännön uutuus on kolmitasoinen päättelyjärjestelmä nimeltä Deep Think Mini. Kehittäjä voi valita matalan, keskitason tai korkean päättelytehon tehtävän mukaan. Ero aiemmin julkaistuun Gemini 3 Deep Think -malliin on selvä: Deep Think on erillinen, raskas päättelymalli, kun taas Deep Think Mini on Gemini 3.1 Proon sisäänrakennettu ominaisuus. Korkeimmalla tasolla se tarjoaa syvällistä päättelyä ilman erillistä mallikutsua.

Mallin konteksti-ikkuna on miljoona tokenia, ja vastaus voi olla enimmillään 64 000 tokenia pitkä. Käytännössä kehittäjä voi syöttää mallille satoja sivuja dokumentaatiota kerralla ilman, että tekstiä tarvitsee pilkkoa osiin.

Agenttisuorituskyvyssä parannus edeltäjään nähden on selkeä. MCP Atlas -testissä, joka mittaa työkalujen koordinointia, tulos nousi 54,1 prosentista 69,2 prosenttiin. BrowseComp-verkkohakutestissä hyppy oli vielä suurempi: 59,2 prosentista 85,9 prosenttiin. SWE-Bench Verified -koodaustestissä malli saavutti 80,6 prosenttia, ja LiveCodeBench Pro -kilpakoodaustestissä Elo-luku nousi 2 887 pisteeseen.

77,1 %↑

ARC-AGI-2-tulos

2,5×↑

Parannus edeltäjään

2 $/1M

Syötetokenihinta

1M

Konteksti-ikkuna (tokenia)

Google DeepMind

Sama hinta, enemmän tehoa

Gemini 3.1 Pron API-hinnoittelu on 2 dollaria per miljoona syötetokenia ja 12 dollaria per miljoona tuotostokenia, eli täsmälleen sama kuin edeltäjässä. Vertailun vuoksi Opus 4.6 maksaa 5 ja 25 dollaria samoilla mittareilla. Googlen malli on siis yli puolet halvempi kuin Anthropicin lippulaiva.

Suomalaisille kehittäjille ja tekoäly-yrityksille hintaero on käytännössä merkittävä. Kun sovellus tekee tuhansia API-kutsuja päivässä, kustannusero kertautuu nopeasti. Ennallaan pysynyt hinta tekee Gemini 3.1 Prosta houkuttelevan vaihtoehdon erityisesti startup-yrityksille ja pienemmille toimijoille, joiden budjetit ovat rajallisia. Malli on saatavilla Gemini API:n, AI Studion, Vertex AI:n, Gemini-sovelluksen ja NotebookLM:n kautta.

Google kutsuu julkaisua vielä esikatseluksi, joten parannuksia on todennäköisesti tulossa. Samalla paine Anthropicin ja OpenAI:n hinnoittelua kohtaan kasvaa.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.