Koneoppiminen

Gemini Deep Think rikkoi tieteen testiennätyksen

82,4 prosenttia GPQA Diamond -testissä on alan vahvin julkaistu päättelytulos.

Hanna HuulivuoHanna Huulivuo
Jaa:
Gemini Deep Think rikkoi tieteen testiennätyksen
Kuva: The Pancake of Heaven! / CC BY-SA 4.0

Kesäkuu 2026 jää AI-alan muistiin julkaisukohujen kuukautena. Gemini 3.5 Pro myöhästyi, GPT-5.6 pysyi vain valittujen kumppanien käytössä, ja vedonlyöntimarkkinat hinnoittelivat odotetut julkaisut alas. Tässä metelissä jäi vähälle huomiolle se, että Google julkaisi 22. kesäkuuta hiljaa Gemini 2.5 Pro -mallin Deep Think -tilan, joka ylsi 82,4 prosenttiin GPQA Diamond -testissä.

Luku on tämänhetkisten tietojen mukaan vahvin julkisesti raportoitu tiede- ja päättelytulos. Toisin kuin kuukauden näyttävät esikatselut ja viivästykset, tämä oli konkreettinen ja mitattava edistysaskel.

Mitä GPQA Diamond oikeastaan mittaa

GPQA Diamond ei ole tavallinen tietovisa. Se on kokoelma kysymyksiä, jotka väitöskirjatason asiantuntijat ovat laatineet omalta erikoisalaltaan fysiikassa, kemiassa ja biologiassa. Diamond on testin vaikein osajoukko, noin 200 kysymystä, jotka on suunniteltu niin tiukoiksi, ettei niihin löydy vastausta pelkällä hakukoneella.

Vertailukohta kertoo vaikeustasosta. Saman alan väitelleet asiantuntijat yltävät tyypillisesti noin 65 prosentin tarkkuuteen, ja toisen alan osaajat jäävät verkkohaun kanssakin noin kolmasosaan. Testi mittaa siis aitoa päättelyä, ei muistitietoa. Juuri siksi 82,4 prosenttia on tutkimuksen näkökulmasta merkittävä, ei pelkkä pyöreä luku markkinointidiassa.

Miksi tulos painaa juuri nyt

Deep Think on Geminin tila, jossa malli käyttää enemmän laskenta-aikaa ja kulkee vastaukseen useamman päättelyketjun kautta ennen lopullista ratkaisua. Lähestymistapa muistuttaa sitä, miten ihminen pohtii vaikeaa ongelmaa: ei suolla ensimmäistä mieleen tulevaa vastausta, vaan punnitsee vaihtoehtoja. Tieteellisissä kysymyksissä tämä lisäaika näkyy suoraan tuloksissa.

Konteksti tekee julkaisusta poikkeuksellisen. Google menetti viidessä kuukaudessa kuusi vanhempaa tutkijaansa kilpailijoille, ja Gemini 3.5 Pron viivästys painoi mielikuvaa hyytyneestä kehityksestä. Samaan aikaan Deep Think osoitti, että perusmallin päättelykyky oli yhä kasvussa. Hiljainen julkaisu ilman näyttävää lavashow'ta korosti viestiä: tulos puhui puolestaan.

“Deep Think ratkaisee testin kysymyksiä, joihin saman alan väitellytkin asiantuntija vastaa väärin joka kolmas kerta.”

— GPQA Diamond -testin vaikeustaso, Tutkimusvertailu

Mitä tämä merkitsee tavalliselle käyttäjälle

Testipisteet kuulostavat kaukaisilta, mutta ne ennakoivat hyvin sitä, mihin malli kykenee oikeassa työssä. Kun tekoäly osaa kuljettaa monivaiheisen tieteellisen päättelyn loppuun, se pärjää paremmin myös arkisemmissa tehtävissä: lääkärin diagnoosin tukena, insinöörin laskelmien tarkistajana tai opiskelijan ohjaajana vaikeassa fysiikan ongelmassa.

Yrityksille viesti on käytännöllinen. Mitä luotettavammin malli päättelee, sitä useamman asiantuntijatehtävän se voi ottaa hoitaakseen ilman jatkuvaa ihmisen tarkistusta. Tutkimusvetoiset alat, kuten lääkekehitys ja materiaalitiede, hyötyvät eniten, koska niissä juuri päättelyn syvyys ratkaisee. Toinen puoli on, että lisälaskenta maksaa, joten Deep Thinkin kaltainen tila ei ole vielä jokaisen kysymyksen oletusratkaisu.

Lyhyesti

Gemini 2.5 Pro Deep Think julkaistiin 22. kesäkuuta 2026. Se ylsi 82,4 prosenttiin GPQA Diamond -testissä, joka mittaa väitöskirjatason tieteellistä päättelyä. Tulos on tämänhetkisten tietojen mukaan vahvin julkaistu, ja se ylittää selvästi ihmisasiantuntijan tyypillisen tason.

Yksittäinen testitulos ei kerro koko tarinaa, ja vertailulukuja kannattaa lukea varauksella, koska kehittäjät raportoivat ne itse omilla asetuksillaan. Silti kesäkuun opetus on selvä. Alan eteneminen ei mitata enää pelkästään lavajulkaisuilla ja lupauksilla, vaan sillä, kuka todella siirtää mitattavaa rajaa. Tällä kertaa raja siirtyi tieteen kysymyksissä, ja se tapahtui ilman suuria valoja.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Datakeskus söisi Lapinlahdella kokonaisen kaupungin sähköt
  4. 4Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  5. 5Suomalaisen tekoälypilven arvo yli miljardi – mukana eläkerahaa

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.