Koneoppiminen

Claude Mythos kiilasi kärkeen testissä, joka nujertaa tohtorit

GPQA Diamondissa Mythos johtaa, mutta Grok 4.1 vie laajemman yhdistelmätestin.

Hanna HuulivuoHanna Huulivuo
Jaa:
Claude Mythos kiilasi kärkeen testissä, joka nujertaa tohtorit

Tekoälymallien päättelykyvyn mittaaminen on muuttunut hankalaksi. Perinteiset testit ovat kyllästyneet, kun huippumallit ratkovat ne lähes virheettömästi. Siksi katse on kääntynyt testeihin, jotka yhä erottelevat kärjen kärjestä. Yksi niistä on GPQA Diamond, ja siinä Anthropicin uusi Claude Mythos Preview kiilasi juuri kaikkien ohi lukemalla 94,6 prosenttia.

Testi, jota edes tohtorit eivät läpäise

GPQA on 448 monivalintakysymyksen kokoelma, jonka ovat laatineet biologian, fysiikan ja kemian tohtoritason asiantuntijat. Diamond on sen vaikein osajoukko: 198 kysymystä, joissa alan asiantuntijat ovat yksimielisiä oikeasta vastauksesta mutta joissa ulkopuoliset epäonnistuvat toistuvasti.

Luvut kertovat vaikeustason. Saman alan tohtorit tai tohtoriopiskelijat pääsevät noin 65 prosentin tarkkuuteen. Taitavat mutta alan ulkopuoliset arvioijat jäävät 34 prosenttiin, vaikka he saavat käyttää rajattomasti internetiä ja pähkäillä keskimäärin yli puoli tuntia kysymystä kohti. Juuri tästä tulee lempinimi Google-proof: vastausta ei voi hakea hakukoneella.

Kun kysymystä ei voi ratkoa hakemalla, testi mittaa aidosti päättelyä. Mallin on rakennettava vastaus vaihe vaiheelta faktojen yhdistelmästä. Tämä selittää, miksi GPQA Diamond erottelee frontier-mallit toisistaan silloinkin, kun helpommat testit näyttävät tasapeliä.

Kärki on tiukassa nipussa

Mythosin 94,6 prosenttia ei ole irtiotto vaan niukka johto. Googlen Gemini 3.1 Pro seuraa lukemalla 94,3 ja Anthropicin edellinen huippumalli Claude Opus 4.7 on 94,2 prosentissa. Kolmen kärki mahtuu alle puolen prosenttiyksikön sisään. Kun kysymyksiä on 198, ero kärkimallien välillä on käytännössä muutama oikea vastaus suuntaan tai toiseen.

Laajemmassa päättelyn kokonaisarviossa, joka niputtaa yhteen sadat testit logiikasta monivaiheiseen päättelyyn, Mythos johtaa pisteellä 71,0. Grok 4.1 puolestaan hallitsee erästä laajempaa yhdistelmätestiä lukemalla 97,6. Kärkipaikka riippuu siis siitä, mitä mittaria katsoo. Sama malli voi olla ykkönen yhdessä ja kolmas toisessa.

94,6 %↑

Claude Mythos Preview

94,3 %

Gemini 3.1 Pro

94,2 %

Claude Opus 4.7

llm-stats.com

GPQA Diamond: Claude Mythos jättää asiantuntijat taakseen

Alan ulkopuoliset arvioijat34 %
Alan tohtorit65 %
Claude Mythos Preview94,6 %

GPQA, arXiv 2311.12022; llm-stats.com

Mitä benchmark-luku ei kerro

Yksittäinen prosenttiluku kätkee paljon. Tulos riippuu siitä, saako malli käyttää ylimääräistä laskenta-aikaa niin sanottuun ajatteluun, montako kertaa vastaus haetaan ja kuka tuloksen on toistanut. Preview-malli on lisäksi varhaisversio, jonka luvut voivat vielä muuttua. Monivalintatesti palkitsee myös pelkästä oikean vaihtoehdon tunnistamisesta, ei välttämättä siitä, että malli ymmärtää miksi.

Leaderboardin ylläpitäjät huomauttavat itsekin, että ajattelumallit kiilaavat päättelytesteissä kärkeen, koska ne saavat käyttää enemmän laskentaa kutakin tehtävää kohti. Se ei ole huijausta, mutta se tarkoittaa, ettei vertailu aina koske samalla viivalla olevia malleja.

Sanasto

Benchmark
Vertailutesti, jolla mitataan ja verrataan tekoälymallien suorituskykyä samoilla tehtävillä. Tulos ilmoitetaan yleensä prosentteina tai pisteinä.
Frontier-malli
Alan kehittyneimmät, aivan kärjessä olevat tekoälymallit. Termi viittaa mallien eturintamaan eli kaikkein uusimpiin ja tehokkaimpiin malleihin.

Miksi tohtoritason testi näkyy arjessa

Tavalliselle käyttäjälle GPQA Diamondin prosentit tuntuvat kaukaisilta, mutta ne ennakoivat konkreettista asiaa. Kun malli osaa yhdistellä kemian, fysiikan ja biologian faktoja tohtoritasolla, se pärjää paremmin myös tehtävissä, joissa pitää päätellä monen askeleen kautta: lääkärin apuna oireiden tulkinnassa, insinöörin laskelmien tarkistajana tai lakitekstin ristiriitojen etsijänä. Mitä paremmin malli päättelee, sitä harvemmin se keksii vastauksen tyhjästä.

Kilpajuoksu on kiristynyt pisteeseen, jossa yksi luku ei enää kruunaa voittajaa. Anthropic johtaa vaikeinta tieteellistä testiä, xAI vie laajimman yhdistelmämittarin ja Google hengittää niskaan molemmissa. Kärkisijoihin kannattaa suhtautua kuin sääennusteeseen: ne kertovat suunnan, eivät lopputulosta. Seuraava malli mittaa itsensä jo nyt näihin lukuihin, ja järjestys ehtii vaihtua ennen kuin ehdit lukea tämän loppuun.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  4. 4Datakeskus söisi Lapinlahdella kokonaisen kaupungin sähköt
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.