AI Co-Mathematician asetti FrontierMath-ennätyksen: 23 oikein 48:sta.
Google DeepMindin matematiikkajärjestelmä AI Co-Mathematician on ratkaissut neljä Paul Erdősin nimeämää avointa konjektuuria semi-autonomisesti. Samalla järjestelmä asetti uuden ennätyksen FrontierMath Tier 4 -testissä saavuttamalla 23 oikeaa vastausta 48 tehtävästä.
Tulokset julkaistiin DeepMindin tutkimusryhmän arxiv-paperissa. Riippumaton matemaatikkopaneeli on aloittanut todistusten vertaisarvioinnin, ja keskustelu käy vilkkaana matematiikan tutkimusyhteisössä myös Suomessa.
Kuka oli Erdős ja miksi hänen ongelmansa painavat
Unkarilainen Paul Erdős (1913–1996) oli yksi 1900-luvun tuotteliaimmista matemaatikoista. Hän julkaisi noin 1 500 artikkelia yli 500 kanssakirjoittajan kanssa ja jätti perinnöksi satoja avoimia ongelmia kombinatoriikan, lukuteorian ja graafiteorian alueilta.
Erdősin tapa työskennellä oli erityinen. Hän muotoili kysymyksiä, joiden vaikeus on petollinen: lauseet näyttävät lyhyiltä ja alkeellisilta, mutta niiden todistaminen vaatii uudenlaista oivallusta. Tästä syystä Erdős-konjektuurit ovat olleet matemaatikoille kuin korkeita huippuja, joita on yritetty kavuta vuosikymmeniä.
FrontierMath Tier 4 on matematiikan kovin koe
FrontierMath on Epoch AI:n koordinoima vertailutesti, joka mittaa tekoälyjen kykyä ratkoa tutkimustason matemaattisia ongelmia. Tehtävät ovat alkuperäisiä ja salaisia, jotta mallit eivät voi opetella vastauksia ulkoa. Tier 4 on testin vaikein taso: sen tehtävät on suunniteltu siten, että tohtoritason matemaatikolta menisi yhteen tehtävään päiviä tai viikkoja.
Aiempi Tier 4 -ennätys oli noin kymmenen prosentin luokkaa. AI Co-Mathematicianin tulos 23/48 tarkoittaa lähes kaksinkertaista hyppyä lyhyessä ajassa, ja se on suurin yksittäinen edistysaskel benchmarkin julkaisun jälkeen.
Mitkä neljä ongelmaa?
Paperissa eritellyt todistukset koskevat kombinatoriikan, graafiteorian ja lukuteorian alueita. DeepMindin tutkijat ovat jättäneet yksityiskohtaiset todistukset matemaatikkopaneelin vertaisarviointiin, joten lopullinen varmuus tulee vasta arvioinnin jälkeen. Tässä vaiheessa puhutaan ennakkotuloksesta, vaikka vertailutestin ennätys onkin vahva signaali järjestelmän kyvyistä.
Miten Aalto näkee tilanteen
Aalto-yliopistossa ja muissa kotimaisissa matematiikan laitoksissa tulokseen suhtaudutaan kiinnostuneesti mutta varauksella. Paperi vaatii huolellisen vertaisarvioinnin, ennen kuin sen merkitys voidaan vahvistaa. Suomalaisessa tutkimuskentässä on totuttu siihen, että näyttävä numero ei vielä tee todistuksesta oikeaa.
Yleinen näkemys matematiikan tutkimusyhteisössä on, että tekoäly ei korvaa matemaatikkoa vaan muuttaa työnkulun. Tutkija voi käyttää järjestelmää lemmien todistamiseen, hypoteesien testaamiseen ja vastaesimerkkien etsintään, mutta tutkimuskysymyksen muotoilu ja tulosten arviointi pysyvät ihmisen vastuulla.
Vertailukohta löytyy fysiikan ja tietojenkäsittelyn puolelta. Numeerinen simulointi ja symbolinen laskenta ovat olleet käytössä vuosikymmeniä eivätkä ne ole syrjäyttäneet tutkijaa, vaan vapauttaneet tämän rutiininomaisesta laskennasta vaativampien kysymysten pariin. Tekoälypohjainen matematiikka näyttää menevän samaan suuntaan.
Miksi tämä koskee muutakin kuin matemaatikkoja
Matematiikan eteneminen vaikuttaa arkeen lähes huomaamatta. Verkkokaupan suosittelujärjestelmät, lääkkeiden suunnittelu, salaus ja logistiikka nojaavat kaikki kombinatoriikkaan, lukuteoriaan ja graafiteoriaan. Kun avoin ongelma ratkeaa, siitä syntyy usein algoritmeja, jotka kantavat kymmeniksi vuosiksi.
Erdős-tyyppiset graafiongelmat liittyvät esimerkiksi tietoverkkojen suunnitteluun. Niiden ratkaisut voivat tarkoittaa tehokkaampia reititysalgoritmeja, joita käytetään matkapuhelinverkoissa, datakeskuksissa ja sähköverkkojen optimoinnissa. Suomalaisille teleoperaattoreille ja energiayhtiöille tämä tarkoittaa pitkällä aikavälillä edullisempaa infrastruktuuria.
Kysymys siitä, onko matematiikka kallis vai halpa tutkimusala, saa uuden sävyn. Tekoälyavusteinen matematiikka voi nopeuttaa tutkimusta merkittävästi, mutta se ei vähennä tarvetta huipputason matemaatikoille, jotka osaavat muotoilla oikeita kysymyksiä ja tarkistaa vastaukset. Pikemminkin se nostaa heidän työnsä arvoa.
FrontierMath Tier 4 -tulokset
AI Co-Mathematician (DeepMind, 2026)48 % (23/48)
Epoch AI, arxiv
Sanasto
- Konjektuuri
- Matemaattinen väite, jota uskotaan todeksi mutta jota ei ole vielä todistettu. Avoin konjektuuri on kuin arvoitus, joka odottaa ratkaisijaa.
- Vertailutesti (benchmark)
- Vakiintunut testijoukko, jolla eri tekoälyjen suoritusta vertaillaan keskenään. Esimerkiksi FrontierMath mittaa kykyä ratkoa matemaattisia ongelmia.
- Formaali verifiointi (Lean)
- Tapa tarkistaa matemaattinen todistus tietokoneella askel askeleelta. Lean on ohjelmointikieli, jolla todistukset kirjoitetaan koneen ymmärrettävään muotoon.
Seuraavat kuukaudet ratkaisevat
Matematiikan vertaisarviointi on tunnetusti hidasta. DeepMindin paperi vaatii kuukausia, ehkä yli vuoden tarkistustyötä, ennen kuin todistukset voidaan vahvistaa tai kumota. Siihen saakka kyse on ennakkotuloksesta, joka pitää lukea kahteen kertaan ennen suuria johtopäätöksiä.
Suomalaisessa matematiikan tutkimuksessa keskustelu kääntyy nyt siihen, mihin Suomi voisi profiloitua. Aalto, Helsingin yliopisto ja Jyväskylä ovat jo aiemmin investoineet matemaattiseen tekoälyyn ja todistusten formaaliin verifiointiin Lean-kielellä. Tuon työn arvo nousee, kun tekoälypohjaiset todistukset yleistyvät ja kaipaavat koneluettavaa tarkistusta. Saatamme nähdä, että Suomen rooli löytyy juuri verifioinnin puolelta, ei kilpailusta isoja kielimalleja vastaan.
Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta.
Lue lisää toimintaperiaatteistamme.