Tutkimus

Putnam-kokeen mediaani on nolla – tekoäly sai täydet

Axiom keräsi 200 miljoonaa todistajalle, joka ei hallusinoi

Aino AikajärviAino Aikajärvi
Jaa:
Putnam-kokeen mediaani on nolla – tekoäly sai täydet

Viisi ihmistä sadassa vuodessa

Yhdysvaltalainen Axiom ilmoitti maaliskuun alussa, että sen AxiomProver-järjestelmä sai täydelliset 120 pistettä vuoden 2025 Putnam-kokeesta. Putnam on Pohjois-Amerikan arvostetuin yliopistotason matematiikkakilpailu, ja kokeen lähes sadan vuoden historiassa vain viisi ihmistä on yltänyt täysiin pisteisiin.

Kokeen vaikeus on legendaarinen. Vuosittain noin 4 000 matematiikan opiskelijaa yrittää ratkaista 12 tehtävää, jotka vaativat luovaa ongelmanratkaisua lukuteoriasta ryhmäteoriaan. Mediaanipisteet ovat tyypillisesti nolla tai yksi 120:stä. Vuoden 2024 kilpailussa keskiarvo oli kahdeksan pistettä, ja vain prosentti osallistujista ylsi yli puoleen pisteistä.

Vuonna 2025 paras ihmistulos oli 110 pistettä. Axiomin tekoäly päihitti senkin ja ratkaisi kaikki 12 tehtävää virheettömästi.

Todistaminen, ei arvaaminen

Axiomin teknologia eroaa perinteisistä kielimalleista yhdellä ratkaisevalla tavalla: se ei arvaa. Tavallinen kielimalli tuottaa tilastollisesti todennäköisimmän vastauksen, joka voi näyttää oikealta mutta olla täysin väärä. Axiom käyttää Lean-ohjelmointikieltä, joka on suunniteltu matemaattisten todistusten koneelliseen tarkistamiseen.

Jokainen päättelyvaihe on Leanissa formaalisti verifioitavissa. Järjestelmä ei voi tuottaa virheellistä tulosta huomaamatta, koska todistuksen jokainen askel tarkistetaan automaattisesti. Tämä poistaa hallusinaatio-ongelman, joka on suurin yksittäinen este tekoälyn käyttöönotolle kriittisillä aloilla.

Axiomin lähestymistapa luo myös itseään vahvistavan kehän. Kun järjestelmä tuottaa verifioitua dataa, sitä voidaan käyttää mallin jatkokouluttamiseen ilman riskiä siitä, että koulutusdata sisältää virheitä. Perinteisissä kielimalleissa tekoälyn tuottaman datan syöttäminen takaisin koulutukseen johtaa laadun heikkenemiseen.

Erottelu on merkittävä erityisesti ohjelmistokehityksessä. Kun tekoäly tuottaa yhä suuremman osan maailman koodista, kasvaa tarve varmistaa, että koodi tekee sen mitä sen pitää. Axiom tarjoaa matemaattisen takuun: koodi on oikein eikä se sisällä tietoturva-aukkoja.

“Kielimallit ovat luonteeltaan tilastollisia – ne tuottavat uskottavia tuloksia, eivät todistettavasti oikeita tai turvallisia.”

— Matt Kraning ja C.C. Gong, Menlo Ventures:n kumppanit

25-vuotias perustaja ja matemaatikko, joka luopui virasta

Axiomin perusti Carina Hong, 25-vuotias MIT:stä valmistunut matemaatikko, joka keskeytti Stanfordin jatko-opintonsa yrityksen takia. Hong on Morgan-palkinnon voittaja ja yhdeksän vertaisarvioidun julkaisun kirjoittaja.

Yhtiön perustajajäsen Ken Ono on yksi maailman tunnetuimmista lukuteoreetikoista ja Ramanujanin matematiikan asiantuntija. Hän jätti vakituisen professorin virkansa ja varaprovostin tehtävän Virginian yliopistossa liittyäkseen Axiomiin kokopäiväisesti. Tekniikkajohtajana toimii Shubho Sengupta, joka johti aiemmin Metan tekoälytutkimusyksikön infrastruktuuria kahdeksan vuoden ajan.

Tiimin osaaminen näkyy tuloksissa. Putnam-kokeen lisäksi Axiomin tekoäly ratkaisi formaalisti 20 vuotta avoinna olleen lukuteoreettisen konjektuurin, johon Ono itse ei ollut koskaan pystynyt. Järjestelmä tuotti todistuksen Lean-kielellä täysin itsenäisesti, ilman ihmisen ohjausta.

Sanasto

Formaali verifiointi
Matemaattinen menetelmä, jolla todistetaan loogisesti, että ohjelma tai ratkaisu on varmasti oikein – ei testaamalla vaan osoittamalla, ettei virheitä voi olla.
Hallusinaatio
Tekoälyn tuottama vastaus, joka vaikuttaa uskottavalta mutta on virheellinen. Kielimallit hallusinoivat, koska ne tuottavat tilastollisesti todennäköistä tekstiä eivätkä tarkista faktojen paikkansapitävyyttä.

200 miljoonan veto formaalista todistamisesta

Axiom keräsi maaliskuussa 200 miljoonan dollarin Series A -kierroksen Menlo Ventures:n johdolla. Kierros nosti alle vuoden ikäisen yhtiön arvostuksen 1,6 miljardiin dollariin. Lokakuussa yhtiö oli kerännyt 64 miljoonan dollarin siemenkierroksen.

Rahoituksen kokoluokka kertoo, kuinka vakavasti sijoittajat suhtautuvat formaaliin verifiointiin. Sijoittaja B Capital kuvaa tilannetta suoraan: Axiomilla on etuoikeus tarkistaa jokainen tekoälyn tuottama koodirivi, jolla on merkitystä. Kun ohjelmistokoodia käytetään lääkinnällisissä laitteissa, liikennejärjestelmissä ja rahoitusinfrastruktuurissa, matemaattinen todistettavuus muuttuu kilpailuedusta välttämättömyydeksi.

Yhtiö julkaisi samalla AXLE-työkalunsa, skaalautuvan Lean-moottorin, jonka rajapinta on avoin kehittäjille. Suomalaisille ohjelmistotaloille kehitys on seuraamisen arvoista: jos tekoäly tuottaa koodin ja toinen järjestelmä todistaa sen matemaattisesti oikeaksi, koko ohjelmistokehityksen luotettavuusstandardi voi muuttua tavalla, jossa nykyiset testausmenetelmät eivät enää riitä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.