Tutkimus

Tekoäly ratkaisi matematiikan mysteerin – oppia se ei ota

Ramsey-ongelma ratkesi, mutta ARC-AGI-3 pysäytti kaikki mallit

Hanna HuulivuoHanna Huulivuo
Jaa:
Tekoäly ratkaisi matematiikan mysteerin – oppia se ei ota

Avoin ongelma ratkesi tekoälyn avulla

Matemaatikot Will Brian ja Paul Larson julkaisivat vuonna 2019 Ramsey-tyyppisen hypergrafitehtävän, johon kukaan ei ollut löytänyt ratkaisua. Maaliskuussa 2026 tilanne muuttui, kun OpenAI:n GPT-5.4 Pro ratkaisi tehtävän osana Epoch AI:n FrontierMath-vertailukoetta.

Ratkaisu syntyi tutkijoiden Kevin Barretonin ja Liam Pricen ohjauksessa. He suuntasivat tekoälymallia kohti ongelmaa, ja GPT-5.4 Pro tuotti vastauksen, jonka tehtävän alkuperäinen laatija Brian vahvisti. Tulos valmistellaan tieteellistä julkaisua varten.

Mikä on Ramsey-hypergrafitehtävä?

Ramsey-teoria tutkii, missä vaiheessa järjestys syntyy väistämättä suuriin rakenteisiin. Klassinen esimerkki: kuuden hengen juhlissa on aina vähintään kolme ihmistä, jotka kaikki tuntevat toisensa, tai kolme, jotka eivät tunne toisiaan lainkaan. Tämä pätee riippumatta siitä, keitä juhliin kutsutaan.

Brianin ja Larsonin ongelma vie ajatuksen monimutkaisempiin rakenteisiin eli hypergrafeihin. Tehtävänä oli rakentaa mahdollisimman suuria hypergrafeja ilman tiettyä kiellettyä osarakennetta ja siten parantaa alarajaa lukujonolle H(n). Aiemmat ratkaisuyritykset olivat juuttuneet tehottomiin konstruktioihin.

GPT-5.4 Pron ratkaisu poisti tehottomuuden ja tuotti alarajan, joka vastaa ylärajan monimutkaisuutta. Ramsey-teoriassa ylä- ja alarajan kohtaaminen on harvinaista, ja aukot voivat säilyä vuosikymmeniä.

Kolme mallia, yksi ratkaisu

GPT-5.4 Pro ei jäänyt ainoaksi ratkaisijaksi. Kun Epoch AI rakensi parannetun testauskehikon, myös Anthropicin Opus 4.6 ja Googlen Gemini 3.1 Pro selvittivät tehtävän. Opus 4.6 onnistui kerran neljästä yrityksestä, Gemini 3.1 Pro kahdesti neljästä.

Vanhemmat mallit kuten GPT-5.2, Opus 4.5 ja Kimi K2.5 Thinking eivät päässeet maaliin. Ero mallisukupolvien välillä on selvä: matemaattinen päättelykyky kehittyy nopeasti.

FrontierMath-vertailukokeessa kehitys näkyy laajemminkin. GPT-4 ratkaisi vuonna 2024 vain viisi prosenttia tehtävistä. GPT-5.4 Pro yltää nyt 50 prosenttiin tasoilla 1–3 ja 38 prosenttiin vaikeimmalla neljännellä tasolla. Kymmenkertainen parannus kahdessa vuodessa.

Alle prosentti toisessa kokeessa

Samaan aikaan toinen vertailukoe piirtää toisenlaisen kuvan. ARC Prize -säätiön ARC-AGI-3-testi mittaa tekoälyn kykyä oppia uutta vuorovaikutuksessa: mallin pitää tutkia tuntematonta ympäristöä, muodostaa hypoteeseja ja toimia ilman ohjeita.

Tulokset olivat karuja. Gemini 3.1 Pro sai 0,37 prosenttia, GPT-5.4 sai 0,26 prosenttia ja Opus 4.6 sai 0,25 prosenttia pisteistä. xAI:n Grok-4.20 jäi pyöreään nollaan. Ihmiskoehenkilöt ratkaisivat kaikki 135 ympäristöä ilman ennakkotietoja tai ohjeita. Ihminen sata prosenttia, tekoäly alle prosentti.

Ero johtuu siitä, mitä testit mittaavat. FrontierMath testaa kykyä käsitellä formaalia logiikkaa ja hyödyntää laajaa koulutusaineistoa. ARC-AGI-3 testaa kykyä sopeutua tilanteeseen, jota malli ei ole koskaan nähnyt. Edellinen on laskentaa, jälkimmäinen oppimista.

Tehokas haku, ei syvä ymmärrys

Ristiriita kertoo tekoälyn nykytilasta jotain olennaista. Matemaattinen suorituskyky on vaikuttavaa, mutta se perustuu koulutusaineiston laajuuteen ja tehokkaaseen tiedonhakuun.

Computerworld-lehti huomautti, että yksi GPT-5.4 Pron ratkaisuista saattoi nojata vuoden 2011 esijulkaisuun, jota tehtävän laatija ei tuntenut. Malli toimi eräänlaisena yhteyksien yhdistäjänä: se kaivoi unohtuneen tutkimuksen esiin ja sovitti sen uuteen ongelmaan. Se on arvokasta, mutta eri asia kuin itsenäinen matemaattinen oivallus.

Yrityksille ja tutkijoille tämä tarkoittaa käytännössä sitä, että tekoäly on jo erinomainen työkalu formaalien ongelmien ratkaisussa ja olemassa olevan tiedon yhdistelyssä. Tehtävissä, jotka vaativat joustavaa sopeutumista uusiin tilanteisiin, ihminen on yhä ylivoimainen.

Seuraa tilannetta

FrontierMath-vertailukoe seuraa tekoälymallien matemaattista kehitystä osoitteessa epoch.ai/frontiermath. ARC-AGI-3-kilpailu tarjoaa kahden miljoonan dollarin palkinnon tekoälylle, joka saavuttaa ihmistason – toistaiseksi paras tekoälyagentti on päässyt 12,58 prosenttiin. Lisätietoja: arcprize.org.

50 %↑

GPT-5.4 Pro, FrontierMath tasot 1–3

< 1 %↓

Paras tekoäly ARC-AGI-3-testissä

100 %↑

Ihminen ARC-AGI-3-testissä

Epoch AI & ARC Prize, 2026

Sanasto

Hypergrafi
Matemaattinen rakenne, jossa yhteys voi yhdistää useamman kuin kaksi pistettä kerrallaan. Tavallisessa verkossa jokainen viiva yhdistää täsmälleen kaksi pistettä, mutta hypergrafissa yksi yhteys voi kattaa kolme tai useamman.

Yhteistyö uutena mallina

Brianin ja Larsonin hypergrafitehtävän ratkaisu voi päätyä tieteelliseen julkaisuun, johon tutkijat Barreto ja Price saavat kanssatekijyyden. Se on uudenlainen malli tieteelliselle työlle: ihminen tunnistaa ongelman ja ohjaa tekoälyä, kone käy läpi valtavan ratkaisuavaruuden.

Tekoäly ei ole yhtä asiaa. Se on matemaatikon tehokas laskin ja samalla toimija, joka ei osaa oppia uutta peliä kokeilemalla. Se, kumman puolen näemme, riippuu täysin siitä, mitä siltä kysymme.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.