Avoin ongelma ratkesi tekoälyn avulla
Matemaatikot Will Brian ja Paul Larson julkaisivat vuonna 2019 Ramsey-tyyppisen hypergrafitehtävän, johon kukaan ei ollut löytänyt ratkaisua. Maaliskuussa 2026 tilanne muuttui, kun OpenAI:n GPT-5.4 Pro ratkaisi tehtävän osana Epoch AI:n FrontierMath-vertailukoetta.
Ratkaisu syntyi tutkijoiden Kevin Barretonin ja Liam Pricen ohjauksessa. He suuntasivat tekoälymallia kohti ongelmaa, ja GPT-5.4 Pro tuotti vastauksen, jonka tehtävän alkuperäinen laatija Brian vahvisti. Tulos valmistellaan tieteellistä julkaisua varten.
Mikä on Ramsey-hypergrafitehtävä?
Ramsey-teoria tutkii, missä vaiheessa järjestys syntyy väistämättä suuriin rakenteisiin. Klassinen esimerkki: kuuden hengen juhlissa on aina vähintään kolme ihmistä, jotka kaikki tuntevat toisensa, tai kolme, jotka eivät tunne toisiaan lainkaan. Tämä pätee riippumatta siitä, keitä juhliin kutsutaan.
Brianin ja Larsonin ongelma vie ajatuksen monimutkaisempiin rakenteisiin eli hypergrafeihin. Tehtävänä oli rakentaa mahdollisimman suuria hypergrafeja ilman tiettyä kiellettyä osarakennetta ja siten parantaa alarajaa lukujonolle H(n). Aiemmat ratkaisuyritykset olivat juuttuneet tehottomiin konstruktioihin.
GPT-5.4 Pron ratkaisu poisti tehottomuuden ja tuotti alarajan, joka vastaa ylärajan monimutkaisuutta. Ramsey-teoriassa ylä- ja alarajan kohtaaminen on harvinaista, ja aukot voivat säilyä vuosikymmeniä.
Kolme mallia, yksi ratkaisu
GPT-5.4 Pro ei jäänyt ainoaksi ratkaisijaksi. Kun Epoch AI rakensi parannetun testauskehikon, myös Anthropicin Opus 4.6 ja Googlen Gemini 3.1 Pro selvittivät tehtävän. Opus 4.6 onnistui kerran neljästä yrityksestä, Gemini 3.1 Pro kahdesti neljästä.
Vanhemmat mallit kuten GPT-5.2, Opus 4.5 ja Kimi K2.5 Thinking eivät päässeet maaliin. Ero mallisukupolvien välillä on selvä: matemaattinen päättelykyky kehittyy nopeasti.
FrontierMath-vertailukokeessa kehitys näkyy laajemminkin. GPT-4 ratkaisi vuonna 2024 vain viisi prosenttia tehtävistä. GPT-5.4 Pro yltää nyt 50 prosenttiin tasoilla 1–3 ja 38 prosenttiin vaikeimmalla neljännellä tasolla. Kymmenkertainen parannus kahdessa vuodessa.
Alle prosentti toisessa kokeessa
Samaan aikaan toinen vertailukoe piirtää toisenlaisen kuvan. ARC Prize -säätiön ARC-AGI-3-testi mittaa tekoälyn kykyä oppia uutta vuorovaikutuksessa: mallin pitää tutkia tuntematonta ympäristöä, muodostaa hypoteeseja ja toimia ilman ohjeita.
Tulokset olivat karuja. Gemini 3.1 Pro sai 0,37 prosenttia, GPT-5.4 sai 0,26 prosenttia ja Opus 4.6 sai 0,25 prosenttia pisteistä. xAI:n Grok-4.20 jäi pyöreään nollaan. Ihmiskoehenkilöt ratkaisivat kaikki 135 ympäristöä ilman ennakkotietoja tai ohjeita. Ihminen sata prosenttia, tekoäly alle prosentti.
Ero johtuu siitä, mitä testit mittaavat. FrontierMath testaa kykyä käsitellä formaalia logiikkaa ja hyödyntää laajaa koulutusaineistoa. ARC-AGI-3 testaa kykyä sopeutua tilanteeseen, jota malli ei ole koskaan nähnyt. Edellinen on laskentaa, jälkimmäinen oppimista.
Tehokas haku, ei syvä ymmärrys
Ristiriita kertoo tekoälyn nykytilasta jotain olennaista. Matemaattinen suorituskyky on vaikuttavaa, mutta se perustuu koulutusaineiston laajuuteen ja tehokkaaseen tiedonhakuun.
Computerworld-lehti huomautti, että yksi GPT-5.4 Pron ratkaisuista saattoi nojata vuoden 2011 esijulkaisuun, jota tehtävän laatija ei tuntenut. Malli toimi eräänlaisena yhteyksien yhdistäjänä: se kaivoi unohtuneen tutkimuksen esiin ja sovitti sen uuteen ongelmaan. Se on arvokasta, mutta eri asia kuin itsenäinen matemaattinen oivallus.
Yrityksille ja tutkijoille tämä tarkoittaa käytännössä sitä, että tekoäly on jo erinomainen työkalu formaalien ongelmien ratkaisussa ja olemassa olevan tiedon yhdistelyssä. Tehtävissä, jotka vaativat joustavaa sopeutumista uusiin tilanteisiin, ihminen on yhä ylivoimainen.
Seuraa tilannetta
FrontierMath-vertailukoe seuraa tekoälymallien matemaattista kehitystä osoitteessa epoch.ai/frontiermath. ARC-AGI-3-kilpailu tarjoaa kahden miljoonan dollarin palkinnon tekoälylle, joka saavuttaa ihmistason – toistaiseksi paras tekoälyagentti on päässyt 12,58 prosenttiin. Lisätietoja: arcprize.org.



