Tekoäly ratkaisi viisi ongelmaa, joita matemaatikot pitivät mahdottomina – menetelmä oli "kaoottinen"
OpenAI:n o4-mini ratkaisi puolet huippumatemaatikoiden tutkimustason tehtävistä. Yhtiön oma tutkija myöntää: prosessi ei näytä inhimilliseltä älykkyydeltä.
Yksitoista huippumatemaatikkoa, mukaan lukien Fields-mitalisti, laati kymmenen julkaisematonta tutkimustason matemaattista ongelmaa tekoälymallien testaamista varten. Nimellä First Proof kulkeva testi kattaa algebrallisen topologian, symplektisen geometrian ja muita edistyneitä matematiikan aloja.
Jokaisen ongelman laatimiseen kului alkuperäisiltä tutkijoilta viikkoja tai kuukausia. Ongelmia ei ole julkaistu aiemmin, joten tekoälymalli ei voi löytää ratkaisua harjoitusaineistostaan. Testi mittaa siis aidosti tekoälyn matemaattista päättelykykyä.
OpenAI:n sisäinen, vielä julkaisematon malli ratkaisi viisi kymmenestä ongelmasta. Julkisesti saatavilla olevat mallit, kuten ChatGPT ja Gemini, ratkaisivat vain kaksi. Ero viittaa siihen, että OpenAI:lla on käytössään merkittävästi tehokkaampia malleja kuin mitä kuluttajille tarjotaan.
“Prosessi oli kaoottinen sprintti. Menetelmä jättää paljon toivomisen varaa. Tulokset ovat lupaavia, mutta tapa jolla niihin päädyttiin ei täytä tieteellisen tutkimuksen standardeja.”
Yksi väite jouduttiin perumaan
OpenAI väitti alun perin ratkaisseensa kuusi kymmenestä ongelmasta. Yhtiö joutui kuitenkin perumaan yhden väitteen tarkemman tarkastelun jälkeen. Tämä herättää kysymyksiä tulosten tarkistusprosessista.
Matemaattisessa tutkimuksessa todistusten oikeellisuuden varmistaminen on keskeistä. Se, että OpenAI itse julkaisi virheellisen väitteen, viittaa siihen, ettei mallin tuottamien todistusten tarkistus ole vielä riittävän systemaattista.
Lupaavaa mutta ei vielä tiedettä
Tulokset ovat kiistatta vaikuttavia. Viisi tutkimustason matemaattista ongelmaa on merkittävä suoritus, ja se osoittaa tekoälymallien päättelykyvyn kehittyneen huomattavasti. Erityisesti kyky käsitellä täysin uusia, julkaisemattomia ongelmia on merkki aidosta matemaattisesta ymmärryksestä.
Samalla on syytä huomioida OpenAI:n oman tutkijan Szymon Pachockin rehellinen arvio. Hänen mukaansa prosessi oli kaoottinen ja menetelmä jättää paljon toivomisen varaa. Tämä viittaa siihen, ettei mallien matemaattinen päättely ole vielä luotettavaa ja toistettavaa.
On myös epäselvää, kuinka monta yritystä malli tarvitsi ratkaisujen löytämiseen ja kuinka paljon ihmisohjausta prosessiin sisältyi. Nämä yksityiskohdat vaikuttavat merkittävästi siihen, miten tuloksia tulisi tulkita.
Julkisten mallien heikko suoriutuminen (kaksi kymmenestä) asettaa tulokset kontekstiin. Suurin osa tekoälystä, jota ihmiset käyttävät päivittäin, ei pysty tämänkaltaiseen matemaattiseen päättelyyn. Huipputulokset kertovat lähinnä siitä, mihin suuntaan ala on kehittymässä.
First Proof on joka tapauksessa arvokas uusi mittari tekoälyn matemaattisen kyvykkyyden arviointiin. Se täydentää olemassa olevia testejä keskittymällä nimenomaan tutkimustason ongelmiin, joita ei voi ratkaista pelkällä kaavamaisella laskennalla.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.