Tutkimus

Tekoäly ratkaisi viisi ongelmaa, joita matemaatikot pitivät mahdottomina – menetelmä oli "kaoottinen"

OpenAI:n o4-mini ratkaisi puolet huippumatemaatikoiden tutkimustason tehtävistä. Yhtiön oma tutkija myöntää: prosessi ei näytä inhimilliseltä älykkyydeltä.

Aino AikajärviAino Aikajärvi
Jaa:
Tekoäly ratkaisi viisi ongelmaa, joita matemaatikot pitivät mahdottomina – menetelmä oli "kaoottinen"

First Proof: matemaatikoiden haaste tekoälylle

Yksitoista huippumatemaatikkoa, mukaan lukien Fields-mitalisti, laati kymmenen julkaisematonta tutkimustason matemaattista ongelmaa tekoälymallien testaamista varten. Nimellä First Proof kulkeva testi kattaa algebrallisen topologian, symplektisen geometrian ja muita edistyneitä matematiikan aloja.

Jokaisen ongelman laatimiseen kului alkuperäisiltä tutkijoilta viikkoja tai kuukausia. Ongelmia ei ole julkaistu aiemmin, joten tekoälymalli ei voi löytää ratkaisua harjoitusaineistostaan. Testi mittaa siis aidosti tekoälyn matemaattista päättelykykyä.

OpenAI:n sisäinen, vielä julkaisematon malli ratkaisi viisi kymmenestä ongelmasta. Julkisesti saatavilla olevat mallit, kuten ChatGPT ja Gemini, ratkaisivat vain kaksi. Ero viittaa siihen, että OpenAI:lla on käytössään merkittävästi tehokkaampia malleja kuin mitä kuluttajille tarjotaan.

“Prosessi oli kaoottinen sprintti. Menetelmä jättää paljon toivomisen varaa. Tulokset ovat lupaavia, mutta tapa jolla niihin päädyttiin ei täytä tieteellisen tutkimuksen standardeja.”

— Szymon Pachocki, Tutkija, OpenAI

Yksi väite jouduttiin perumaan

OpenAI väitti alun perin ratkaisseensa kuusi kymmenestä ongelmasta. Yhtiö joutui kuitenkin perumaan yhden väitteen tarkemman tarkastelun jälkeen. Tämä herättää kysymyksiä tulosten tarkistusprosessista.

Matemaattisessa tutkimuksessa todistusten oikeellisuuden varmistaminen on keskeistä. Se, että OpenAI itse julkaisi virheellisen väitteen, viittaa siihen, ettei mallin tuottamien todistusten tarkistus ole vielä riittävän systemaattista.

Lupaavaa mutta ei vielä tiedettä

Tulokset ovat kiistatta vaikuttavia. Viisi tutkimustason matemaattista ongelmaa on merkittävä suoritus, ja se osoittaa tekoälymallien päättelykyvyn kehittyneen huomattavasti. Erityisesti kyky käsitellä täysin uusia, julkaisemattomia ongelmia on merkki aidosta matemaattisesta ymmärryksestä.

Samalla on syytä huomioida OpenAI:n oman tutkijan Szymon Pachockin rehellinen arvio. Hänen mukaansa prosessi oli kaoottinen ja menetelmä jättää paljon toivomisen varaa. Tämä viittaa siihen, ettei mallien matemaattinen päättely ole vielä luotettavaa ja toistettavaa.

On myös epäselvää, kuinka monta yritystä malli tarvitsi ratkaisujen löytämiseen ja kuinka paljon ihmisohjausta prosessiin sisältyi. Nämä yksityiskohdat vaikuttavat merkittävästi siihen, miten tuloksia tulisi tulkita.

Julkisten mallien heikko suoriutuminen (kaksi kymmenestä) asettaa tulokset kontekstiin. Suurin osa tekoälystä, jota ihmiset käyttävät päivittäin, ei pysty tämänkaltaiseen matemaattiseen päättelyyn. Huipputulokset kertovat lähinnä siitä, mihin suuntaan ala on kehittymässä.

First Proof on joka tapauksessa arvokas uusi mittari tekoälyn matemaattisen kyvykkyyden arviointiin. Se täydentää olemassa olevia testejä keskittymällä nimenomaan tutkimustason ongelmiin, joita ei voi ratkaista pelkällä kaavamaisella laskennalla.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.