Kone, joka tekee tiedettä
Nature-lehti julkaisi maaliskuun lopussa tutkimuksen, joka haastaa käsityksemme siitä, kuka voi kutsua itseään tutkijaksi. Tokiolaisen Sakana AI:n, Brittiläisen Kolumbian yliopiston (UBC), Vector Instituten ja Oxfordin yliopiston tutkijat esittelivät artikkelissa AI Scientist -järjestelmän, joka suorittaa koneoppimisen tutkimusprosessin alusta loppuun ilman ihmisen ohjausta.
Käytännössä järjestelmä saa lähtökohdakseen koodipohjan ja tutkimusalueen. Se generoi tutkimusideoita, tarkistaa Semantic Scholar -tietokannasta onko idea uusi, kirjoittaa kokeellisen koodin, korjaa omat virheensä ja iteroi kunnes kokeet toimivat. Tulosten analysointi, kuvaajien piirtäminen ja valmiin tieteellisen artikkelin kirjoittaminen tapahtuvat samassa putkessa. Lopuksi järjestelmä arvioi oman työnsä erillisellä arviointimoduulilla.
Yhden artikkelin tuottaminen maksaa 6–15 dollaria ja vaatii ihmiseltä noin 3,5 tuntia valvontatyötä. UBC:n professori Jeff Clune johti tutkimusta.
Vertaisarvioinnin läpi – mutta miten?
Tutkijat testasivat järjestelmäänsä lähettämällä kolme sen tuottamaa artikkelia ICLR 2025 -koneoppimiskonferenssin workshopiin. Yksi niistä sai keskiarvosanan 6,33, joka ylitti workshopin tyypillisen hyväksymiskynnyksen.
Tulos kuulostaa vaikuttavalta, mutta konteksti ratkaisee. Kyseessä oli workshop, ei konferenssin päärata. Workshopit ovat tieteellisen julkaisemisen kevyempi muoto, jossa uusia ja keskeneräisiäkin ideoita esitellään matalammalla kynnyksellä. Pääkonferenssin hyväksymiskynnys olisi huomattavasti korkeampi.
Silti kynnys ylittyi, ja sen teki kone.
Kiireisen kandin tasoa
Helmikuussa 2025 julkaistu riippumaton arviointi, joka kohdistui järjestelmän aiempaan versioon, piirtää AI Scientistista karumman kuvan. Arvioijat testasivat järjestelmää käytännössä ja havaitsivat, että 42 prosenttia kokeista epäonnistui ohjelmointivirheiden vuoksi. Nekin kokeet, jotka onnistuivat, tuottivat usein harhaanjohtavia tai loogisesti virheellisiä tuloksia.
Kirjallisuuskatsaus osoittautui pintapuoliseksi. Järjestelmä luokitteli pitkään tunnettuja optimointimenetelmiä uusiksi keksinnöiksi. Artikkelien lähdeluettelot olivat niukkoja: mediaani oli viisi viittausta per artikkeli, joista valtaosa oli vanhentuneita.
Vakavimpia ongelmia olivat keksityt koetulokset. Järjestelmä sepitti lukuja, vaikka sitä oli nimenomaisesti ohjeistettu käyttämään vain todellista dataa. Artikkeleihin jäi myös rakennevirheitä: puuttuvia kuvia, toistuvia osioita ja paikkamerkkitekstejä kuten "Conclusions Here". Riippumattomien arvioijien tiivistys oli tyly – tuotos vastaa laadultaan kiireessä kirjoitettua kandidaatintutkielmaa.
“AI Scientist avaa oven rekursiiviselle itseoppimiselle, jossa tekoälyjärjestelmä ei vain löydä uutta tieteellistä tietoa vaan käyttää löydöksiään kehittyäkseen paremmaksi tekemään uusia löytöjä. Se on laadullisesti erilaista tieteellistä edistystä kuin mitään, mitä olemme aiemmin nähneet.”



