Tokiolainen tekoäly-yhtiö Sakana AI julkaisi maaliskuussa Nature-lehdessä tutkimuksen järjestelmästä, joka tekee tiedettä ilman ihmisen apua. AI Scientist v2 muotoilee hypoteeseja, suunnittelee kokeita, kirjoittaa ja ajaa koodin, analysoi tulokset ja tuottaa valmiin tieteellisen käsikirjoituksen otsikosta lähdeluetteloon. Yksi sen tuottamista papereista läpäisi ICLR-konferenssin workshopin vertaisarvioinnin – ensimmäisenä täysin tekoälyn kirjoittamana tutkimuksena koskaan.
Saavutus kuulostaa vaikuttavalta, mutta tarkempi katsaus paljastaa, että tieteen automaatio on vielä kaukana valmiista.
Kone joka tekee tiedettä
AI Scientist v2 eroaa tavallisista kielimalleista ratkaisevasti. Järjestelmä ei ainoastaan tuota tekstiä, vaan käy läpi koko tutkimusprosessin. Se käyttää agenttipohjaista puuhakumenetelmää, jossa erillinen kokeenhallinnoija-agentti ohjaa tutkimusta hypoteesista koeasetelmaan, koodista analyysiin ja lopulta valmiiseen käsikirjoitukseen.
Kuvien ja kaavioiden laadusta huolehtii visio-kielimalli, joka antaa palautetta ja korjaa visualisointeja useilla kierroksilla. Yhden paperin tuottaminen maksaa 6–15 dollaria. Vertailun vuoksi: ihmistutkija käyttää yksittäiseen julkaisuun tyypillisesti kuukausia tai vuosia työtä.
Se, että työ julkaistiin Nature-lehdessä, kertoo aiheen painoarvosta. Tutkimus osoittaa, että tekoälyn tuottamien paperien laatu paranee suoraan suhteessa taustalla olevan kielimallin kehitykseen – mitä parempi malli, sitä parempi paperi.
Käytännössä tämä tarkoittaa
Jos tekoäly pystyy tuottamaan tutkimuspapereita 15 dollarilla kappale, tieteellisten julkaisujen määrä voi kasvaa räjähdysmäisesti. Vertaisarvioijien työtaakka kasvaa, ja tutkimusten luotettavuuden varmistaminen vaatii uudenlaisia työkaluja.
Arvosanat riittivät – mutta eivät pääkonferenssiin
Sakana AI lähetti kolme tekoälyn tuottamaa paperia ICLR 2025 -konferenssin ICBINB-workshopiin. Konferenssin järjestäjät suostuivat arvioimaan ne sokkona osana kontrolloitua koetta: arvioijat eivät tienneet lukevansa koneen kirjoittamia tekstejä.
Yksi kolmesta paperista – neuroverkkojen yleistyvyyttä käsittelevä tutkimus – sai arvosanat 6, 7 ja 6. Keskiarvo 6,33 ylitti workshopin hyväksyntärajan ja sijoittui kaikkien lähetettyjen paperien parhaaseen 45 prosenttiin. Paperi vedettiin kuitenkin pois ennen julkaisua. Sakana AI oli sopinut etukäteen järjestäjien kanssa, ettei tekoälyn tuottamia tutkimuksia julkaista, koska tiedeyhteisö ei ole vielä luonut pelisääntöjä tällaisille töille.
Workshop-tason hyväksyntä ei kuitenkaan vastaa pääkonferenssin läpäisyä. Workshopeissa hyväksytään tyypillisesti 60–70 prosenttia papereista, pääkonferensseissa vain 20–30 prosenttia. Sakana AI itsekin myönsi, ettei yksikään kolmesta paperista olisi selvinnyt pääkonferenssin arvioinnista.
Kiiltävä pinta, hauras pohja
Ulkopuolinen arviointi paljasti vakavia laatuongelmia. Hyväksytyssä paperissa väitettiin virheellisesti, että Ian Goodfellow kehitti LSTM-neuroverkot. Todellisuudessa ne ovat Hochreiterin ja Schmidhuberin keksintö vuodelta 1997. Laajemmassa analyysissa todettiin, että yli puolessa AI Scientist v2:n käsikirjoituksista oli vääriä tai keksittyjä lukuarvoja. Kokeista 42 prosenttia epäonnistui koodausvirheiden vuoksi.
Arvioijat vertasivat tuotoksia "kiireessä kirjoitettuun kandidaatintutkielmaan". Viittauksia oli keskimäärin viisi per paperi, ja suurin osa niistä oli vanhentuneita. Kehittäjät itsekin myönsivät, että kymmenen prosentin hallusinaatioaste on "todennäköisesti liikaa".



