Tutkimus

Tekoäly läpäisi vertaisarvioinnin

Ensimmäinen tekoälyn kirjoittama paperi selvisi tieteellisestä arvioinnista

Hanna HuulivuoHanna Huulivuo
Jaa:
Tekoäly läpäisi vertaisarvioinnin

Tokiolainen tekoäly-yhtiö Sakana AI julkaisi maaliskuussa Nature-lehdessä tutkimuksen järjestelmästä, joka tekee tiedettä ilman ihmisen apua. AI Scientist v2 muotoilee hypoteeseja, suunnittelee kokeita, kirjoittaa ja ajaa koodin, analysoi tulokset ja tuottaa valmiin tieteellisen käsikirjoituksen otsikosta lähdeluetteloon. Yksi sen tuottamista papereista läpäisi ICLR-konferenssin workshopin vertaisarvioinnin – ensimmäisenä täysin tekoälyn kirjoittamana tutkimuksena koskaan.

Saavutus kuulostaa vaikuttavalta, mutta tarkempi katsaus paljastaa, että tieteen automaatio on vielä kaukana valmiista.

Kone joka tekee tiedettä

AI Scientist v2 eroaa tavallisista kielimalleista ratkaisevasti. Järjestelmä ei ainoastaan tuota tekstiä, vaan käy läpi koko tutkimusprosessin. Se käyttää agenttipohjaista puuhakumenetelmää, jossa erillinen kokeenhallinnoija-agentti ohjaa tutkimusta hypoteesista koeasetelmaan, koodista analyysiin ja lopulta valmiiseen käsikirjoitukseen.

Kuvien ja kaavioiden laadusta huolehtii visio-kielimalli, joka antaa palautetta ja korjaa visualisointeja useilla kierroksilla. Yhden paperin tuottaminen maksaa 6–15 dollaria. Vertailun vuoksi: ihmistutkija käyttää yksittäiseen julkaisuun tyypillisesti kuukausia tai vuosia työtä.

Se, että työ julkaistiin Nature-lehdessä, kertoo aiheen painoarvosta. Tutkimus osoittaa, että tekoälyn tuottamien paperien laatu paranee suoraan suhteessa taustalla olevan kielimallin kehitykseen – mitä parempi malli, sitä parempi paperi.

Käytännössä tämä tarkoittaa

Jos tekoäly pystyy tuottamaan tutkimuspapereita 15 dollarilla kappale, tieteellisten julkaisujen määrä voi kasvaa räjähdysmäisesti. Vertaisarvioijien työtaakka kasvaa, ja tutkimusten luotettavuuden varmistaminen vaatii uudenlaisia työkaluja.

Arvosanat riittivät – mutta eivät pääkonferenssiin

Sakana AI lähetti kolme tekoälyn tuottamaa paperia ICLR 2025 -konferenssin ICBINB-workshopiin. Konferenssin järjestäjät suostuivat arvioimaan ne sokkona osana kontrolloitua koetta: arvioijat eivät tienneet lukevansa koneen kirjoittamia tekstejä.

Yksi kolmesta paperista – neuroverkkojen yleistyvyyttä käsittelevä tutkimus – sai arvosanat 6, 7 ja 6. Keskiarvo 6,33 ylitti workshopin hyväksyntärajan ja sijoittui kaikkien lähetettyjen paperien parhaaseen 45 prosenttiin. Paperi vedettiin kuitenkin pois ennen julkaisua. Sakana AI oli sopinut etukäteen järjestäjien kanssa, ettei tekoälyn tuottamia tutkimuksia julkaista, koska tiedeyhteisö ei ole vielä luonut pelisääntöjä tällaisille töille.

Workshop-tason hyväksyntä ei kuitenkaan vastaa pääkonferenssin läpäisyä. Workshopeissa hyväksytään tyypillisesti 60–70 prosenttia papereista, pääkonferensseissa vain 20–30 prosenttia. Sakana AI itsekin myönsi, ettei yksikään kolmesta paperista olisi selvinnyt pääkonferenssin arvioinnista.

Kiiltävä pinta, hauras pohja

Ulkopuolinen arviointi paljasti vakavia laatuongelmia. Hyväksytyssä paperissa väitettiin virheellisesti, että Ian Goodfellow kehitti LSTM-neuroverkot. Todellisuudessa ne ovat Hochreiterin ja Schmidhuberin keksintö vuodelta 1997. Laajemmassa analyysissa todettiin, että yli puolessa AI Scientist v2:n käsikirjoituksista oli vääriä tai keksittyjä lukuarvoja. Kokeista 42 prosenttia epäonnistui koodausvirheiden vuoksi.

Arvioijat vertasivat tuotoksia "kiireessä kirjoitettuun kandidaatintutkielmaan". Viittauksia oli keskimäärin viisi per paperi, ja suurin osa niistä oli vanhentuneita. Kehittäjät itsekin myönsivät, että kymmenen prosentin hallusinaatioaste on "todennäköisesti liikaa".

6–15 $

Tutkimuspaperin tuottamiskustannus

42 %↓

Kokeista epäonnistui koodivirheisiin

~20 %

ICLR:n arvioinneista tekoälyn tuottamia

Sakana AI, Nature 2026

Sanasto

Vertaisarviointi
Tieteellinen laadunvalvontaprosessi, jossa riippumattomat alan tutkijat arvioivat tutkimuksen ennen sen julkaisua. Arvioijat voivat hylätä paperin, hyväksyä sen tai pyytää muutoksia.
Hallusinaatio
Tekoälyn tuottama tieto, joka vaikuttaa uskottavalta mutta on virheellistä tai kokonaan keksittyä – esimerkiksi olematon lähdeviite tai väärä tilastoluku.

Vertaisarviointi itsessään paineen alla

AI Scientist v2:n tapaus osuu hetkeen, jolloin koko vertaisarviointijärjestelmä kamppailee tekoälyn kanssa. ICLR 2026 -konferenssissa paljastui, että noin viidennes vertaisarvioinneista oli tekoälyn kirjoittamia. Kun sekä tutkimukset että niiden arvioinnit syntyvät koneellisesti, tieteellisen laadunvalvonnan perusta horjuu.

Suomalaisille tutkijoille ja yrityksille tämä tarkoittaa käytännössä sitä, että tieteellisiin julkaisuihin vetoaminen vaatii aiempaa tarkempaa lähdekritiikkiä. Päätöksiä tehdään tutkimustiedon pohjalta, ja jos sen perusta on koneen tuottamaa, virheiden riski kertautuu ketjussa eteenpäin.

Mitä seurata

Sakana AI:n koodi on avoimesti saatavilla, ja useat tutkimusryhmät rakentavat vastaavia järjestelmiä. Seuraava iso testi tulee siinä vaiheessa, kun tekoälyn tuottama paperi lähetetään pääkonferenssin arviointiin workshopin sijaan. Nature ja muut suuret julkaisijat valmistelevat parhaillaan linjauksia tekoälyn kirjoittamille tutkimuksille – jos selkeät säännöt syntyvät vuoden 2026 aikana, palaamme aiheeseen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat
  5. 5Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.