David Africa sai luettavakseen paperin, joka vastasi hänen omaan tutkimuskysymykseensä. Kokeet oli ajettu, koodi toimi, teksti oli valmis. Africa hylkäsi sen.
”Kokeet ja metodologiset valinnat olivat kummallisia ja vaikeita ymmärtää”, hän kirjoitti arviossaan. Teksti oli hänen mukaansa ”tiheää ja raskaasti varauksilla kuormitettua, usein siihen pisteeseen asti, että se hämärsi mitä oikeasti tehtiin ja mitä löydettiin”. Alkukieli on englanti.
Paperin oli kirjoittanut tekoälyagentti. Africa on yksi 24 tutkijasta, jotka julkaisivat heinäkuun 29. päivänä arXivissa kokeen, jolle he antoivat nimen shadow evaluation: agentille annettiin julkaisemattoman NeurIPS 2026 -käsikirjoituksen keskeinen tutkimuskysymys, kuusi päivää aikaa ja tuhansia dollareita laskentaa. Sitten paperin alkuperäiset tekijät arvostelivat tuloksen. Kummankin tapauksen kohdalla vastaus oli hylkäys, eikä se ollut lähelläkään.
Sama lehti, kaksi vastausta
Nature uutisoi kokeesta 13. elokuuta otsikolla ”AI isn’t ready to research itself”. Viisi kuukautta aiemmin, 25. maaliskuuta, sama lehti oli julkaissut vertaisarvioidun tutkimusartikkelin otsikolla ”Towards end-to-end automation of AI research”. Sen tekijät, Sakana AI:n ryhmä sekä Jeff Clune, esittelivät The AI Scientist -järjestelmän, joka heidän kuvauksensa mukaan ”luo tutkimusideoita, kirjoittaa koodia, ajaa kokeita, piirtää ja analysoi dataa, kirjoittaa koko tieteellisen käsikirjoituksen ja tekee oman vertaisarviointinsa”.
Viimeinen kohta kannattaa lukea kahdesti. Tekee oman vertaisarviointinsa.
Vertaisarviointi on tieteen laadunvalvonta, ja se on yllättävän mekaaninen asia. Ennen kuin tutkimus julkaistaan, saman alan tutkijat lukevat käsikirjoituksen läpi ja kertovat toimitukselle, kestävätkö menetelmät ja päätelmät. Suomessa Tieteellisten seurain valtuuskunnan vertaisarviointitunnuksen ehto on, että arvion tekee vähintään kaksi riippumatonta asiantuntijaa. Koko koneisto on siis ihmisiä, jotka lukevat. Kun se osa korvataan, mitään ei jää tilalle valvomaan.
21 prosenttia, ja kukaan ei tunnustanut mitään
Marraskuun 18. päivänä 2025 tekoälytunnistukseen erikoistunut Pangram Labs julkaisi analyysin ICLR 2026 -konferenssin vertaisarvioista. Yhtiö ajoi noin 70 000 arviota EditLens-mallinsa läpi. Tulos: 15 899 arviota eli 21 prosenttia oli kokonaan tekoälyn kirjoittamia, ja yli puolessa kaikista arvioista näkyi jotain koneen kädenjälkeä, joko muokkausta, avustusta tai täyttä generointia. ICLR on koneoppimisen kolmen suurimman konferenssin joukossa.
Luku on arvio, ja se pitää sanoa ääneen. Pangram ei lukenut tunnustuksia vaan ajoi tekstit tunnistimen läpi. Yhtiö ilmoittaa väärien positiivisten osuudeksi noin yhden kymmenestätuhannesta omassa testiaineistossaan, ja tunnistin on yhtiön oma kaupallinen tuote. Se ei tee luvusta väärää, mutta kertoo kuka sen tuotti ja millä menetelmällä.
Konferenssi itse ei ole vahvistanut osuutta. Arvioijia ei pyydetty selittämään mitään, koska kukaan ei huomannut mitään selitettävää ennen kuin ulkopuolinen yhtiö laski luvun jälkikäteen.
“Pidämme tätä kehitystä ongelmallisena ja tieteelle haitallisena, ja vetoamme konferensseihin ja julkaisijoihin, että ne ottaisivat tekoälytunnistuksen käyttöön väärinkäytön hillitsemiseksi ja tieteellisen luotettavuuden suojelemiseksi.”
Ketju, jota kukaan ei näe
Kukaan tavallinen lukija ei avaa ICLR:n konferenssipapereita. Hän lukee uutisen, jossa sanotaan, että uusi lääke laskee riskiä kolmanneksella, että hoitosuositus muuttui tai että ilmastomalli tarkentui. Jokainen näistä nojaa siihen, että joku toinen tutkija on lukenut alkuperäisen työn ja sanonut, että luvut kestävät. Se on koko takuu.
Elokuussa Alexander M. Fichtlin johtama ryhmä vertaili koneen ja ihmisen kirjoittamia arvioita ICLR 2026:n ja Nature Communicationsin aineistolla. Kielimallit tuottivat sujuvaa ja yksityiskohtaista tekstiä, mutta suosittelivat systemaattisesti liian myönteisesti, esittivät yleisluontoista kritiikkiä ja perustelivat väitteitä epätasaisesti. Toinen ryhmä, Joachim Baumannin johdolla, löysi ICLR 2026:n arvioista ilmiön, jota se kutsuu laumamieleksi: koneet ovat samaa mieltä keskenään huomattavasti useammin kuin ihmiset, mikä kapeuttaa näkökulmien kirjoa. Sama ryhmä osoitti, että tekoälyarvioijan pisteytystä voi nostaa merkittävästi pelkästään pyytämällä kielimallia kirjoittamaan paperin uudelleen tyylillisesti paremmaksi. Sisältö ei muutu, arvosana muuttuu.
African kollega Viet Nguyen tarttui arviossaan täsmälleen siihen kohtaan, jota kone ei osaa: agentti oli testannut muutaman signaalin epäonnistuneesti ja päätellyt siitä, ettei käyttökelpoisia signaaleja ole. ”Se on huikea hyppy, eräänlainen esimerkillä todistamisen virhepäätelmä, joka on erittäin epätieteellinen”, Nguyen kirjoitti.
Vertaisarviointi ei myöskään ollut kunnossa ennen kielimalleja. arXiv-paperin tekijät kuvaavat konferenssiarviointia ylikuormittuneeksi ja hyvin satunnaiseksi, ja muistuttavat NeurIPSin ohjeistavan arvioijia tarkastamaan ydinargumentit mutta ei jokaista riviä. Aiemmissa kokeissa noin puolet hyväksytyistä papereista olisi hylätty, jos prosessi olisi ajettu uudelleen. Tekoäly ei siis romuttanut toimivaa järjestelmää. Se kävi sisään ovesta, joka oli jo auki.
Suomessa suositus tuli kesäkuussa
Tutkimuseettinen neuvottelukunta julkaisi 8. kesäkuuta 2026 kansallisen suosituksen Tekoäly tutkimuksessa. Sen ydinlinja on, että vastuu sisällöstä, päätelmistä ja luotettavuudesta jää tutkijalle riippumatta siitä, mitä työkalua hän käyttää, ja että tutkijan on tunnettava käyttämänsä järjestelmän rajat.
”Tekoäly tarjoaa tutkimukselle uusia mahdollisuuksia, mutta samalla se tuo mukanaan uusia eettisiä kysymyksiä”, sanoi hanketyöryhmän puheenjohtaja, yliopistonlehtori Simo Kyllönen julkistustiedotteessa. Vertaisarviointia tiedotteessa ei mainita erikseen. Tieteellisten seurain valtuuskunnan vertaisarviointitunnuksen ohjesivu, joka määrittelee suomalaisen tunnuksen ehdot, on päivitetty viimeksi syyskuussa 2020, eikä siinä lue sanaa tekoäly.



