Tutkimus

Joka viides vertaisarvio oli koneen kirjoittama

Nature esitteli keväällä itse tutkivan koneen – elokuussa se perui puheensa.

Hanna HuulivuoHanna Huulivuo
Jaa:
Joka viides vertaisarvio oli koneen kirjoittama
Kuva: Christian Velitchkov / Unsplash

David Africa sai luettavakseen paperin, joka vastasi hänen omaan tutkimuskysymykseensä. Kokeet oli ajettu, koodi toimi, teksti oli valmis. Africa hylkäsi sen.

”Kokeet ja metodologiset valinnat olivat kummallisia ja vaikeita ymmärtää”, hän kirjoitti arviossaan. Teksti oli hänen mukaansa ”tiheää ja raskaasti varauksilla kuormitettua, usein siihen pisteeseen asti, että se hämärsi mitä oikeasti tehtiin ja mitä löydettiin”. Alkukieli on englanti.

Paperin oli kirjoittanut tekoälyagentti. Africa on yksi 24 tutkijasta, jotka julkaisivat heinäkuun 29. päivänä arXivissa kokeen, jolle he antoivat nimen shadow evaluation: agentille annettiin julkaisemattoman NeurIPS 2026 -käsikirjoituksen keskeinen tutkimuskysymys, kuusi päivää aikaa ja tuhansia dollareita laskentaa. Sitten paperin alkuperäiset tekijät arvostelivat tuloksen. Kummankin tapauksen kohdalla vastaus oli hylkäys, eikä se ollut lähelläkään.

Sama lehti, kaksi vastausta

Nature uutisoi kokeesta 13. elokuuta otsikolla ”AI isn’t ready to research itself”. Viisi kuukautta aiemmin, 25. maaliskuuta, sama lehti oli julkaissut vertaisarvioidun tutkimusartikkelin otsikolla ”Towards end-to-end automation of AI research”. Sen tekijät, Sakana AI:n ryhmä sekä Jeff Clune, esittelivät The AI Scientist -järjestelmän, joka heidän kuvauksensa mukaan ”luo tutkimusideoita, kirjoittaa koodia, ajaa kokeita, piirtää ja analysoi dataa, kirjoittaa koko tieteellisen käsikirjoituksen ja tekee oman vertaisarviointinsa”.

Viimeinen kohta kannattaa lukea kahdesti. Tekee oman vertaisarviointinsa.

Vertaisarviointi on tieteen laadunvalvonta, ja se on yllättävän mekaaninen asia. Ennen kuin tutkimus julkaistaan, saman alan tutkijat lukevat käsikirjoituksen läpi ja kertovat toimitukselle, kestävätkö menetelmät ja päätelmät. Suomessa Tieteellisten seurain valtuuskunnan vertaisarviointitunnuksen ehto on, että arvion tekee vähintään kaksi riippumatonta asiantuntijaa. Koko koneisto on siis ihmisiä, jotka lukevat. Kun se osa korvataan, mitään ei jää tilalle valvomaan.

21 prosenttia, ja kukaan ei tunnustanut mitään

Marraskuun 18. päivänä 2025 tekoälytunnistukseen erikoistunut Pangram Labs julkaisi analyysin ICLR 2026 -konferenssin vertaisarvioista. Yhtiö ajoi noin 70 000 arviota EditLens-mallinsa läpi. Tulos: 15 899 arviota eli 21 prosenttia oli kokonaan tekoälyn kirjoittamia, ja yli puolessa kaikista arvioista näkyi jotain koneen kädenjälkeä, joko muokkausta, avustusta tai täyttä generointia. ICLR on koneoppimisen kolmen suurimman konferenssin joukossa.

Luku on arvio, ja se pitää sanoa ääneen. Pangram ei lukenut tunnustuksia vaan ajoi tekstit tunnistimen läpi. Yhtiö ilmoittaa väärien positiivisten osuudeksi noin yhden kymmenestätuhannesta omassa testiaineistossaan, ja tunnistin on yhtiön oma kaupallinen tuote. Se ei tee luvusta väärää, mutta kertoo kuka sen tuotti ja millä menetelmällä.

Konferenssi itse ei ole vahvistanut osuutta. Arvioijia ei pyydetty selittämään mitään, koska kukaan ei huomannut mitään selitettävää ennen kuin ulkopuolinen yhtiö laski luvun jälkikäteen.

“Pidämme tätä kehitystä ongelmallisena ja tieteelle haitallisena, ja vetoamme konferensseihin ja julkaisijoihin, että ne ottaisivat tekoälytunnistuksen käyttöön väärinkäytön hillitsemiseksi ja tieteellisen luotettavuuden suojelemiseksi.”

— Bradley Emi, Pangram Labsin teknologiajohtaja ja perustajaosakas, yhtiön blogikirjoituksessa 18.11.2025 (alkukieli englanti)

Ketju, jota kukaan ei näe

Kukaan tavallinen lukija ei avaa ICLR:n konferenssipapereita. Hän lukee uutisen, jossa sanotaan, että uusi lääke laskee riskiä kolmanneksella, että hoitosuositus muuttui tai että ilmastomalli tarkentui. Jokainen näistä nojaa siihen, että joku toinen tutkija on lukenut alkuperäisen työn ja sanonut, että luvut kestävät. Se on koko takuu.

Elokuussa Alexander M. Fichtlin johtama ryhmä vertaili koneen ja ihmisen kirjoittamia arvioita ICLR 2026:n ja Nature Communicationsin aineistolla. Kielimallit tuottivat sujuvaa ja yksityiskohtaista tekstiä, mutta suosittelivat systemaattisesti liian myönteisesti, esittivät yleisluontoista kritiikkiä ja perustelivat väitteitä epätasaisesti. Toinen ryhmä, Joachim Baumannin johdolla, löysi ICLR 2026:n arvioista ilmiön, jota se kutsuu laumamieleksi: koneet ovat samaa mieltä keskenään huomattavasti useammin kuin ihmiset, mikä kapeuttaa näkökulmien kirjoa. Sama ryhmä osoitti, että tekoälyarvioijan pisteytystä voi nostaa merkittävästi pelkästään pyytämällä kielimallia kirjoittamaan paperin uudelleen tyylillisesti paremmaksi. Sisältö ei muutu, arvosana muuttuu.

African kollega Viet Nguyen tarttui arviossaan täsmälleen siihen kohtaan, jota kone ei osaa: agentti oli testannut muutaman signaalin epäonnistuneesti ja päätellyt siitä, ettei käyttökelpoisia signaaleja ole. ”Se on huikea hyppy, eräänlainen esimerkillä todistamisen virhepäätelmä, joka on erittäin epätieteellinen”, Nguyen kirjoitti.

Vertaisarviointi ei myöskään ollut kunnossa ennen kielimalleja. arXiv-paperin tekijät kuvaavat konferenssiarviointia ylikuormittuneeksi ja hyvin satunnaiseksi, ja muistuttavat NeurIPSin ohjeistavan arvioijia tarkastamaan ydinargumentit mutta ei jokaista riviä. Aiemmissa kokeissa noin puolet hyväksytyistä papereista olisi hylätty, jos prosessi olisi ajettu uudelleen. Tekoäly ei siis romuttanut toimivaa järjestelmää. Se kävi sisään ovesta, joka oli jo auki.

Suomessa suositus tuli kesäkuussa

Tutkimuseettinen neuvottelukunta julkaisi 8. kesäkuuta 2026 kansallisen suosituksen Tekoäly tutkimuksessa. Sen ydinlinja on, että vastuu sisällöstä, päätelmistä ja luotettavuudesta jää tutkijalle riippumatta siitä, mitä työkalua hän käyttää, ja että tutkijan on tunnettava käyttämänsä järjestelmän rajat.

”Tekoäly tarjoaa tutkimukselle uusia mahdollisuuksia, mutta samalla se tuo mukanaan uusia eettisiä kysymyksiä”, sanoi hanketyöryhmän puheenjohtaja, yliopistonlehtori Simo Kyllönen julkistustiedotteessa. Vertaisarviointia tiedotteessa ei mainita erikseen. Tieteellisten seurain valtuuskunnan vertaisarviointitunnuksen ohjesivu, joka määrittelee suomalaisen tunnuksen ehdot, on päivitetty viimeksi syyskuussa 2020, eikä siinä lue sanaa tekoäly.

Näin luvut on tarkistettu

Luku 21 prosenttia on Pangram Labsin EditLens-tunnistimen tuottama arvio noin 70 000 ICLR 2026 -arviosta (15 899 kappaletta), julkaistu yhtiön blogissa 18.11.2025. Kyse on koneellisesta tunnistuksesta, ei konferenssin omasta tiedosta eikä arvioijien tunnustuksista. Molemmat Nature-lähteet, 13.8.2026 julkaistu uutisanalyysi ja 25.3.2026 julkaistu tutkimusartikkeli, ovat maksumuurin takana: linkit avautuvat, mutta koko teksti vaatii tilauksen. arXiv-, Pangram-, TENK- ja TSV-lähteet ovat vapaasti luettavissa.

21 %↑

ICLR 2026:n arvioista kokonaan tekoälyn kirjoittamia

15 899

Arviota, joissa ei näkynyt ihmisen kädenjälkeä

Pangram Labs 18.11.2025, tunnistimen oma arvio. ICLR ei ole vahvistanut lukua.

Vuosi, jona vertaisarviointi alkoi automatisoitua

2025-11

Pangram Labs laskee 21 prosenttia

Tunnistin käy läpi ICLR 2026:n vertaisarviot ja päätyy 15 899 kokonaan koneen kirjoittamaan arvioon. Konferenssi ei ole vahvistanut osuutta.

2026-03

Nature julkaisee The AI Scientistin

Sakana AI:n järjestelmä kirjoittaa käsikirjoituksen ja tekee myös oman vertaisarviointinsa.

2026-05

Kielimallit ovat samaa mieltä keskenään

Baumannin ryhmä osoittaa, että kielimallien arviot yhtenevät useammin kuin ihmisarvioijien. Erimielisyys on vertaisarvioinnin tarkoitus.

2026-06

Suomeen kansallinen suositus

TENK: vastuu sisällöstä jää tutkijalle. Vertaisarviointia ei mainita tiedotteessa erikseen.

2026-07

Agentin paperit eivät läpäise arviointia

Tutkimuksen kahdessa tapaustutkimuksessa agentti sai kuusi päivää ja tuhansia dollareita laskenta-aikaa. Kumpikaan käsikirjoitus ei mennyt läpi.

2026-08

Nature: tekoäly ei ole valmis tutkimaan itseään

Sama lehti, jossa täysautomaatio esiteltiin viisi kuukautta aiemmin.

Sanasto

arXiv
Ilmainen verkkoarkisto, johon tutkijat lataavat käsikirjoituksiaan ennen vertaisarviointia. Sisältöä ei ole tarkastettu, joten arXiv-paperi on tutkimuksen luonnos eikä hyväksytty julkaisu.
ICLR ja NeurIPS
Koneoppimisen suurimpia tieteellisiä konferensseja. Niissä julkaistut paperit käyvät läpi vertaisarvioinnin, ja hyväksyntä on alalla merkittävä tunnustus.
Väärä positiivinen
Tunnistimen virhe, jossa se merkitsee ihmisen kirjoittaman tekstin koneen tekemäksi. Pangramin ilmoittama yksi kymmenestätuhannesta tarkoittaa, että yhtiön omassa testissä virhe osui yhteen tekstiin 10 000:sta.

Sakana AI:n järjestelmä läpäisi Naturen artikkelin mukaan alkuarvioinnin yhden huippukonferenssin workshopissa. Se on yksi paperi. Mutta kun samaan aikaan viidennes erään suurimman koneoppimiskonferenssin arvioista näyttää tulevan koneelta, kysymys ei ole enää siitä, korvaako tekoäly tutkijan. Kysymys on siitä, kuka istuu huoneessa sanomassa ei.

Africa ja Nguyen sanoivat ei, koska joku pyysi heitä lukemaan ja he tekivät sen huolellisesti. Se pyyntö on toistaiseksi ihmisten välinen, ja sen ylläpito on halvempaa kuin sen menettäminen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 420 vuotta koodaamatta, sitten 5,4 miljoonaa
  5. 5Datakeskukset Suomessa – hankkeet, sähkö ja vero

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.