Tieteen laadunvalvonta lepää yhden vanhan käytännön varassa. Ennen kuin tutkimus julkaistaan, toiset saman alan tutkijat lukevat sen läpi ja sanovat, kelpaako se. Vertaisarvio on siis kollegan lausunto siitä, onko työ tehty huolellisesti, ovatko tulokset uskottavia ja kannattaako niitä levittää eteenpäin.
Koneoppimisen suurimmassa konferenssissa tuo lausunto tuli tänä vuonna hyvin usein koneelta. Tekoälytekstin tunnistukseen erikoistunut Pangram kävi läpi ICLR 2026 -konferenssin vertaisarviot ja päätyi lukuun, joka on jäänyt vaivaamaan alaa: 76 139 arviosta 15 899 eli 21 prosenttia oli sen mukaan kokonaan tekoälyn tuottamia.
Yli puolessa kaikista arvioista oli jonkinlainen tekoälyn kädenjälki. Osassa kyse oli kielenhuollosta ja muotoilusta, osassa siitä, että malli oli kirjoittanut koko lausunnon alusta loppuun.
Arviot eivät jää arkistoon
ICLR ei ole mikä tahansa tapahtuma. Se on koneoppimisen kolmen tärkeimmän konferenssin joukossa, ja siellä hyväksytty paperi on tutkijalle urakysymys. Se vaikuttaa rahoituspäätöksiin, rekrytointeihin ja siihen, mikä tutkimussuunta saa jatkaa.
Vertaisarviot ovat siis päätöksentekoaineistoa. Ne ratkaisivat, mitkä noin 19 000 lähetetystä tutkimuksesta pääsivät ohjelmaan ja mitkä hylättiin. Jos joka viides lausunto on kielimallin tuottama tiivistelmä paperista, jota kukaan ei ehkä lukenut ajatuksella loppuun, osa päätöksistä perustuu automaattiin.
ICLR:n omat säännöt eivät kiellä kielimallin käyttöä, mutta edellyttävät sen kertomista. Arvioija vastaa aina siitä, mitä hänen nimellään lähtee ulos. Kokonaan koneen kirjoittama lausunto, joka esitetään omana asiantuntija-arviona, rikkoo tuota periaatetta suoraan.
Kone antoi paremmat pisteet
Aineiston kiinnostavin havainto ei ole itse osuus vaan sen seuraus. Mitä enemmän arviossa oli tekoälyä, sitä korkeamman pistemäärän se antoi paperille. Kokonaan koneen tuottamat lausunnot olivat järjestelmällisesti lempeämpiä kuin ihmisen kirjoittamat.
Se sopii siihen, mitä kielimalleista tiedetään. Terävä arvio vaatii, että lukija tuntee alan aiemmat tulokset ja uskaltaa sanoa suoraan, ettei tämä riitä. Malli tuottaa sujuvaa, kohteliasta ja pääosin myönteistä tekstiä, koska se on opetettu tekemään niin.
Käytännössä automaatti on siis löysempi portinvartija kuin ihminen. Pangramin mukaan tämä viittaa siihen, ettei kielimallia käytetty apuvälineenä vaan sille ulkoistettiin itse harkinta.
Tunnistus ei ole erehtymätön
Havainto perustuu Pangramin omaan tunnistustyökaluun. Yhtiö ilmoittaa väärien positiivisten osuudeksi noin yhden kymmenestätuhannesta ja tieteellisillä teksteillä vielä pienemmän luvun, mutta mikään tekoälytunnistin ei ole varma todiste yksittäisen tekstin alkuperästä.
Pangram myös myy juuri tätä palvelua, eikä ICLR ole vahvistanut lukuja omalla tarkastuksellaan. Kokonaisuutena osuus on uskottava suuruusluokka, yksittäisen arvioijan syyllistämiseen se ei riitä.
Sama paine puskee suomalaisissa yliopistoissa
Vertaisarviointi on palkatonta työtä. Suomalainen professori tai tutkijatohtori lukee kollegan käsikirjoituksen opetuksen, hankehakemusten ja oman tutkimuksen välissä, usein iltaisin. Korvaus on nolla euroa ja kiitos on rivi ansioluettelossa.
Kun arviopyyntöjä tulee enemmän kuin ehtii ja kieltäytyminen tuntuu epäkollegiaaliselta, kielimalli on houkutteleva oikopolku. Kymmenen minuutin urakka näyttää tulostettuna samalta kuin kolmen tunnin urakka. Juuri siinä on ongelman ydin: laadun ero ei näy päälle.
Tavallisen ihmisen kannalta kyse ei ole akateemisesta sisäpiirikiistasta. Vertaisarvio on se suodatin, jonka läpi kulkevat myös lääketutkimukset, ilmastomallit ja ne tekoälyjärjestelmät, joita ollaan tuomassa terveydenhuoltoon ja viranomaispäätöksiin. Jos suodatin vuotaa, vuoto näkyy vuosia myöhemmin aivan muualla kuin konferenssisalissa.



