Tutkimus

Joka viides tiedearvio oli kokonaan tekoälyn kirjoittama

Kone antoi myös järjestelmällisesti parempia arvosanoja kuin ihminen.

Nelli NelisanomaNelli Nelisanoma
Jaa:
Joka viides tiedearvio oli kokonaan tekoälyn kirjoittama

Tieteen laadunvalvonta lepää yhden vanhan käytännön varassa. Ennen kuin tutkimus julkaistaan, toiset saman alan tutkijat lukevat sen läpi ja sanovat, kelpaako se. Vertaisarvio on siis kollegan lausunto siitä, onko työ tehty huolellisesti, ovatko tulokset uskottavia ja kannattaako niitä levittää eteenpäin.

Koneoppimisen suurimmassa konferenssissa tuo lausunto tuli tänä vuonna hyvin usein koneelta. Tekoälytekstin tunnistukseen erikoistunut Pangram kävi läpi ICLR 2026 -konferenssin vertaisarviot ja päätyi lukuun, joka on jäänyt vaivaamaan alaa: 76 139 arviosta 15 899 eli 21 prosenttia oli sen mukaan kokonaan tekoälyn tuottamia.

Yli puolessa kaikista arvioista oli jonkinlainen tekoälyn kädenjälki. Osassa kyse oli kielenhuollosta ja muotoilusta, osassa siitä, että malli oli kirjoittanut koko lausunnon alusta loppuun.

Arviot eivät jää arkistoon

ICLR ei ole mikä tahansa tapahtuma. Se on koneoppimisen kolmen tärkeimmän konferenssin joukossa, ja siellä hyväksytty paperi on tutkijalle urakysymys. Se vaikuttaa rahoituspäätöksiin, rekrytointeihin ja siihen, mikä tutkimussuunta saa jatkaa.

Vertaisarviot ovat siis päätöksentekoaineistoa. Ne ratkaisivat, mitkä noin 19 000 lähetetystä tutkimuksesta pääsivät ohjelmaan ja mitkä hylättiin. Jos joka viides lausunto on kielimallin tuottama tiivistelmä paperista, jota kukaan ei ehkä lukenut ajatuksella loppuun, osa päätöksistä perustuu automaattiin.

ICLR:n omat säännöt eivät kiellä kielimallin käyttöä, mutta edellyttävät sen kertomista. Arvioija vastaa aina siitä, mitä hänen nimellään lähtee ulos. Kokonaan koneen kirjoittama lausunto, joka esitetään omana asiantuntija-arviona, rikkoo tuota periaatetta suoraan.

Kone antoi paremmat pisteet

Aineiston kiinnostavin havainto ei ole itse osuus vaan sen seuraus. Mitä enemmän arviossa oli tekoälyä, sitä korkeamman pistemäärän se antoi paperille. Kokonaan koneen tuottamat lausunnot olivat järjestelmällisesti lempeämpiä kuin ihmisen kirjoittamat.

Se sopii siihen, mitä kielimalleista tiedetään. Terävä arvio vaatii, että lukija tuntee alan aiemmat tulokset ja uskaltaa sanoa suoraan, ettei tämä riitä. Malli tuottaa sujuvaa, kohteliasta ja pääosin myönteistä tekstiä, koska se on opetettu tekemään niin.

Käytännössä automaatti on siis löysempi portinvartija kuin ihminen. Pangramin mukaan tämä viittaa siihen, ettei kielimallia käytetty apuvälineenä vaan sille ulkoistettiin itse harkinta.

Tunnistus ei ole erehtymätön

Havainto perustuu Pangramin omaan tunnistustyökaluun. Yhtiö ilmoittaa väärien positiivisten osuudeksi noin yhden kymmenestätuhannesta ja tieteellisillä teksteillä vielä pienemmän luvun, mutta mikään tekoälytunnistin ei ole varma todiste yksittäisen tekstin alkuperästä.

Pangram myös myy juuri tätä palvelua, eikä ICLR ole vahvistanut lukuja omalla tarkastuksellaan. Kokonaisuutena osuus on uskottava suuruusluokka, yksittäisen arvioijan syyllistämiseen se ei riitä.

Sama paine puskee suomalaisissa yliopistoissa

Vertaisarviointi on palkatonta työtä. Suomalainen professori tai tutkijatohtori lukee kollegan käsikirjoituksen opetuksen, hankehakemusten ja oman tutkimuksen välissä, usein iltaisin. Korvaus on nolla euroa ja kiitos on rivi ansioluettelossa.

Kun arviopyyntöjä tulee enemmän kuin ehtii ja kieltäytyminen tuntuu epäkollegiaaliselta, kielimalli on houkutteleva oikopolku. Kymmenen minuutin urakka näyttää tulostettuna samalta kuin kolmen tunnin urakka. Juuri siinä on ongelman ydin: laadun ero ei näy päälle.

Tavallisen ihmisen kannalta kyse ei ole akateemisesta sisäpiirikiistasta. Vertaisarvio on se suodatin, jonka läpi kulkevat myös lääketutkimukset, ilmastomallit ja ne tekoälyjärjestelmät, joita ollaan tuomassa terveydenhuoltoon ja viranomaispäätöksiin. Jos suodatin vuotaa, vuoto näkyy vuosia myöhemmin aivan muualla kuin konferenssisalissa.

Yli puolessa ICLR-arvioista näkyi koneen jälki

Kokonaan tekoälyn kirjoittamia21 %
Osittain tekoälyn muokkaamianoin 30 %
Ei havaittua tekoälyänoin 49 %

Pangram, ICLR 2026 -arvioanalyysi

76 139

Analysoitua vertaisarviota

15 989↑

Kokonaan koneen tuottamaa lausuntoa

19 000

Lähetettyä tutkimuspaperia

Pangram, ICLR 2026

Kielto ei riitä

Sääntö tekoälyn käytön ilmoittamisesta oli jo voimassa, ja silti näin kävi. Valvontaa ei käytännössä ole, eikä sanktioita juuri sovelleta. Pelkkä lisäkielto tuottaa lähinnä lisää ilmoittamatonta käyttöä.

Taustalla on määrä. Sama Pangramin analyysi löysi tekoälyn jälkiä myös itse tutkimuspapereista: noin joka yhdennessätoista lähetetyssä työssä yli puolet tekstistä oli koneen tuottamaa. Kun kielimalli sekä kirjoittaa hakemuksen että arvioi sen, ihmisen rooli kutistuu leimasimeksi.

Yhtä asiaa kannattaa seurata ensi kevääseen mennessä: julkaiseeko ICLR oman tarkastuksensa tuloksen vai jättääkö se kysymyksen ulkopuolisen yhtiön varaan. Se kertoo enemmän tieteen itsekorjautuvuudesta kuin mikään yksittäinen prosenttiluku.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Datakeskus söisi Lapinlahdella kokonaisen kaupungin sähköt
  4. 4Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  5. 5Google kaatoi 300 hehtaaria metsää – virasto selvittää

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.