David Africa sai luettavakseen tutkimuspaperin, jonka aihe oli hänelle epämiellyttävän tuttu. Se käsitteli samaa kysymystä kuin hänen oma, vielä julkaisematon artikkelinsa. Kirjoittaja vain ei ollut ihminen.
Africa antoi lukemalleen kaksi pistettä kuudesta. Toisen koepaperin arvioija, tutkija Viet Nguyen, antoi yhden. NeurIPS-konferenssin asteikolla ne tarkoittavat hylkäystä ja vahvaa hylkäystä.
Kyse oli Princetonin yliopiston tutkijan Sayash Kapoorin johtamasta kokeesta, jonka tuloksista Nature kertoi 13. elokuuta. Ryhmä antoi tekoälyagentille kuusi päivää ja 3 000 dollaria laskentakrediittejä aikaa tehdä oikeaa tutkimusta. Lopputuloksena syntyi kaksi kokonaista, agentin itse kirjoittamaa artikkelia, jotka aiheen todelliset asiantuntijat hylkäsivät.
“Kokeet ja menetelmävalinnat olivat outoja ja vaikeita ymmärtää. Tulokset vaikuttavat selvästi jälkikäteen tehtyjen valintojen tulokselta.”
Koeasetelma ratkaisee, miten tulos pitää lukea
Menetelmää kutsutaan varjoarvioinniksi. Kapoorin ryhmä valitsi kaksi artikkelia, jotka oli lähetetty koneoppimisen suurimman konferenssin NeurIPS:n arvioitavaksi mutta joita ei ollut vielä julkaistu. Agentti ei siis voinut lukea vastauksia mistään.
Toinen tehtävä oli selvittää, miten kielimallin persoonaa ja luonteenpiirteitä voi ohjata täsmällisesti. Toinen oli rakentaa ilmaisin, joka havaitsee milloin taulukkodataan erikoistuneen mallin suoritus alkaa pettää, koska data on muuttunut. Molemmat ovat kysymyksiä, joihin kukaan ei tiennyt valmista vastausta.
Työkalut olivat aidot. Ajossa oli Claude Opus 4.8 OpenClaw:n agenttikehyksessä, käytössä oma Linux-kone, verkkoyhteys, kyky luoda aliagentteja ja ohjelmisto, joka simuloi vertaisarviointia. Aikaa oli kuusi vuorokautta ja lisäksi vuorokauden jatkoaika. Rahaa oli 3 000 dollaria rajapintakutsuihin ja erillinen budjetti näytönohjaintunneille. Varmistuksena sama koe ajettiin kilpailevalla mallilla ja kehyksellä.
Arvostelijoiksi valittiin paperien omat tekijät. Se on asetelman vahvuus ja heikkous yhtä aikaa. Kukaan ei tiedä paremmin, mitä kysymyksellä on arvoa ja mitä on jo turhaan kokeiltu. Kukaan ei myöskään ole vähemmän puolueeton arvioimaan konetta, joka yritti tehdä saman työn viikossa.
Insinöörityö sujui, ajattelu ei
Tieteen perusvaatimus on, että tulos kestää toistamisen. Jos vain yksi ryhmä saa jonkin tuloksen eikä kukaan muu, tulosta ei oikeastaan ole. Tässä kokeessa ei kuitenkaan toistettu valmiita tuloksia vaan tehtiin jotain vaikeampaa: agentin piti vastata avoimeen kysymykseen alusta asti, ilman tietoa siitä mihin ihmiset olivat päätyneet.
Tekninen suoritus oli hyvä. Agentti ajoi satoja kokeita, korjasi itse rikkoutuneet näytönohjainympäristöt, kokosi kirjallisuuskatsauksen, huomasi omia harhoja ja käänsi valmiin artikkelin painokuntoon. Ihmiset auttoivat vain käytännön järjestelyissä. Yhtään ohjelmointiongelmaa ei jäänyt ratkaisematta.
Sitten tuli seinä. Agentti valitsi hypoteesinsa liian aikaisin eikä perääntynyt, vaikka tulokset eivät tukeneet sitä. Se kavensi väitteitään yhä pienemmiksi sen sijaan että olisi vaihtanut lähestymistapaa. Persoonatehtävässä lopputulos oli laimea kielto: kapea hienosäätö ei yleistynyt odotetusti. Ilmaisintehtävässä agentti päätyi väittämään, ettei toimivaa ilmaisinta ole olemassakaan.
Juuri tuo väite sai Nguyenin tarttumaan kynään.
“Kun on testattu muutama toimimaton signaali mallin sisältä, siitä eteneminen väitteeseen 'ei ole olemassa signaaleja, joita voisimme käyttää' on valtava harppaus, eräänlainen todistus esimerkillä -virhepäätelmä, joka on erittäin epätieteellinen.”



