Tutkimus

Tekoäly sai kuusi päivää ja 3 000 dollaria – arvosana 1/6

Agentti kirjoitti kaksi tutkimuspaperia. Alkuperäiset tekijät hylkäsivät molemmat.

Nelli NelisanomaNelli Nelisanoma
Jaa:
Tekoäly sai kuusi päivää ja 3 000 dollaria – arvosana 1/6
Kuva: Photograph by Mike Peel (www.mikepeel.net). / CC BY-SA 4.0

David Africa sai luettavakseen tutkimuspaperin, jonka aihe oli hänelle epämiellyttävän tuttu. Se käsitteli samaa kysymystä kuin hänen oma, vielä julkaisematon artikkelinsa. Kirjoittaja vain ei ollut ihminen.

Africa antoi lukemalleen kaksi pistettä kuudesta. Toisen koepaperin arvioija, tutkija Viet Nguyen, antoi yhden. NeurIPS-konferenssin asteikolla ne tarkoittavat hylkäystä ja vahvaa hylkäystä.

Kyse oli Princetonin yliopiston tutkijan Sayash Kapoorin johtamasta kokeesta, jonka tuloksista Nature kertoi 13. elokuuta. Ryhmä antoi tekoälyagentille kuusi päivää ja 3 000 dollaria laskentakrediittejä aikaa tehdä oikeaa tutkimusta. Lopputuloksena syntyi kaksi kokonaista, agentin itse kirjoittamaa artikkelia, jotka aiheen todelliset asiantuntijat hylkäsivät.

“Kokeet ja menetelmävalinnat olivat outoja ja vaikeita ymmärtää. Tulokset vaikuttavat selvästi jälkikäteen tehtyjen valintojen tulokselta.”

— David Africa, Arvioidun persoona-artikkelin tekijä, arviolausunto tutkimuksen esipainoksessa. Käännös englannista.

Koeasetelma ratkaisee, miten tulos pitää lukea

Menetelmää kutsutaan varjoarvioinniksi. Kapoorin ryhmä valitsi kaksi artikkelia, jotka oli lähetetty koneoppimisen suurimman konferenssin NeurIPS:n arvioitavaksi mutta joita ei ollut vielä julkaistu. Agentti ei siis voinut lukea vastauksia mistään.

Toinen tehtävä oli selvittää, miten kielimallin persoonaa ja luonteenpiirteitä voi ohjata täsmällisesti. Toinen oli rakentaa ilmaisin, joka havaitsee milloin taulukkodataan erikoistuneen mallin suoritus alkaa pettää, koska data on muuttunut. Molemmat ovat kysymyksiä, joihin kukaan ei tiennyt valmista vastausta.

Työkalut olivat aidot. Ajossa oli Claude Opus 4.8 OpenClaw:n agenttikehyksessä, käytössä oma Linux-kone, verkkoyhteys, kyky luoda aliagentteja ja ohjelmisto, joka simuloi vertaisarviointia. Aikaa oli kuusi vuorokautta ja lisäksi vuorokauden jatkoaika. Rahaa oli 3 000 dollaria rajapintakutsuihin ja erillinen budjetti näytönohjaintunneille. Varmistuksena sama koe ajettiin kilpailevalla mallilla ja kehyksellä.

Arvostelijoiksi valittiin paperien omat tekijät. Se on asetelman vahvuus ja heikkous yhtä aikaa. Kukaan ei tiedä paremmin, mitä kysymyksellä on arvoa ja mitä on jo turhaan kokeiltu. Kukaan ei myöskään ole vähemmän puolueeton arvioimaan konetta, joka yritti tehdä saman työn viikossa.

Insinöörityö sujui, ajattelu ei

Tieteen perusvaatimus on, että tulos kestää toistamisen. Jos vain yksi ryhmä saa jonkin tuloksen eikä kukaan muu, tulosta ei oikeastaan ole. Tässä kokeessa ei kuitenkaan toistettu valmiita tuloksia vaan tehtiin jotain vaikeampaa: agentin piti vastata avoimeen kysymykseen alusta asti, ilman tietoa siitä mihin ihmiset olivat päätyneet.

Tekninen suoritus oli hyvä. Agentti ajoi satoja kokeita, korjasi itse rikkoutuneet näytönohjainympäristöt, kokosi kirjallisuuskatsauksen, huomasi omia harhoja ja käänsi valmiin artikkelin painokuntoon. Ihmiset auttoivat vain käytännön järjestelyissä. Yhtään ohjelmointiongelmaa ei jäänyt ratkaisematta.

Sitten tuli seinä. Agentti valitsi hypoteesinsa liian aikaisin eikä perääntynyt, vaikka tulokset eivät tukeneet sitä. Se kavensi väitteitään yhä pienemmiksi sen sijaan että olisi vaihtanut lähestymistapaa. Persoonatehtävässä lopputulos oli laimea kielto: kapea hienosäätö ei yleistynyt odotetusti. Ilmaisintehtävässä agentti päätyi väittämään, ettei toimivaa ilmaisinta ole olemassakaan.

Juuri tuo väite sai Nguyenin tarttumaan kynään.

“Kun on testattu muutama toimimaton signaali mallin sisältä, siitä eteneminen väitteeseen 'ei ole olemassa signaaleja, joita voisimme käyttää' on valtava harppaus, eräänlainen todistus esimerkillä -virhepäätelmä, joka on erittäin epätieteellinen.”

— Viet Nguyen, Arvioidun taulukkomalliartikkelin tekijä, arviolausunto tutkimuksen esipainoksessa. Käännös englannista.

Tällä lupauksella myydään koko alan investoinnit

Tulos ei jää tutkijoiden sisäpiiriin, koska juuri tätä väitettä käytetään perusteluna rahalle. Ajatus on yksinkertainen: kun tekoäly alkaa parantaa itse itseään, kehitys nopeutuu ja nykyiset investoinnit maksavat itsensä takaisin moninkertaisina. Sillä perustellaan konesalien rakentamista, sähkönkulutuksen kasvua ja yhtiöiden arvostuksia, jotka eivät nykyliikevaihdolla selity.

Tavalliselle lukijalle se näkyy kahdella tavalla. Eläkerahat ja indeksirahastot ovat kiinni näiden yhtiöiden arvossa, ja se arvo nojaa osittain oletukseen automaattisesta tutkimuksesta. Samalla työpaikoilla myydään agenttituotteita, joiden lupaus on nimenomaan itsenäinen ongelmanratkaisu. Tämä koe kertoo, mikä osa lupauksesta pitää tällä hetkellä paikkansa: koodi kyllä syntyy, arvostelukyky ei.

Kapoor muotoili sen Naturelle näin: "En usko, että avoimen tutkimuksen täysi automatisointi on näköpiirissä juuri nyt."

Mitä koe ei todista

Otos on kaksi paperia. Molemmat ovat koneoppimisen alalta, joten kokeesta ei voi päätellä mitään esimerkiksi biologian tai materiaalitutkimuksen automatisoinnista. Arvostelijat eivät olleet sokkoja eivätkä ulkopuolisia, ja aikaa oli kuusi päivää, kun ihmistekijöillä oli kuukausia. Tutkijat myöntävät nämä rajoitteet itse esipainoksessaan.

Kyse on myös yhdestä mallisukupolvesta ja yhdestä kehyksestä. Vuoden päästä sama koe voi tuottaa toisen tuloksen, ja ryhmä sanoo suoraan, ettei se osaa vastata siihen, tarvitaanko tutkimuksen kiihdyttämiseen ylipäätään täyttä automaatiota vai riittäisivätkö tarkkarajaiset osatehtävät.

Yksi yksityiskohta kannattaa panna merkille, koska se kääntää tulkinnan päälaelleen. Agentti käytti 3 000 dollarin budjetistaan vain noin 1 130 ja 1 235 dollaria, siis alle puolet. Se ei loppunut rahaan eikä aikaan. Se lopetti etsimisen liian aikaisin, koska ei tunnistanut olevansa umpikujassa. Rahan lisääminen ei korjaa sitä vikaa, ja siksi seuraava kiinnostava mittari ei ole budjetti vaan se, oppiiko malli koskaan perääntymään.

2/6 ja 1/6↓

Alkuperäisten tutkijoiden arvosanat agentin kahdelle artikkelille asteikolla 1–6, jossa 6 on paras

6 vrk

Agentin työaika. Ihmistutkijoilta samaan meni kuukausia.

1 235 $

Kalliimman ajon laskentakulut 3 000 dollarin budjetista

Nature 13.8.2026 ja tutkimuksen esipainos (arXiv 2607.27191)

Sanasto

Vertaisarviointi
Tieteen laadunvalvonta: saman alan tutkijat lukevat käsikirjoituksen ja päättävät, kelpaako se julkaistavaksi. Arvio annetaan usein numeroasteikolla.
Esipainos (preprint)
Tutkimusartikkeli, joka on julkaistu verkossa ennen vertaisarviointia. Tulokset ovat siis kaikkien luettavissa, mutta kukaan ulkopuolinen ei ole vielä tarkistanut niitä.
Agenttikehys
Ohjelmisto, joka antaa kielimallille kyvyn toimia itsenäisesti: ajaa komentoja, käyttää verkkoa ja tiedostoja sekä jatkaa työtä vaihe kerrallaan ilman että ihminen ohjaa joka askelta.

Lähteistä

Etsin kokeesta riippumatonta arviota kolmesta paikasta: Naturen uutisjutusta, tutkimuksen esipainoksesta ja tutkimusryhmän omasta julkaisukanavasta normaltech.ai. Yhtään tutkimuksen ulkopuolista tutkijaa ei ole toistaiseksi kommentoinut tuloksia julkisuudessa, ei myöskään Naturen jutussa. Kaikki tässä jutussa siteeratut henkilöt ovat itse mukana tutkimuksessa.

Etsin myös Suomi-kytkentää samoista lähteistä. Tutkimusryhmässä ei ole suomalaisia osallistujia eikä suomalaisia tutkimuslaitoksia, joten kytkentää ei tähän juttuun ole.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Robotit hyppäsivät sulaan teräkseen Imatralla
  5. 5Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.