Mitä Stanford ja Nature mittasivat
Stanfordin Human-Centered AI -instituutin AI Index 2026 -raportti, jonka Nature nosti pääuutiseksi 8.5.2026, asettaa selvän vastapainon viime kuukausien agenttihypelle. Kun OpenAI:n, Anthropicin ja Googlen parhaat agentit pistettiin tekemään monivaiheisia tieteellisiä työnkulkuja, ne saivat noin puolet siitä pistemäärästä, jonka tohtorin tutkinnon suorittaneet ihmiset ottivat samoista tehtävistä.
Testattuja malleja olivat OpenAI:n GPT-pohjainen agentti, Anthropicin Claude ja Googlen Gemini. Tehtävät vaativat harkintaa, suunnittelua ja varmistamista: kokeiden suunnittelua, anomalioiden jäljittämistä useista tieteellisistä artikkeleista ja osittain toimivien laboratorioprotokollien virheenetsintää. Juuri näissä työvaiheissa agentit jäivät selvästi jälkeen.
Yksittäisissä tehtävissä loikka on ollut iso
Raportti ei ole pelkkää tyrmäystä tekoälylle. Reaalimaailman yksittäisten agenttitehtävien onnistumisaste on noussut vuodessa 20 prosentista 77,3 prosenttiin. Kyberturvallisuuden triage-tehtävissä loikka oli vielä jyrkempi, 15 prosentista 93 prosenttiin.
Kun tehtävä on selkeä ja yksivaiheinen, agentit suoriutuvat vakuuttavasti. Vaikeudet alkavat, kun pitäisi ketjuttaa kuusi tai useampi askel ja arvioida matkalla, meneekö homma oikeaan suuntaan. Stanfordin tutkijat huomauttavat, että agentit eivät tunnista omia virheitään vaan etenevät itsevarmasti hyvinkin väärään suuntaan.
Hukkaavat tutkijan koko iltapäivän
Raportin kärjekkäin yksityiskohta on havainto, että agentit tekevät usein luottavaisia virheitä, jotka kirjoittajien mukaan "hukkaavat tutkijan koko iltapäivän". Tämä on ero verrattuna ihmistutkijaan, joka pysähtyy ihmettelemään, kun jokin ei näytä järkevältä.
Mittakaavan asettaa toinen luku samasta raportista: tekoäly mainitaan tällä hetkellä vain 6–9 prosentissa luonnontieteiden vertaisarvioiduista artikkeleista. Käytännössä agentit eivät ole vielä tutkimuksen valtaväline vaan apuri tarkkaan rajatuissa työvaiheissa.
Suomalainen näkökulma: pragmaattinen linja
Aalto-yliopisto ja Helsingin yliopisto ovat olleet eturivissä, kun on tutkittu kielimallien sovelluksia tieteessä. Aion ottaa molempien AI-tutkimusryhmiin yhteyttä alkuviikosta saadakseni heidän näkemyksensä siitä, miten Stanfordin tulos vaikuttaa heidän omaan agenttitutkimukseensa, ja palaan asiaan tarkemmin lähipäivinä.
Suomalaisten tutkimusryhmien julkinen linja on ollut varovaisen pragmaattinen. Agentteja käytetään koodin kirjoittamisen, kirjallisuuskatsausten ja datan esikäsittelyn tukena, ei autonomisina tutkijoina. Tämä asettelu istuu hyvin Stanfordin havaintoihin. Kun amerikkalainen julkinen keskustelu on viime kuukaudet pyörinyt ajatuksessa, että agentit korvaisivat tohtorintutkinnon suorittaneita työntekijöitä, suomalaiset ryhmät ovat puhuneet kuiluista ja virheherkkyydestä.



