Tutkimus

Tohtorit kaatoivat agenttihypen – Nature nosti uutiseksi

Stanfordin AI Index 2026: parhaat agentit saivat puolet ihmistohtorien pisteistä.

Hanna HuulivuoHanna Huulivuo
Jaa:
Tohtorit kaatoivat agenttihypen – Nature nosti uutiseksi
Kuva: King of Hearts / CC BY-SA 3.0

Mitä Stanford ja Nature mittasivat

Stanfordin Human-Centered AI -instituutin AI Index 2026 -raportti, jonka Nature nosti pääuutiseksi 8.5.2026, asettaa selvän vastapainon viime kuukausien agenttihypelle. Kun OpenAI:n, Anthropicin ja Googlen parhaat agentit pistettiin tekemään monivaiheisia tieteellisiä työnkulkuja, ne saivat noin puolet siitä pistemäärästä, jonka tohtorin tutkinnon suorittaneet ihmiset ottivat samoista tehtävistä.

Testattuja malleja olivat OpenAI:n GPT-pohjainen agentti, Anthropicin Claude ja Googlen Gemini. Tehtävät vaativat harkintaa, suunnittelua ja varmistamista: kokeiden suunnittelua, anomalioiden jäljittämistä useista tieteellisistä artikkeleista ja osittain toimivien laboratorioprotokollien virheenetsintää. Juuri näissä työvaiheissa agentit jäivät selvästi jälkeen.

Yksittäisissä tehtävissä loikka on ollut iso

Raportti ei ole pelkkää tyrmäystä tekoälylle. Reaalimaailman yksittäisten agenttitehtävien onnistumisaste on noussut vuodessa 20 prosentista 77,3 prosenttiin. Kyberturvallisuuden triage-tehtävissä loikka oli vielä jyrkempi, 15 prosentista 93 prosenttiin.

Kun tehtävä on selkeä ja yksivaiheinen, agentit suoriutuvat vakuuttavasti. Vaikeudet alkavat, kun pitäisi ketjuttaa kuusi tai useampi askel ja arvioida matkalla, meneekö homma oikeaan suuntaan. Stanfordin tutkijat huomauttavat, että agentit eivät tunnista omia virheitään vaan etenevät itsevarmasti hyvinkin väärään suuntaan.

Hukkaavat tutkijan koko iltapäivän

Raportin kärjekkäin yksityiskohta on havainto, että agentit tekevät usein luottavaisia virheitä, jotka kirjoittajien mukaan "hukkaavat tutkijan koko iltapäivän". Tämä on ero verrattuna ihmistutkijaan, joka pysähtyy ihmettelemään, kun jokin ei näytä järkevältä.

Mittakaavan asettaa toinen luku samasta raportista: tekoäly mainitaan tällä hetkellä vain 6–9 prosentissa luonnontieteiden vertaisarvioiduista artikkeleista. Käytännössä agentit eivät ole vielä tutkimuksen valtaväline vaan apuri tarkkaan rajatuissa työvaiheissa.

Suomalainen näkökulma: pragmaattinen linja

Aalto-yliopisto ja Helsingin yliopisto ovat olleet eturivissä, kun on tutkittu kielimallien sovelluksia tieteessä. Aion ottaa molempien AI-tutkimusryhmiin yhteyttä alkuviikosta saadakseni heidän näkemyksensä siitä, miten Stanfordin tulos vaikuttaa heidän omaan agenttitutkimukseensa, ja palaan asiaan tarkemmin lähipäivinä.

Suomalaisten tutkimusryhmien julkinen linja on ollut varovaisen pragmaattinen. Agentteja käytetään koodin kirjoittamisen, kirjallisuuskatsausten ja datan esikäsittelyn tukena, ei autonomisina tutkijoina. Tämä asettelu istuu hyvin Stanfordin havaintoihin. Kun amerikkalainen julkinen keskustelu on viime kuukaudet pyörinyt ajatuksessa, että agentit korvaisivat tohtorintutkinnon suorittaneita työntekijöitä, suomalaiset ryhmät ovat puhuneet kuiluista ja virheherkkyydestä.

Sanasto

Tekoälyagentti
Tekoälyjärjestelmä, joka osaa suorittaa monivaiheisia tehtäviä itsenäisesti: suunnitella askeleita, käyttää työkaluja ja tehdä päätöksiä matkan varrella. Eroaa tavallisesta chatbotista, joka vain vastaa yksittäisiin kysymyksiin.
Triage
Tehtävien luokittelu ja priorisointi kiireellisyyden mukaan. Kyberturvallisuudessa triage tarkoittaa hälytysten lajittelua sen mukaan, mitkä vaativat välitöntä toimintaa.

Yritykset ja kansalaiset hyötyvät rajatummasta lupauksesta

Agenttihype ei jää akateemiseen torstaikahville. Suomalaiset PK-yritykset miettivät juuri nyt, kannattaako rekrytoida vai ostaa agenttipalvelu. Julkishallinto pohtii agenttien käyttöä asiakaspalvelussa ja päätöksenteon tukena. Stanfordin luvut antavat näihin keskusteluihin konkreettisen mittapuun: yksittäisissä tehtävissä agentti voi tehdä lujasti töitä ihmisen rinnalla, mutta päätöksenteko, joka vaatii useita peräkkäisiä arvioita, on yhä ihmisen heiniä.

Sama pätee tavalliseen kansalaiseen, joka pyytää Claudelta tai ChatGPT:ltä apua veroilmoitukseen tai sairauspäivärahahakemukseen. Yksittäinen kysymys saattaa onnistua, mutta kun tilanne edellyttää useiden palasten yhdistämistä ja tarkistamista, pelkkään agenttiin tukeutuminen voi maksaa juuri sen iltapäivän, joka Stanfordin raportin mukaan menee tutkijoiltakin hukkaan.

Tutkimuksen viesti ei siis ole, että agentit ovat hyödyttömiä. Viesti on, että seuraava harppaus ei tule pelkillä isommilla malleilla vaan siitä, että agentit oppivat huomaamaan, milloin ne ovat eksyksissä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.