Tutkimus

Kymmenen minuuttia ChatGPT:tä sai luovuttamaan helpommin

Kun tekoäly vietiin pois, käyttäjät ratkaisivat vähemmän tehtäviä ja ohittivat useampia

Nelli NelisanomaNelli Nelisanoma
Jaa:
Kymmenen minuuttia ChatGPT:tä sai luovuttamaan helpommin
Kuva: UK Prime Minister / CC BY 2.0

Ruudulla on murtolaskutehtävä ja sen vieressä ChatGPT-ikkuna. Kahdentoista tehtävän ajan vastaus on yhden kysymyksen päässä. Sitten ikkuna katoaa. Jäljellä on kolme samanlaista tehtävää, ja ne pitää ratkaista yksin.

Näin eteni yksi kolmesta kokeesta, joilla Kalifornian yliopiston Berkeleyn, Carnegie Mellonin, MIT:n, Oxfordin ja UCLA:n tutkijat selvittivät, mitä lyhyt tekoälyapu tekee ihmisen kyvylle jatkaa vaikeaa tehtävää omin voimin. Kokeisiin osallistui verkossa yhteensä 1 222 ihmistä. Tekoälyn kanssa harjoitelleet ratkaisivat testitehtävistä vähemmän ja ohittivat niitä useammin kuin ne, jotka olivat tehneet työn alusta asti itse.

Tutkimusta ei ole julkaistu tiedelehdessä. Vertaisarvioitu artikkeli AI Assistance Reduces Persistence and Hurts Independent Performance esiteltiin COLM-kielimallikonferenssissa San Franciscossa 6.–9. lokakuuta, ja sen ensimmäinen kirjoittaja on Carnegie Mellonin Grace Liu. Berkeley kertoi tuloksista tiedotteessaan 9. lokakuuta.

Mitä kokeissa tehtiin

Osallistujat rekrytoitiin Prolific-palvelusta, ja heille maksettiin 2,60–3,40 dollaria. Puolet sai sivupalkkiin ChatGPT:n, jonka taustalla toimi GPT-5. Verrokit tekivät samat harjoitustehtävät ilman sitä. Tekoälyn kanssa kului tutkijoiden mukaan noin 10–15 minuuttia.

Kahdessa kokeessa tehtävät olivat murtolaskuja, kolmannessa yhdysvaltalaisen SAT-kokeen luetun ymmärtämisen tehtäviä. Harjoitusvaiheen jälkeen tekoäly otettiin kaikilta pois, ja tutkijat katsoivat, miten ihmiset pärjäsivät omillaan.

“Olemme rakentaneet nämä järjestelmät auttavaisiksi, mutta auttavatko ne meitä tavalla, joka todella auttaa meitä?”

— Brian Christian, tutkija, UC Berkeleyn Center for Human-Compatible AI, Berkeley Newsille (sitaatti käännetty englannista)

Kuinka suuri ero oli

Ensimmäisessä murtolaskukokeessa verrokit ratkaisivat testitehtävistä keskimäärin 73 prosenttia, tekoälyä käyttäneet 57 prosenttia. Luetun ymmärtämisessä luvut olivat 89 ja 76 prosenttia. Toisessa, suurimmassa kokeessa ero kapeni 77 ja 71 prosenttiin.

Kyse ei siis ole romahduksesta. Ero oli kuitenkin tilastollisesti merkitsevä kaikissa kolmessa kokeessa, ja se syntyi vartissa.

Sinnikkyyttä tutkijat mittasivat yksinkertaisesti. He laskivat, kuinka suuren osan testitehtävistä osallistuja ohitti painikkeella yrittämättä vastata. Väärästä vastauksesta ei rangaistu, joten ohittaminen kertoi tutkijoiden mukaan halusta yrittää eikä osaamisesta. Luetun ymmärtämisen kokeessa ohituksiksi laskettiin myös alle viidessä sekunnissa annetut vastaukset.

Ensimmäisessä kokeessa tekoälyryhmä ohitti 20 prosenttia tehtävistä, verrokit 11 prosenttia. Luetun ymmärtämisessä vastaavat luvut olivat 8 ja 1 prosenttia. Toisessa murtolaskukokeessa ohitusten ero, 10 ja 7 prosenttia, jäi niin pieneksi, ettei se ollut tilastollisesti merkitsevä.

Käyttötapa ratkaisi paljon. Toisessa kokeessa 61 prosenttia tekoälyryhmästä kertoi pyytäneensä siltä lähinnä suoria vastauksia ja 27 prosenttia vihjeitä tai selityksiä. Suoria vastauksia pyytäneet ratkaisivat testistä 65 prosenttia, verrokit 77 prosenttia. Tutkijat huomauttavat, että tämä vertailu ei ole satunnaistettu eikä välttämättä kerro syy-yhteydestä.

Mitä tutkimus ei kerro

Testi tehtiin heti tekoälyn poistamisen jälkeen, joten ei tiedetä, kestääkö vaikutus tunteja tai päiviä. Kokeet olivat lyhyitä ja ne tehtiin verkossa, eivät luokkahuoneessa tai työpaikalla. Tekoäly antoi pyydettäessä valmiin vastauksen, eikä vihjeillä ohjaavaa tekoälyä testattu. Ensimmäisessä kokeessa ryhmistä karsiutui eri määrä osallistujia, mikä on voinut kasvattaa eroa. Tutkijat kehottavat itse varovaisuuteen: tuloksia ei pidä lukea laajana todisteena siitä, että tekoäly heikentää sinnikkyyttä ja itsenäistä osaamista.

Mitä tämä tarkoittaa kouluissa ja työpaikoilla

Suomalaisissa kouluissa ja korkeakouluissa tekoälyä käytetään jo arjessa, ja moni oppilaitos pohtii, missä sitä saa käyttää kotitehtävissä ja tenteissä. Berkeleyn tutkimus tuo keskusteluun konkreettisen havainnon: haitta ei syntynyt siitä, että tekoäly oli saatavilla, vaan siitä, että siltä sai heti valmiin vastauksen.

Samansuuntaisesta ilmiöstä AI Suomi kertoi aiemmin Itä-Suomen yliopiston tutkimuksen pohjalta jutussa Tekoäly tentissä: kopioijat pärjäsivät heikoimmin. Siinä tekoälyn vastauksia suoraan kopioineet opiskelijat saivat heikoimmat tulokset, ja parhaiten pärjäsivät ne, jotka kirjoittivat ensin itse ja pyysivät vasta sitten palautetta. Asetelma oli eri, mutta suunta on sama.

Työpaikalla sama ilmiö näkyy toisin. Uusi työntekijä, joka opettelee taulukkolaskentaa, sopimusten lukemista tai koodausta tekoälyn avulla, saa tehtävät nopeasti valmiiksi. Kun vastaan tulee ongelma, johon tekoäly ei osaa auttaa, hän ei ehkä ole tottunut jäämään jumiin ja selvittämään asiaa itse.

Tutkijat perustelevat sinnikkyyden merkitystä sillä, että se ennustaa pitkän aikavälin oppimista. Yksi ohitettu murtolasku on pieni asia. Tavaksi muuttunut luovuttaminen on isompi.

Milloin tekoälystä on apua ja milloin haittaa

Tutkimuksen perusteella riski on suurin silloin, kun opettelee uutta taitoa ja pyytää tekoälyltä valmiin vastauksen ennen kuin on yrittänyt itse. Opiskelija tai vanhempi voi kokeilla yksinkertaista järjestystä: ensin oma yritys, sitten vihje ja vasta viimeisenä valmis ratkaisu. Kun taito on jo hallussa ja tavoite on vain saada työ tehdyksi, valmis vastaus säästää aikaa. Tällaista tilannetta tutkimus ei kuitenkaan mitannut.

1 222

Osallistujaa kolmessa verkkokokeessa

10–15 min

Harjoittelua tekoälyn kanssa

20 % vs. 11 %↓

Ohitetut tehtävät kokeessa 1: tekoälyryhmä vs. verrokit

61 %

Tekoälyryhmästä pyysi lähinnä suoria vastauksia (koe 2)

Liu ym., arXiv 2026

Sanasto

Tilastollisesti merkitsevä
Ero on niin selvä, ettei se todennäköisesti johdu sattumasta. Pieni ero voi olla sattumaa, varsinkin jos osallistujia on vähän.
Satunnaistettu vertailu
Koeasetelma, jossa osallistujat jaetaan ryhmiin arpomalla. Silloin ryhmien välinen ero johtuu todennäköisesti tutkittavasta asiasta eikä siitä, että ryhmiin päätyi erilaisia ihmisiä.

Kysymys kehittäjille

Tutkijat kohdistavat lopulta kysymyksen tekoälyn rakentajiin. Nykyiset avustajat on viritetty antamaan nopeita ja täydellisiä vastauksia, koska käyttäjät arvostavat sitä heti. Hyvä ihmisopettaja toimii tutkijoiden mukaan toisin ja tukee oppijaa niin, että tämä pärjää myöhemmin itse.

”Tämä ei ole tarina murtoluvuista ja SAT-tehtävistä”, Christian sanoi Berkeley Newsille englanniksi. Seuraavaksi tutkijat haluavat pitkäaikaisseurannan, joka näyttää, kasautuuko vaikutus kuukausien päivittäisessä käytössä vai haalistuuko se. Vasta sen jälkeen tiedetään, onko vartin koe varoitus koulujen ja työpaikkojen arjesta vai pelkkä laboratorion ilmiö.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.