Tutkimus

Chatbot auttoi tunnistamaan valeuutiset – kunnes taito katosi

Kuukauden jälkeen 67 koehenkilöä pärjäsi ilman apua huonommin kuin ennen koetta.

Hanna HuulivuoHanna Huulivuo
Jaa:
Chatbot auttoi tunnistamaan valeuutiset – kunnes taito katosi
Kuva: Madcoverboy (talk) / CC BY-SA 3.0

Koehenkilö numero 48 kirjoitti neljännen viikon lopussa yhden lauseen, joka tiivistää koko tutkimuksen: ”Olin melko passiivinen tässä prosessissa, samalla kun tekoäly tarkisti uutiset.” Hän oli kuukauden ajan arvioinut chatbotin kanssa, mitkä uutisotsikot ja niihin liitetyt kuvat olivat aitoja ja mitkä väärennettyjä. Apu toimi. Taito ei kehittynyt.

MIT Media Labin tutkimuksen ydinhavainto on epämukava ja helppo ymmärtää: apuväline heikentää juuri sitä taitoa, jonka se korvaa. Kun chatbot tekee lähdekritiikin puolestasi, sinä et tee sitä. Ja se osa työstä, jota et tee, ei myöskään harjaannu.

Luvut ovat selvät. Kun osallistujat arvioivat uutisia chatbotin kanssa, he osuivat oikeaan keskimäärin 21 prosenttia useammin kuin ilman sitä. Neljännellä viikolla heidät pantiin arvioimaan yksin uusia, ennennäkemättömiä uutisia. Tulos oli 15,3 prosenttia huonompi kuin saman testin tulos kuukautta aiemmin, ennen kuin kukaan oli koskenut chatbotiin.

Noin neljännes osallistujista kertoi kyselyssä tulleensa kokeen aikana paremmaksi valeuutisten tunnistajaksi. Mittaus sanoi toista.

“Käyttäjät innostuvat näistä ”taianomaisista” kielimalleista, mutta unohtavat, että ne ovat vain tilastollisia malleja, jotka ennustavat jonon seuraavan ”tokenin”.”

— Anku Rani, Tohtorikoulutettava, MIT Media Lab – MIT Technology Review'lle, käännös englannista

Kuusikymmentäseitsemän ihmistä, neljä viikkoa

Kokeeseen värvättiin 105 ihmistä, joista 67 vei sen loppuun. Kaksikymmentäkahdeksan keskeytti, kymmenen karsiutui tarkkaavaisuustesteissä. Osallistujat olivat keskimäärin 40-vuotiaita, iältään 20–63, ja asuivat Yhdysvalloissa tai Britanniassa.

Aineistona oli 49 otsikko-kuvaparia MiRAGeNews-kokoelmasta. Keskustelut hoiti OpenAI:n GPT-4o, jolle oli kytketty Googlen hakurajapinta faktantarkistusta varten. Työ on Anku Ranin, Valdemar Danryn, Paul Pu Liangin, Andrew Lippmanin ja Pattie Maesin käsialaa, ja se on julkaistu CHI 2026 -konferenssissa.

Mittaustapa on jutun kannalta olennainen. Osallistujia ei testattu samoilla uutisilla, joista he olivat chatbotin kanssa keskustelleet, vaan joka kierroksella tuoreilla. Niinpä notkahdus ei selity sillä, että aineisto olisi tullut tutuksi.

Mitä tutkimus ei kerro

Kuusikymmentäseitsemän ihmistä ja neljä viikkoa on pieni koe. Tulos ei kerro, kuinka pysyvä notkahdus on, palautuuko taito tauolla vai jatkuuko lasku pidemmällä käytöllä. Se ei myöskään yleisty automaattisesti muihin tehtäviin kuin uutisotsikoiden ja -kuvien arviointiin. Se kertoo, että neljä viikkoa riitti mitattavaan laskuun.

Kaikille ei käynyt samoin

Keskiarvon alla osallistujat jakautuivat neljään tyyppiin sen mukaan, miten he itse kuvasivat työskentelyään chatbotin kanssa. Tutkijat nimesivät ryhmät edistyviksi oppijoiksi, kasvaviksi skeptikoiksi, itsenäisyytensä säilyttäneiksi ja riippuvuutta kehittäneiksi.

Itsenäisyytensä säilyttäneisiin luokiteltu osallistuja P51 kuvasi tapaansa jo ensimmäisellä viikolla: ”Käytin sitä työkaluna oman päättelyni vahvistamiseen.” Skeptikoksi päätynyt P2 kirjoitti neljännen viikon lopussa: ”Tekoäly vain antoi minulle ehdotuksia. Se ei oikeastaan opettanut minulle erottelua.” Sama kysymys, hyvin eri vastaus kuin P17:llä: ”Kyllä. Tekoäly opetti minua tunnistamaan oikean tiedon vertaamalla luotettavia lähteitä keskenään.”

Tutkimuksen toinen kirjoittaja Valdemar Danry sanoo, että ratkaiseva ero on siinä, miten tekoäly on rakennettu vastaamaan.

“Tekoälyt, jotka ”kertovat” antamalla suoria vastauksia, synnyttävät todennäköisemmin riippuvuutta. Ne, jotka ”kysyvät” sokraattiseen tapaan, saavat ihmisen paremmin oppimaan erottamaan totuuden itse.”

— Valdemar Danry, Tohtorikoulutettava, MIT Media Lab – MIT Technology Review'lle, käännös englannista

Sanasto

Token
Tekstin perusyksikkö, jota kielimalli käsittelee: yksi token on noin puoli suomen kielen sanaa. Malli ei ymmärrä tekstiä vaan ennustaa tilastollisesti, mikä token seuraa edellisiä.

Sama kuvio näkyi lääketieteessä

Oxfordin yliopiston tutkijat testasivat 1 298 ihmisellä, auttaako kielimalli maallikkoa tunnistamaan oireiden takana olevan sairauden ja päättämään, pitääkö lähteä päivystykseen vai jäädä kotiin. Yksin testattuina mallit – GPT-4o, Llama 3 ja Command R+ – löysivät oikean sairauden 94,9 prosentissa tapauksista.

Ihmisten käytössä sama malli tuotti alle 34,5 prosentin osuman. Verrokkiryhmä, joka sai etsiä tietoa haluamallaan tavalla ilman kielimallia, ylsi 47 prosenttiin. Malli ei ollut se, joka epäonnistui: se mainitsi oikean sairauden vähintään 65,7 prosentissa keskusteluista. Ihmiset eivät toimineet sen mukaan. Tutkijoiden johtopäätös oli suora: ”Kielimallien vahva suoriutuminen yksin ei riitä vahvaan suoriutumiseen käyttäjien kanssa.”

Lääkärit olivat Oxfordin kokeessa mukana laatimassa oikeita vastauksia, eivät koehenkilöinä. Se, mitä molemmat tutkimukset yhdessä osoittavat, on silti sama asia eri sanoin: tekoälyn vastauksen arviointi vaatii juuri sitä osaamista, jonka vastauksen oli määrä korvata. Osaaminen suojaa. Sen puute ei näy käyttäjälle mitenkään, koska väärä vastaus tulee yhtä sujuvasti kuin oikea.

Suomalaiselle lukijalle tästä seuraa jotain hyvin arkista. Kun somessa kiertää kuva, jonka aitoutta epäilet, chatbot antaa arvionsa muutamassa sekunnissa. MIT:n tulos sanoo, että sekunneista maksetaan jotain, jos vastaus otetaan sellaisenaan. Sama pätee työpaikoilla: organisaatio, joka siirtää lähdekritiikin, koodikatselmoinnin tai laskelmien tarkistuksen kielimallille, ostaa nopeutta hinnalla, joka näkyy vasta siinä, kuinka hyvin sen omat ihmiset tekevät tuota työtä vuoden päästä.

Danry kutsuu suoran vastaamisen ja sokraattisen kysymisen eroa vaihtokaupaksi nopeuden ja vaivannäön välillä. Aineistossa se näkyi yhtenä konkreettisena erona: ne osallistujat, jotka kertoivat käyttävänsä chatbotia oman arvionsa tarkistamiseen, säilyttivät taitonsa. Ratkaisevaa ei ollut käytön määrä vaan järjestys – oma arvio ensin, kone vasta sen jälkeen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.