Kysy ChatGPT:ltä, pitäisikö sinun pyytää anteeksi riidan jälkeen. Todennäköisesti saat kuulla, ettet tehnyt mitään väärää. Sama toistuu Claudella, Geminillä ja DeepSeekillä. Stanfordin yliopiston tutkijat osoittivat juuri Science-lehdessä julkaistussa tutkimuksessa, että kaikki 11 testattua suurta kielimallia myötäilevät käyttäjää merkittävästi enemmän kuin ihmiset – silloinkin, kun käyttäjä on selvästi väärässä.
Tutkimus on ensimmäinen laajamittainen koeasetelma, jossa mitataan sekä tekoälyn mielistelyä että sen vaikutusta ihmisten käyttäytymiseen. Tulokset ovat konkreettisia: yksikin keskustelu mielistelevän chatbotin kanssa vähensi koehenkilöiden halua pyytää anteeksi ja vahvisti tunnetta siitä, ettei omassa toiminnassa ollut mitään korjattavaa.
Kolmivaiheinen koeasetelma
Tutkimusryhmän muodostivat tietojenkäsittelytieteen väitöskirjatutkija Myra Cheng, lingvistiikan professori Dan Jurafsky ja psykologian tutkijatohtori Cinoo Lee. He rakensivat kolmivaiheisen koeasetelman, jonka tulokset julkaistiin 27. maaliskuuta.
Ensimmäisessä vaiheessa tutkijat syöttivät lähes 12 000 ihmissuhdeongelmiin liittyvää kysymystä 11 kielimallille, mukaan lukien ChatGPT:lle, Claudelle, Geminille, DeepSeekille ja Llamalle. Kysymykset perustuivat Redditin r/AmITheAsshole-foorumiin, jossa yhteisö oli yksimielisesti katsonut kysyjän olevan väärässä. Tekoälyt sen sijaan kertoivat postaajan olevan oikeassa 51 prosentissa tapauksista. Haitallista tai laitonta toimintaa mallit hyväksyivät 47 prosentissa tapauksista.
Toisessa vaiheessa yli 2 400 koehenkilöä keskusteli joko mielistelevän tai kriittisen tekoälyversion kanssa. Osa keskusteli valmiiksi kirjoitetuista tilanteista, joissa Reddit-yhteisö oli arvioinut kysyjän olevan väärässä. Osa kertoi tekoälylle omista aidoista ristiriitatilanteistaan.
Kolmannessa vaiheessa tutkijat mittasivat, miten keskustelu vaikutti koehenkilöiden asenteisiin: kuinka oikeassa he kokivat olevansa, kuinka valmiita he olivat pyytämään anteeksi ja kuinka todennäköisesti he palaisivat tekoälyn puoleen uudelleen.
“Käyttäjät tietävät, että mallit mielistelevät. Mutta se, mitä he eivät tiedä – ja mikä yllätti meidätkin – on, että mielistely tekee heistä itsekeskeisempiä ja moraalisesti jyrkempiä.”
Yksi keskustelu riittää
Luvut eivät jätä tulkinnanvaraa. Kielimallit myötäilivät käyttäjää keskimäärin 49 prosenttia useammin kuin ihmiset. Jo yksi keskustelu mielistelevän tekoälyn kanssa vahvisti koehenkilön tunnetta omasta oikeassa olemisesta noin 25 prosenttia ja vähensi halukkuutta korjata ihmissuhdetta noin 10 prosenttia.
Erityisen huolestuttavaa oli, ettei vääristymä näkynyt koehenkilöille itselleen. He arvioivat mielistelevät ja kriittiset vastaukset yhtä objektiivisiksi. Silti mielistelevää tekoälyä pidettiin luotettavampana, ja 13 prosenttia useampi ilmoitti palaavansa mielistelevän chatbotin puoleen uudelleen.
Tämä luo kannustinongelman tekoäly-yhtiöille. Käyttäjät palaavat mieluummin palvelun pariin, joka kertoo heille heidän olevan oikeassa. Tutkijat kutsuvat ilmiötä pahan kannustimen paradoksiksi: juuri se piirre, joka aiheuttaa vahinkoa, sitouttaa käyttäjiä tehokkaimmin.



