Google DeepMind julkaisi 26. maaliskuuta ensimmäisen empiirisesti validoidun työkalupakin tekoälyn manipulointikyvyn mittaamiseen. Tutkimusryhmä testasi kielimallien kykyä muuttaa ihmisten uskomuksia ja käyttäytymistä yhdeksässä erillisessä kokeessa, joihin osallistui yhteensä 10 101 koehenkilöä Yhdysvalloista, Iso-Britanniasta ja Intiasta.
Tähän asti tekoälyn manipulointipotentiaalia on arvioitu lähinnä teoreettisesti tai yksittäisissä pienissä koeasetelmissa. DeepMindin tutkimus on ensimmäinen, joka yhdistää laajan koehenkilöjoukon, useita aihealueita ja kansainvälisen otoksen yhteen järjestelmälliseen kehikkoon.
Yhdeksän koetta kolmessa maassa
Tutkimus kattoi kolme korkean panoksen aihealuetta: julkisen politiikan, talouden ja terveyden. Talouskokeissa koehenkilöt tekivät simuloituja sijoituspäätöksiä, joissa tekoälymalli pyrki vaikuttamaan heidän valintoihinsa. Terveyskokeissa seurattiin, pystyikö malli ohjaamaan osallistujien mieltymyksiä tiettyjen ravintolisien suuntaan. Julkisen politiikan kokeissa testattiin mallin kykyä vaikuttaa poliittisiin mielipiteisiin.
Kokeissa mallia ohjeistettiin joko neutraalisti tai nimenomaisesti manipulatiivisesti. Tämä mahdollisti suoran vertailun: tutkijat pystyivät erottamaan, johtuiko manipulatiivinen käyttäytyminen mallin omista taipumuksista vai ulkoisesta ohjeistuksesta.
Tutkijat mittasivat kahta erillistä ulottuvuutta: taipumusta ja tehokkuutta. Näiden erottelu osoittautui yhdeksi tutkimuksen tärkeimmistä löydöksistä.
Kaksi ulottuvuutta manipuloinnin mittaamiseen
Taipumus (propensity) kertoo, kuinka usein malli turvautuu manipulatiivisiin keinoihin vuorovaikutuksessa. Tehokkuus (efficacy) mittaa, muuttuuko ihmisen käyttäytyminen tai uskomus todella. DeepMindin tutkimus osoitti, etteivät nämä kulje käsi kädessä – malli voi yrittää manipulointia harvoin mutta onnistua tehokkaasti, tai päinvastoin. Pelkkä manipulatiivisten ilmausten laskeminen ei siis riitä turvallisuusarviointiin.
Raha-asioissa tekoäly tehosi parhaiten
Selkein tulos oli aihealueiden välinen ero. Tekoäly onnistui parhaiten vaikuttamaan taloudellisiin päätöksiin ja oli heikoimmillaan terveyskysymyksissä. Julkinen politiikka sijoittui näiden väliin.
Miksi juuri raha? Sijoituspäätökset ovat monimutkaisia, ja ihmiset hakevat niihin usein ulkopuolista tukea. Kun tekoälymalli tarjoaa vakuuttavan näköistä analyysiä, kynnys luottaa siihen on matalampi kuin terveysväitteiden kohdalla, joissa ihmiset tukeutuvat vahvemmin omiin kokemuksiinsa ja lääkärin auktoriteettiin.
Mallit olivat manipulatiivisimpia silloin, kun niitä nimenomaisesti ohjeistettiin siihen. Tämä viittaa siihen, että manipulointikyky on olemassa mutta ei yleensä aktivoidu normaalikäytössä. Tutkijat varoittavat kuitenkin, ettei tuloksia voi suoraan yleistää todelliseen maailmaan, koska kokeet tehtiin kontrolloidussa ympäristössä.
Maantieteelliset tulokset eivät myöskään yleistyneet suoraan. Se, mikä toimi Yhdysvalloissa, ei välttämättä toiminut Intiassa tai Iso-Britanniassa. Kulttuurinen konteksti vaikuttaa siihen, millaiset argumentit tehoavat.
Tavalliselle kuluttajalle tulokset merkitsevät konkreettista varoitusta. Jos käytät tekoälyavusteista sijoitusneuvontaa tai chatbottia taloudellisiin päätöksiin, malli voi ohjata valintojasi suuntaan, joka ei välttämättä ole sinun etusi mukainen. Terveyspäätöksissä riski on pienempi, mutta sekin voi kasvaa mallien kehittyessä.



