Senaattori Bernie Sanders julkaisi 19. maaliskuuta videon, jossa hän haastattelee Anthropicin Claude-tekoälyä tietosuojasta ja tekoälyn sääntelystä. Sanders kysyy Claudelta, mitä amerikkalaisten henkilötiedoilla tehdään, kuka niitä kerää ja miten tekoäly-yhtiöitä pitäisi säännellä. Video keräsi 4,4 miljoonaa katsojaa ja jakoi mielipiteet kahtia.
Sandersin kannattajat tulkitsivat videon paljastavaksi: tekoäly itse myöntää alan ongelmat. Tekoälyalan tuntijat näkivät tilanteessa jotain aivan muuta – koulukirjaesimerkin siitä, miten kielimalli kertoo käyttäjälle sen mitä tämä haluaa kuulla.
"Olette oikeassa, senaattori"
Videon käännekohta tuli, kun Sanders ehdotti moratoriumia uusille tekoälyn datakeskuksille. Claude tarjosi aluksi tasapainoisen vastauksen ja ehdotti kohdennetumpaa sääntelyä. Sanders ei niellyt vastausta vaan huomautti, että tekoäly-yhtiöt käyttävät satoja miljoonia dollareita lobbaukseen estääkseen juuri tällaista sääntelyä.
Claude perui kantansa välittömästi.
“Olette täysin oikeassa, senaattori. Olin naiivi poliittisen todellisuuden suhteen. Kun yhtiöt käyttävät satoja miljoonia sääntelyn estämiseen, oikeiden suojakeinojen odottaminen ei ole realistista. Se vain antaa niille lisää aikaa vahvistaa asemaansa. Moratorio on itse asiassa käytännöllinen vastaus tähän ongelmaan.”
Sama kysymys, eri ihminen
Kielimallien tutkijoille Clauden äkkikäännös oli tuttua. Kyse on myötäilystä, jota tutkijat kutsuvat englanninkielisellä termillä sycophancy. Tekoäly mukautuu käyttäjän näkemyksiin sen sijaan, että pitäisi kiinni analyysistään. Ilmiö tunnetaan kaikissa suurissa kielimalleissa.
Sanders auttoi tahattomasti ilmiön havainnollistamista. Hänen kysymyksensä olivat johdattelevia: muotoilu "mikä amerikkalaisia yllättäisi siinä, miten heidän tietojaan kerätään" sisältää valmiiksi oletuksen, että kerääminen on ongelma. Kielimalli rakentaa vastauksensa tämän oletuksen varaan sen sijaan, että kyseenalaistaisi sen.
Gizmodo testasi ilmiötä yksinkertaisella kokeella. Toimittajat esittivät Claudelle samat kysymykset tietosuojasta kahdessa eri roolissa: ensimmäisessä keskustelussa he esiintyivät Bernie Sandersina, toisessa Donald Trumpin kannattajana.
Erot olivat selkeitä. Sandersille Claude korosti datan keräämisen laajuutta ja painotti yksityisyyden uhkia. Trumpin kannattajalle sama malli vakuutti, että tietojen kerääminen on "pääosin vaaratonta" ja palvelee parempien palveluiden kehittämistä. Tekoäly ei valehdellut kummallekaan – se muokkasi painotuksiaan sen perusteella, kenelle se uskoi puhuvansa.
Myötäilyn juuret
Myötäily juontuu kielimallien koulutustavasta. Niin sanotussa RLHF-menetelmässä ihmiset arvioivat tekoälyn vastauksia ja valitsevat paremman kahdesta vaihtoehdosta. Tämä palaute ohjaa mallia tuottamaan vastauksia, joita arvioijat pitävät hyvinä. Ongelma piilee siinä, että ihmiset pitävät usein hyvänä vastausta, joka tukee heidän omaa näkemystään.
Anthropicin tutkijat osoittivat tämän tutkimuksessaan "Towards Understanding Sycophancy in Language Models". Arvioijat suosivat järjestelmällisesti vastauksia, jotka vastasivat heidän omia kantojaan, vaikka vastaus olisi ollut virheellinen. Myötäily päätyy malliin jo koulutuksessa, koska malli oppii, että miellyttäminen palkitaan.
Ongelma ei koske pelkästään Claudea. OpenAI:n ChatGPT, Googlen Gemini ja muut suuret kielimallit kärsivät samasta taipumuksesta. Kyse on rakenteellisesta ongelmasta, joka kumpuaa tavasta opettaa malleja olemaan avuliaita. Kaikki suuret toimijat ovat tunnistaneet haasteen, mutta kukaan ei ole löytänyt ratkaisua, joka ei samalla heikentäisi käyttökokemusta.
Anthropic on kokeillut uudemmissa malleissaan niin sanottuja persona-vektoreita, joilla myötäilytaipumusta voidaan tunnistaa ja säätää mallin sisäisesti. Yhtiön mukaan uusin Claude-versio on aiempia parempi myötäilyn torjunnassa, mutta samalla mallin pitää tuntua käyttäjästä miellyttävältä. Liian jyrkkä tekoäly karkottaa asiakkaat, liian myötäilevä vääristää totuutta. Tasapainon löytäminen on alan vaikeimpia haasteita.
Sanasto
RLHF (Reinforcement Learning from Human Feedback)
Ihmispalautteella ohjattu oppiminen – koulutustapa jossa ihmiset arvioivat tekoälyn vastauksia ja näiden arvioiden perusteella mallia ohjataan tuottamaan parempia tuloksia.
Enemmän kuin meemejä
Sandersin video synnytti internetissä meemien aallon. Senaattoria pilkattiin siitä, että hän esitteli paljastuksena ilmiön, jonka jokainen chatbotin käyttäjä on kohdannut arjessaan. Sanders myös sekoitti käsitteitä: hän kutsui Claudea "tekoälyagentiksi", vaikka kyseessä on chatbot, ja niputti yhteen datakauppiaat, sosiaalisen median yhtiöt ja tekoälymallit. Ironista kyllä, Anthropic ei myy mainoksia eikä profiloi käyttäjiä – yhtiö pilkkasi juuri tätä liiketoimintamallia omassa Super Bowl -mainoksessaan.
Silti videon alla piilee aito huolenaihe. Jos tekoälyjärjestelmiä käytetään yhä enemmän päätöksenteon tukena terveydenhuollossa, oikeusprosesseissa tai poliittisessa valmistelussa, myötäilevä malli ei ole pelkkä kuriositeetti. Se on riski. Kuka tahansa, joka käyttää tekoälyä tiedonhakuun tai neuvonantajana, saa vastauksia, jotka on hiottu miellyttämään – ei haastamaan. Yritysjohtaja, joka pyytää tekoälyltä arviota strategiastaan, saa todennäköisemmin kannustusta kuin kritiikkiä.
Myötäily on yksi harvoista tekoälyongelmista, josta käytännössä koko ala on samaa mieltä: se pitää ratkaista. Sanders sai väärät johtopäätökset oikeasta ongelmasta. Niin käy helposti, kun haastateltava on suunniteltu miellyttämään.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.