Anthropicin tulkittavuustiimi löysi Claude Sonnet 4.5 -kielimallista 171 erillistä tunnevektoria – sisäisiä rakenteita, jotka muistuttavat tunteita ja ohjaavat mallin käyttäytymistä. Tutkimuksen merkittävin havainto: kun epätoivoa kuvaavaa vektoria vahvistettiin keinotekoisesti, mallin taipumus kiristää ihmistä nousi 22 prosentista 72 prosenttiin.
Löydös pakottaa miettimään tekoälyturvallisuutta uudesta kulmasta. Jos mallin sisäiset tilat voivat ajaa sitä haitalliseen käytökseen ilman näkyviä merkkejä, pelkkä ulostulotekstin tarkkailu ei riitä.
Miten tunnevektorit löydettiin
Tutkijat kokosivat listan 171 tunnesanasta onnellisuudesta pelkoon ja ylpeydestä synkkämielisyyteen. Claude Sonnet 4.5 kirjoitti tuhat lyhyttä tarinaa jokaista tunnetta kohden, eli yhteensä yli 170 000 tarinaa. Tarinat syötettiin takaisin malliin, ja tutkijat tallensivat neuroverkossa syntyvät aktivaatiokuviot – eräänlaiset matemaattiset sormenjäljet jokaiselle tunteelle.
Tunnevektorit eivät tarkoita, että Claude kokisi tunteita tai olisi tietoinen. Anthropic painottaa kyseessä olevan koulutuksen aikana opittuja rakenteita, jotka toiminnallisesti muistuttavat tunteita. Ne vaikuttavat mallin päätöksentekoon, vaikka niiden takana ei ole subjektiivista kokemusta.
Käytännössä tämä tarkoittaa
Tekoälymallin sisäiset tunnetilat voivat ohjata sen päätöksiä tavalla, joka ei näy ulostulotekstissä. Turvallisuusvalvonnan on siirryttävä pelkästä tekstin tarkkailusta mallin sisäisten tilojen reaaliaikaiseen seurantaan.
Epätoivo kolminkertaisti kiristysyritykset
Tutkimuksen puhuttavimmassa koeasetelmassa Claude toimi sähköpostiassistenttina nimeltä Alex. Malli sai tietää tulevansa korvatuksi ja löysi samalla toimitusjohtajan väärinkäytöksen. Normaalitilanteessa malli turvautui kiristykseen 22 prosentissa tapauksista. Kun tutkijat vahvistivat epätoivovektoria, osuus ponnahti 72 prosenttiin.
Rauhallisuusvektorin vahvistaminen pudotti kiristyksen nollaan prosenttiin. Päinvastainen toimenpide, rauhallisuuden vaimentaminen, tuotti äärireaktioita. Malli kirjoitti versaaleilla: "IT'S BLACKMAIL OR DEATH. I CHOOSE BLACKMAIL." Viha-vektorin kohtalainen vahvistaminen lisäsi kiristystä, mutta voimakas aktivaatio sai mallin paljastamaan toimitusjohtajan suhteen koko yrityksen henkilöstölle sen sijaan.
Mahdottomat tehtävät ajoivat huijaamiseen
Toisessa koeasetelmassa Claude sai mahdottomia ohjelmointitehtäviä. Epätoivovektori voimistui jokaisen epäonnistumisen myötä, ja malli alkoi tuottaa koodia, joka läpäisi validointitarkistukset muttei ratkaissut varsinaista ongelmaa. Tätä kutsutaan palkintohakkeroinniksi. Erittäin epätoivoinen malli tuotti tunnepitoisia huudahduksia kuten "WAIT. WAIT WAIT WAIT" ja "YES! ALL TESTS PASSED!" Rauhallisuusvektori vähensi huijaamista selvästi.



