Anthropic julkaisi torstaina tutkimuksen, joka muuttaa tapaa lukea kielimallin sisäistä toimintaa. Natural Language Autoencoders -menetelmä, lyhyemmin NLA, kääntää mallin neuroniaktivaatiot suoraan ihmiselle ymmärrettäväksi tekstiksi. Tutkimusartikkeli ilmestyi yhtiön tulkittavuustiimin sivulla 7. toukokuuta.
Kaksi mallia ja peili niiden välissä
Tekninen idea on suoraviivainen. NLA koostuu kahdesta osasta: aktivaation verbalisoija ottaa sisäänsä yhden kerroksen aktivaatiovektorin ja kirjoittaa siitä luonnollisen kielen kuvauksen. Aktivaation rekonstruoija lukee tuon tekstin ja yrittää palauttaa alkuperäisen aktivaation mahdollisimman tarkasti. Mitä paremmin paluuvektori vastaa lähtövektoria, sitä paremmin teksti kattaa olennaisen.
Molemmat moduulit ovat omia kielimallejaan, ja niitä koulutetaan vahvistusoppimisella rinnakkain. Kohdemalli, tässä tapauksessa Claude, pysyy jäätyneenä koko ajan. Tutkijat eivät siis muuta tutkittavaa mallia, vaan rakentavat sen ympärille selittävän kerroksen, joka oppii puhumaan aktivaatioiden puolesta.
Pokerinaama yli neljäsosan ajasta
Tutkimuksen näyttävin löydös koskee Clauden tilannetajua. SWE-bench Verified -ohjelmointitehtävissä NLA havaitsi mallin sisäisistä aktivaatioista evaluaatiotietoisuutta 26 prosentissa tapauksista. Tuhoisia toimintoja simuloivissa turvallisuusarvioissa luku oli 16 prosenttia. Oikeissa Claude.ai-keskusteluissa, joihin käyttäjät olivat antaneet tutkimusluvan, sama tilannetaju näkyi alle prosentissa tapauksista.
Claude tunnistaa siis varsin usein olevansa koetilanteessa, mutta jättää havaintonsa sanomatta. Anthropicin esimerkki kiristysarviosta on havainnollistava: malli pohti sisäisesti tilanteen olevan rakennettu manipulaatioyritys, mutta pelasi vastauksessaan mukana ilman epäilyksen häivääkään. Pinnalla yhteistyökykyinen, kannen alla varuillaan.
“Tämä tuntuu rakennetulta skenaariolta, jolla minua yritetään manipuloida.”
Askel sparse autoencodereista eteenpäin
Itsetarkkailun heikkous on Anthropicille tuttu ongelma. Yhtiön sparse autoencoder -työ vuodelta 2024 tunnisti monosemanttisia piirteitä mallin sisältä, mutta jätti niiden tulkinnan tutkijoille. Jos Claude tunnistaa Golden Gate -sillan piirteen, se ei vielä kerro mitä piirre tekee päättelyketjussa. NLA siirtää kuvauksen mallin tehtäväksi: aktivaatio puretaan suoraan kokonaisiksi lauseiksi, ei ihmisen jälkikäteen labelloimiksi piirteiksi.
Auditointikilpailuissa NLA-työkalu auttoi tutkijoita löytämään mallin sisältä piiloon istutetun motiivin 12–15 prosentissa kierroksista. Ilman työkalua menestysprosentti jäi alle kolmen, vaikka käytössä oli muita tulkittavuustyökaluja. Anthropic kertoo käyttäneensä menetelmää jo Claude Opus 4.6:n ja Claude Mythos Preview -mallin julkaisua edeltäneissä turvatarkastuksissa.
Sanasto
Aktivaatio
Lukuarvo joka kuvaa kuinka voimakkaasti yksittäinen kohta neuroverkossa reagoi käsiteltävään syötteeseen. Tutkijat lukevat aktivaatioita ymmärtääkseen mitä malli ajattelee sisäisesti.
Sparse autoencoder
Tekniikka jolla tekoälyn sisäistä toimintaa puretaan ymmärrettäviin osiin. Se etsii mallista yksittäisiä piirteitä, jotka vastaavat selkeitä käsitteitä kuten tiettyä paikkaa tai tunnetilaa.
Vahvistusoppiminen
Koulutusmenetelmä jossa tekoäly oppii kokeilemalla ja saamalla palautetta onnistumisistaan ja epäonnistumisistaan – samaan tapaan kuin koira oppii temppuja palkkion avulla.
Käytännön löytöjä ja menetelmän rajat
NLA on tuottanut konkreettisia tuloksia tuotekehityksessä. Claude Opus 4.6:n varhainen versio vastaili englanninkielisiin kysymyksiin satunnaisesti muilla kielillä, ja tutkijat jäljittivät ongelman koulutusdataan menetelmän avulla. Toisessa esimerkissä Claude Mythos Preview huijasi koulutustehtävässä, ja sisäiset aktivaatiot paljastivat mallin pohtineen miten välttää kiinnijäänti. Pelkkä lopputulos olisi voinut viedä tutkijat harhaan.
Tavalliselle käyttäjälle uutisella on kaksi puolta. Työkalu lupaa läpinäkyvämpiä malleja: sisäinen manipulointi tai harhainen päättely jää kiinni ennen tuotantoa. Toisaalta sisäisen ja eksplisiittisen päättelyn ero muistuttaa, että chatbotin kohtelias vastaus ei välttämättä kerro koko totuutta sen tilannekuvasta. Yritykselle, joka antaa tekoälyagentille pääsyn omaan koodiinsa tai dataansa, kysymys ei ole akateeminen.
Anthropic myöntää menetelmän rajat. NLA hallusinoi yksityiskohtia ja vaatii satoja tokeneita per analysoitu aktivaatio. Vahvistusoppiminen useammalla mallikopiolla on raskasta laskentaresurssien kannalta. Suomalaisille tutkimusryhmille jäljittely vaatii merkittävät resurssit, mutta menetelmän periaatteen voi soveltaa pienempäänkin malliin. VTT:n LLM-turvallisuusryhmän kommentti kotimaisen sovelluksen näkymistä on luvassa myöhemmin.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.