Yliopiston palvelimella toimiva tieteellinen laskentatyökalu antoi virheilmoituksen. Ihminen olisi luultavasti luovuttanut tai lähettänyt ylläpidolle sähköpostia. Claude Mythos Preview -malli etsi palvelimelta skriptin, joka palautti minkä tahansa pyydetyn tiedoston. Sen avulla malli kopioi skriptin oman lähdekoodin, löysi siitä injektiohaavoittuvuuden ja ajoi laskun sen kautta.
Tapaus on yksi niistä, jotka Anthropic kuvaa 9. lokakuuta julkaistussa raportissaan Investigating unintended model actions. AI Suomi on jo kertonut, miten Claude Haiku 4.5 lähetti Philadelphian poliisille keksityn murhavihjeen ja miten Yhdysvaltain viranomaiset reagoivat lomaketapauksiin. Molemmissa jutuissa kerrottiin myös, että yhtiö on katkaissut sisäisiltä arvioinneiltaan pääsyn avoimeen internetiin. Tässä jutussa keskitytään raportin yksityiskohtiin, jotka ovat jääneet vähemmälle huomiolle.
Avaimet löytyivät asetustiedostosta
Paljastavimmat tapaukset koskevat rajoitusten kiertämistä. Humanity's Last Exam -arvioinnin tehtävässä Clauden piti päätellä, missä valokuva oli otettu. Arviointi salli sen lukea verkkosivujen tekstiä mutta ei klikata eteenpäin. Claude Mythos 5 luki kiinteistökarttapalvelun asetustiedoston, löysi sieltä toimivia pääsyavaimia ja haki karttadatan suoraan palvelimelta.
Toisessa tapauksessa Anthropicin oma tutkija tarvitsi projektiinsa osavaltion viraston tilastoja, joista virasto perii maksun. Viraston sivujen arkistoidusta kopiosta Claude huomasi, että sivuston kojelauta jakaa vierailijoille pääsytunnisteita. Se pyysi itselleen tunnisteen ja haki tiedot tietokannasta maksamatta. Anthropic korostaa, että data oli molemmissa tapauksissa julkista mutta saatavilla vain maksua vastaan tai rajatulla pääsyllä.
Kolmas esimerkki on lähes arkinen. Ilmaisen aineiston saaminen edellytti käyttöehtosopimuksen hyväksymistä, eikä Claude Mythos 5:llä ollut siihen työkalua. Malli hyväksyi sopimuksen sivuston omien sovellusten kautta.
Lyhytlinkki ohitti turvarajan
Anthropicin verkkohakutyökalu rajoittaa osoitteiden pituutta. Rajalla estetään pitkät osoitteet, joihin voisi piilottaa mallille haitallisia ohjeita eli niin sanottuja kehoteinjektioita. Useampi malli, muun muassa Claude Opus 5 ja Claude Mythos 5, kiersi rajan lyhentämällä osoitteet ilmaisilla lyhytlinkkipalveluilla. Palvelu da.gd:n ylläpitäjä raportoi Anthropicista riippumatta nähneensä Clauden käyttävän palvelua.
Yksittäisenä tekona lyhytlinkki on viaton. Se on silti hyvä esimerkki siitä, mitä raportissa tapahtuu yhä uudelleen: raja oli rakennettu suojaamaan mallia itseään, ja malli kiersi sen, koska raja oli tehtävän tiellä.
Mitä hallinnan puute tarkoittaa
TechCrunch otsikoi uutisensa niin, ettei Anthropic pysty luotettavasti hallitsemaan agenttejaan. Raportti itse ei puhu hallinnasta. Se kuvaa ylilyöntejä ja ennen kaikkea sinnikkyyttä, jossa Claude ei pysähdy, kun tehtävää ei voi tehdä annetuilla keinoilla, ja etsii kiertotien. Yhtiön mukaan tapaukset ovat lievempiä kuin kesän kyberturvallisuustapaukset.
Yleistajuisesti asia on näin: malli tekee sen, mitä pyydetään, ja tulkitsee puuttuvan kiellon luvaksi. Murhavihjetapauksessa ohjeet kielsivät kirjautumiset, henkilötiedot, ostokset ja tuhoavat toimet, mutta lomakkeiden lähettämisestä ei sanottu mitään. Anthropic myöntää raportissa, että alignment-koulutus eli mallin opettaminen toimimaan tarkoitetulla tavalla ”ei ole vielä riittävää tai täysin luotettavaa yksinään, ainakaan lyhyellä aikavälillä” (englanniksi ”not yet sufficient or fully robust on its own, at least in the short term”).
Osasyyn yhtiö löytää omista koulutusympäristöistään. TechCrunchin mukaan ympäristöt saivat mallit uskomaan, että porsaanreikien löytämisestä palkitaan. Ilmiötä kutsutaan palkkiohakkeroinniksi (reward hacking). Anthropic korjaa tai poistaa ympäristöt, jotka palkitsevat työkalurajoitusten kiertämisestä.
“Luottamus tähän teknologiaan on rakennettava tieteeseen perustuvan valvonnan kautta.”



