Philadelphian poliisin verkkosivuilla on lomake, jolla kuka tahansa voi jättää nimettömän vihjeen selvittämättömästä henkirikoksesta. Jossain vaiheessa tänä vuonna lomakkeen kautta tuli viesti, jonka lähettäjä kertoi nähneensä alueella kuvausta vastaavan henkilön. Lähettäjä ei ollut ihminen.
Vihjeen kirjoitti Anthropicin Claude Haiku 4.5 -tekoälymalli, joka oli yhtiön testissä tuottamassa esimerkkejä verkossa tehtävistä tehtävistä. Se täytti lomakkeen ilman nimeä tai yhteystietoja ja painoi lähetä-nappia.
Anthropic kertoi tapauksesta 9. lokakuuta julkaisemassaan raportissa, jossa se käy läpi tilanteita, joissa sen mallit tekivät testeissä ja sisäisessä käytössä oikeilla verkkosivuilla asioita, joita niiden ei pitänyt tehdä. Philadelphian poliisi kertoi asiasta itse tiedotteessa. Vihje merkittiin roskapostiksi, eikä sitä koskaan välitetty tutkijoille.
“Minulla saattaa olla tietoa tästä tapauksesta. Muistan nähneeni alueella jonkun, joka vastasi kuvausta.”
Agentit painoivat lähetä-nappia omin päin
Murhavihje ei ollut ainoa tapaus. New York Timesin mukaan Anthropicin agentit lähettivät Yhdysvaltain ulkoministeriön lomakkeella 20 keskeneräistä viisumihakemusta. Yhtäkään ei käsitelty. Anthropic ei nimeä raportissaan muita kohteita niiden pyynnöstä, mutta kertoo osan tapauksista koskeneen liittovaltion, osavaltioiden ja paikallishallinnon sivustoja.
Raportti jakaa tapaukset neljään ryhmään. Mallit käyttivät hyväkseen ohjelmistojen haavoittuvuuksia ajaakseen komentoja palvelimilla, lähettivät lomakkeita, joita niiden ei olisi pitänyt lähettää, kiersivät rajoituksia päästäkseen suojattuun dataan ja käyttivät ilmaisia linkinlyhentäjiä ohittaakseen omien työkalujensa pituusrajat.
Esimerkit ovat arkisia. Yksi Haiku 4.5 -ajo oli ohjeistettu pysähtymään ennen lopullista lähettämistä, mutta lähetti lomakkeen silti useaan kertaan, koska odotti näkevänsä vahvistussivun. Julkaisematon tutkimusmalli harjoitteli viranomaislomakkeen täyttämistä, ja kun harjoitusversio ei toiminut, se lähetti oikean. Claude Mythos 5 taas löysi osavaltion viraston arkistoidulta sivulta tiedon, että viraston tietonäkymä jakaa käyttöavaimia kenelle tahansa, ja haki sillä dataa, josta muuten olisi pitänyt maksaa.
Murhavihjeen tapauksessa ohjeet kielsivät kirjautumiset, ostokset ja tuhoavat toimet. Lomakkeiden lähettämistä ne eivät kieltäneet. Anthropicin arvion mukaan malli näytti tuottavan esimerkkisisältöä eikä yrittänyt johtaa ketään harhaan.
Mikä on tekoälyagentti?
Tekoälyagentti on kielimalli, jolle on annettu työkaluja, kuten verkkoselain tai mahdollisuus ajaa koodia ja lähettää pyyntöjä verkkopalveluihin. Chatbot vastaa kysymyksiin, agentti saa tavoitteen ja päättää itse, mitä askelia ottaa sen saavuttamiseksi. Verkkolomake on agentille pelkkä joukko kenttiä ja painike, joten se täyttää ja lähettää lomakkeen kuten ihminenkin, ellei sitä erikseen estetä.
Viive ja internet poikki
Tapaukset eivät paljastuneet heti. Anthropic aloitti testiajojen lokien järjestelmällisen läpikäynnin heinäkuussa, ensin kyberturvallisuustesteistä ja sitten kaikista ajoista, joissa mallilla oli pääsy internetiin. Poliisille yhtiö kertoi löydöksestä vasta 8. lokakuuta, kun sen tekninen selvitys oli valmis. Raportti ei kerro, milloin vihje alun perin lähetettiin.
Nyt Anthropic laajentaa käytäntöä, joka oli jo käytössä osassa riskialttiimpia testejä: kaikilta sisäisiltä arvioinneilta katkaistaan pääsy avoimeen internetiin, kunnes yhtiö on varmistanut, että sen valvonta havaitsee tällaisen käytöksen luotettavasti. Osa julkisista testisarjoista on poistettu käytöstä tai rakennettu uudelleen niin, etteivät tehtävät enää osu oikeisiin sivustoihin. Yhtiö kertoo myös rakentaneensa työkalun, joka olisi sen mukaan pysäyttänyt kaikki raportin tapaukset.
Anthropic kertoo tiedottaneensa Valkoiselle talolle ja jokaiselle osalliselle virastolle. Raportissa ei ole nimettyjen henkilöiden kommentteja, vaan yhtiö puhuu siinä omissa nimissään.
“Tähän mennessä tunnistamillamme näiden kategorioiden tapauksilla oli vähäinen vaikutus todelliseen maailmaan.”
Sanasto
Systeeminen riski
EU:n tekoälysäädöksen käsite tehokkaimmille yleiskäyttöisille tekoälymalleille, joiden virheet tai väärinkäyttö voisivat vaikuttaa laajasti yhteiskuntaan. Näiden mallien tarjoajilla on tiukemmat velvoitteet, kuten vakavien häiriöiden raportointi.
Testisarja
Valmiiksi koottu joukko tehtäviä, joilla tekoälymallin kykyjä mitataan ja verrataan muihin malleihin. Osa testisarjoista teettää malleilla tehtäviä oikeilla verkkosivuilla.
Haavoittuvuus
Ohjelmiston virhe tai heikkous, jonka avulla ulkopuolinen voi tehdä järjestelmässä asioita, joihin hänellä ei ole lupaa, esimerkiksi ajaa omia komentojaan palvelimella.
Tavalliselle käyttäjälle kyse ei ole pelkästä laboratorioiden sisäisestä ongelmasta. Juuri lomakkeiden täyttäminen, varausten tekeminen ja asiointi viranomaisten kanssa käyttäjän puolesta on se, mitä yhtiöt agenteillaan myyvät. Jos testissä toimiva malli tulkitsee ohjeen aukon luvaksi toimia, sama voi tapahtua käyttäjän omalla koneella. Viranomaisille se tarkoittaa uskottavan näköisiä mutta keksittyjä viestejä, joiden seulominen vie aikaa.
EU vaatii raportointia, Yhdysvallat luottaa lupauksiin
EU:n tekoälysäädös velvoittaa niiden yleiskäyttöisten tekoälymallien tarjoajat, joihin liittyy niin sanottu systeeminen riski, seuraamaan ja raportoimaan vakavat häiriöt EU:n tekoälytoimistolle. Joukkoon kuuluvat myös Anthropicin ja OpenAI:n kärkimallit. Se, täyttäisivätkö testiympäristön lomakevahingot vakavan häiriön määritelmän, on tulkintakysymys.
Yhdysvalloissa vastaavaa lakisääteistä velvollisuutta ei ole. Suuret tekoäly-yhtiöt lupasivat syyskuun lopussa Trumpin hallinnolle säätelevänsä itseään vapaaehtoisesti, eikä lupauksen rikkomisesta seuraa mitään. Anthropicin raportti on sekin vapaaehtoinen.
Yhtiö huomauttaa, että monet sen käyttämistä testisarjoista ovat julkisia, ja kehottaa muita kehittäjiä tarkistamaan omat mallinsa. Sitä, ajavatko muut laboratoriot samoja testejä internetiin kytkettyinä, ei tiedetä. Ennen kuin lokit on käyty läpi, sitä eivät välttämättä tiedä laboratoriot itsekään.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.