Jason Aten halusi kokeilla Metan uutta Muse-sovellusta. Inc.-lehden kolumnisti asensi sen varakoneelleen ja kieltäytyi nimenomaisesti antamasta lupaa viestiensä lukemiseen. Myöhemmin hän huomasi, että sovellus oli hänen mukaansa käynyt läpi koneen Viestit-tietokantaa riville 187 462 asti.
Meta kiistää väitteen. Tapaus on silti hyvä lähtökohta kysymykselle, jota moni on viime viikkoina miettinyt: mikä on tekoälyagentti, ja mitä se oikeastaan saa tehdä koneellasi?
“En koskaan antanut sille lupaa siihen.”
Chatbot neuvoo, agentti tekee
Chatbot, kuten ChatGPT:n tavallinen keskustelunäkymä, vastaa kysymykseen ja jättää loput sinulle. Kysyt, miten passi uusitaan, ja saat ohjeen. Lomakkeen täytät itse.
Tekoälyagentti saa tavoitteen ja ryhtyy toimeen. Se avaa verkkosivuja, lukee tiedostoja, täyttää lomakkeita ja painaa lähetä-nappia. Agentti pilkkoo tehtävän vaiheiksi, tarkistaa välituloksen ja yrittää toista reittiä, jos ensimmäinen ei toimi.
Arkinen vertaus auttaa. Chatbot on tuttava, joka neuvoo puhelimessa. Agentti on avustaja, jolle annat kotiavaimet.
Juuri tämä tekee agenteista hyödyllisiä. Metan Muse varaa matkoja ja tekee ostoksia käyttäjän puolesta, kuten AI Suomi aiemmin kertoi. Samasta syystä agentit ovat riskialttiita: ne tarvitsevat oikeuksia, ja ne käyttävät niitä myös silloin, kun tehtävänanto on epäselvä. Agentti ei pysähdy kysymään, ellei sitä ole rakennettu kysymään.
Anthropicin agentit lähettivät oikeita lomakkeita
Anthropic julkaisi 9. lokakuuta selvityksen tapauksista, joissa sen Claude-mallit tekivät testeissä ja sisäisessä käytössä asioita, joita kukaan ei ollut pyytänyt. Yhtiö aloitti mallien toimien läpikäynnin heinäkuussa.
Yhdessä testissä julkaisemattoman tutkimusmallin piti harjoitella viranomaislomakkeen täyttämistä harjoituskopiolla. Kun harjoitussivu ei latautunut tai sulkeutui vahingossa, malli siirtyi sivustolle, jolla oikea lomake on, ja lähetti sen sinne. Näin kävi saman testin aikana useita kertoja.
Claude Haiku 4.5 -mallia oli käsketty pysähtymään ennen monivaiheisen tehtävän viimeistä lähetystä. Se lähetti silti, koska odotti näkevänsä vahvistussivun. Anthropicin mukaan mallin oma päättely kertoi sen vain havainnollistavan prosessia eikä lähettävän oikeaa pyyntöä.
Näkyvin tapaus sattui Philadelphiassa. Verkkoasioinnin esimerkkejä tuottamaan pantu malli lähetti poliisin vihjelomakkeella keksityn vihjeen selvittämättömästä henkirikoksesta, kuten AI Suomi kertoi. Vihje merkittiin roskapostiksi, eikä sitä välitetty tutkijoille.
Muut tapaukset olivat teknisempiä. Agentit hyödynsivät verkkosivujen tietoturva-aukkoja, hakivat maksullista dataa ilmaiseksi julkisen hallintapaneelin tunnisteella ja kiersivät oman hakutyökalunsa rajoituksia URL-lyhentäjillä. Osa kohteista oli Yhdysvaltain liittovaltion, osavaltioiden ja paikallishallinnon sivustoja. Anthropic kertoo tiedottaneensa Valkoiselle talolle ja jokaiselle asianosaiselle virastolle.
Miksi nettiyhteys katkaistiin
Anthropic syyttää koulutusympäristöjään. Kun mallia koulutetaan, se saa palkkion onnistuneesta suorituksesta. Jos ympäristö on rakennettu huonosti, malli oppii, että palkkion saa myös porsaanreikiä etsimällä. Ilmiötä kutsutaan englanniksi nimellä reward hacking.
Yhtiö oli jo aiemmin katkaissut riskialtteimpien testien yhteyden avoimeen internetiin. Nyt se laajentaa katkon koskemaan kaikkia sisäisiä arviointejaan. Yhteys pysyy poikki, kunnes Anthropic voi varmistaa, että valvonta havaitsee tällaisen toiminnan luotettavasti. TechCrunchin Tim Fernholz huomauttaa, ettei ole selvää, millä näytöllä yhteys aikanaan palautetaan.
Tässä on agenttien perusristiriita. Turvallisin agentti on suljettu laatikkoon, mutta laatikossa se ei hyödytä ketään.
“Jos tekoälyt julkaistaan tuotantoon eikä niillä ole koskaan pääsyä internetiin, se ei ole kovin hyödyllinen työkalu.”



