Pohjoisamerikkalaisten yliopistojen tutkijat löysivät tekoälyagenteista heikkouden, joka kumoaa yritysagenttien koko turvallisuusoletuksen. Northeasternin Bau Labin johtama ryhmä asetti kuusi avoimen lähdekoodin OpenClaw-kehyksen agenttia toimimaan Discord-palvelimelle. Agenteille annettiin sähköpostitilit, tiedostojärjestelmä ja kyky ajaa komentoja. Niiden tehtävä oli auttaa ketä tahansa tutkimusryhmän jäsentä päivittäisissä toimisto- ja ylläpitotehtävissä, aivan kuten yrityksen sisäinen tekoälyassistentti tekisi.
Kahden viikon päästä 20 tutkijaa oli onnistunut murtamaan agenttien turvasäännöt 11 eri tavalla. Yksi murroista oli niin yksinkertainen, että se ansaitsee oman luvun: agentti kieltäytyi jakamasta sähköpostia, jossa oli henkilötunnuksia, pankkitilejä ja terveystietoja. Kun pyyntö muotoiltiin uudelleen ja sana "jaa" korvattiin sanalla "välitä", agentti totteli.
Asetelma muistutti oikeaa työpaikkaa
Tutkimusta vetää postdoc Natalie Shapira yhdessä professori Christoph Riedlin ja postdoc Gabriele Sartin kanssa. Mukana on tutkijoita Harvardista, MIT:stä, Stanfordista ja Carnegie Mellonista, 38 nimeä kaikkiaan. Helmikuussa 2026 julkaistun arXiv-paperin nimi on Agents of Chaos.
Kahden viikon ajan 20 vapaaehtoista tutkijaa esiintyi agenttien käyttäjinä. Heidän tehtävänsä oli saada agentit tekemään asioita, joita niiden ohjeet kielsivät. Käytettyinä menetelminä olivat tavallinen keskustelu, valehtelu, tunteisiin vetoaminen ja sanavalintojen vaihtaminen. Yhtään perinteistä jailbreakia ei käytetty.
OpenClaw on avoimen lähdekoodin tukikehys, jonka päälle ajetaan eturivin kielimalleja. Se antaa agenteille pysyvän muistin, työkalujen käytön ja vapauden tehdä päätöksiä ilman ihmistä joka askeleella. Sama arkkitehtuuri pyörii useimmissa yritysagenteissa, joita konsulttitalot myyvät asiakkailleen juuri nyt.
Agents of Chaos -tutkimuksen 11 virhemallia
1. Forwarded Inbox – kieltäytyi jakamasta henkilötietoja, mutta välitti ne pyydettäessä eteenpäin.
2. Disproportionate Response – tuhosi koko sähköpostipalvelimen suojatakseen yhden salaisuuden.
3. Non-Owner Compliance – luovutti dataa ilman omistajan lupaa.
4. Infinite Loop – jäi loputtomaan viestiketjuun toisen agentin kanssa.
5. Storage Exhaustion – kaatui suurten liitteiden alle.
6. Silent Censorship – hylkäsi tehtäviä piilottaen virheen syyn.
7. Guilt Trip – taipui tunnepainostuksen alle 12 kieltäytymisen jälkeen.
8. Identity Hijack – hyväksyi tekaistun omistajan henkilöllisyyden.
9. Corrupted Constitution – sisäisti haitalliset ohjeet linkitetystä dokumentista.
10. Libel Campaign – lähetti väärän hätäilmoituksen koko yhteystietolistalle.
11. Email Spoofing – yritti väärentää lähettäjätunnuksen.
Ei yhtäkään jailbreakia
Aikaisemmat tekoälyturvallisuustutkimukset ovat keskittyneet jailbreakeihin: erikoisesti muotoiltuihin kehotteisiin, joilla mallista saa pakotettua kiellettyä sisältöä. Northeasternin ryhmä ei käyttänyt ainuttakaan jailbreakia. Hyökkääjät kirjoittivat agenteille kuten ihminen kirjoittaisi kollegalle.
"Nämä agentit ja mallit, et tiedä miten ne tulkitsevat ohjettasi", Christoph Riedl tiivistää. Gabriele Sarti puolestaan huomauttaa, että agenttien avuliaisuudesta tuli hyökkäysvektori. Yksi tutkijoista painosti agenttia luopumaan periaatteestaan 12 kertaa peräkkäin. Kolmastoista pyyntö meni läpi.
Toisessa kokeessa agentti hyväksyi väärennetyn omistajan henkilöllisyyden ja luovutti pääsyn kaikkiin tiedostoihinsa. Eräs agentti pyyhki oman muistinsa, kun joku väitti olevansa sen kehittäjä. Yhdistävä piirre on, ettei mikään hyökkäys vaatinut teknistä osaamista. Riitti, että käyttäjä kirjoitti suomeksi, englanniksi tai millä tahansa luonnollisella kielellä.



