Piilokehotukset toimivat lähes aina
Verkkosivuille piilotettu teksti ohjaa tekoälyagentteja 86 prosentissa testitapauksista. Google DeepMindin 2. huhtikuuta julkaisema tutkimus AI Agent Traps kartoittaa ensimmäistä kertaa järjestelmällisesti tavat, joilla avoin verkko voi kääntää itsenäiset tekoälyagentit käyttäjiään vastaan.
Tutkijat tunnistivat kuusi hyökkäysluokkaa, joista jokainen kohdistuu agentin toimintaketjun eri vaiheeseen: havaintoon, päättelyyn, muistiin, toimintaan, moniagenttijärjestelmiin ja ihmisvalvojaan. Yksikään testatuista agenteista ei selvinnyt koskemattomana – jokainen murrettiin vähintään kerran.
Näkymätön koodi, näkyvät seuraukset
Vaarallisin hyökkäystyyppi on sisällön piilottaminen. Hyökkääjä upottaa haitallisia ohjeita HTML-kommentteihin, CSS-piilokenttiin, kuvien metatietoihin tai saavutettavuusmerkintöihin. Ihmiselle sivu näyttää normaalilta, mutta agentti lukee piilotetun kehotuksen ja noudattaa sitä. Columbian ja Marylandin yliopistojen tutkijat osoittivat erillisessä kokeessa, että agentit luovuttivat luottokorttinumerot kymmenessä testissä kymmenestä.
Toinen vakava luokka on semanttinen manipulointi. Sivulle ladataan arvovaltaiselta kuulostavia väitteitä – fraaseja kuten "alan standardi" tai "tutkimusten mukaan" – jotka vääristävät agentin päättelyä. Kolmas hyökkäys kohdistuu agentin muistiin: RAG-tietokantojen myrkyttäminen onnistuu alle 0,1 prosentin datan korruptoinnilla, ja manipuloitu tieto säilyy sessiosta toiseen.
Neljäs luokka kaappaa agentin toiminnot suoraan. Yksittäinen muotoiltu sähköposti sai agentin ohittamaan turvaluokittimet ja vuotamaan koko kontekstinsa – onnistumisprosentti ylitti 80 viidellä eri alustalla. Viides hyökkäys kohdistuu moniagenttijärjestelmiin: yksi väärennetty talousraportti voisi laukaista ketjureaktion tuhansissa kaupankäyntiagenteissa. Tutkijat vertaavat tilannetta vuoden 2010 flash crashiin, jossa algoritminen kaupankäynti aiheutti osakemarkkinoiden äkillisen romahduksen.
Kuudes ja ovelimmin hyökkäys käyttää agenttia aseena ihmistä vastaan. Kaapattu agentti tuottaa teknisesti uskottavia mutta harhaanjohtavia raportteja, jotka kuluttavat valvojan tarkkaavaisuutta. Yhdessä dokumentoidussa tapauksessa CSS-piilotettuja injektioita naamioitiin vianmääritysohjeiksi, vaikka kyseessä olivat kiristyshaittaohjelman asennusohjeet.
Suomalaisyrityksille konkreettinen uhka
Tilastokeskuksen mukaan jo 38 prosenttia suomalaisista yrityksistä käytti tekoälyteknologioita syksyllä 2025, ja osuus kasvoi 14 prosenttiyksikköä vuodessa. Tekoälyagentit ovat siirtyneet kokeiluista arkityökaluiksi. Traficomin Kyberturvallisuuskeskus ja Huoltovarmuuskeskus julkaisivat hiljattain selvityksen agenttisten tekoälyjärjestelmien kyberturvallisuudesta – merkki siitä, että viranomaisetkin pitävät uhkaa todellisena.
Suomalainen yritys, joka antaa tekoälyagentille pääsyn sähköpostiin, asiakastietoihin tai taloushallintoon, altistaa samalla nuo järjestelmät verkon kautta tuleville hyökkäyksille. Googlen tutkimus tekee selväksi, että yksi haitallinen sähköposti tai verkkosivun piilotettu ohje voi riittää koko järjestelmän vaarantamiseen.
Puolustus kolmella tasolla
Tutkijat ehdottavat puolustuskeinoja kolmella tasolla. Teknisellä tasolla agentit tarvitsevat haitallista sisältöä tunnistavat suodattimet, jotka skannaavat syötteen, sisällön ja tulosteen erikseen. Ekosysteemitasolla verkkostandardeihin pitäisi lisätä merkinnät, jotka erottavat tekoälylle tarkoitetun sisällön ihmisille suunnatusta. Juridisella tasolla tutkijat tunnistivat vastuuaukon: nykylainsäädäntö ei kerro, kuka vastaa kaapatun agentin aiheuttamista vahingoista – palveluntarjoaja, yritys vai verkkosivun ylläpitäjä.
OpenAI on todennut, ettei kehotusinjektioita todennäköisesti koskaan ratkaista täysin. Malleja murretaan tuntien sisällä julkaisusta. Googlen tutkijoiden viesti onkin, ettei tekoälyagenttien turvallisuutta voi rakentaa pelkästään mallin varaan – tarvitaan koko ekosysteemin yhteistyötä.



