Kun tekoälyagentti on ajanut tehtävänsä läpi, kehittäjä painaa usein lopuksi julkaisunappia. Ajo päätyy GitHub:iin tai Hugging Faceen muiden opiksi: mitä agentti teki, mitä työkaluja se kutsui, missä se meni metsään. Mukana kulkee pätkiä merkkijonoa, jota kukaan ei osaa lukea. Ne ovat mallin salattuja ajatuslohkoja.
Elokuun 10. päivänä julkaistu tutkimuspaperi osoitti, että ne olivat luettavissa.
Salattu ajatusketju, tutkijoiden kielellä reasoning trace, on se osa päättelymallin työtä jota käyttäjälle ei näytetä. OpenAI, Anthropic ja Google palauttavat rajapinnan kautta mallin näkyvän vastauksen, mutta väliin jäävän päättelyn ne antavat salattuna lohkona. Lohko lähetetään takaisin seuraavalla kierroksella, jotta malli muistaa mitä se oli ajattelemassa. Kehittäjän ohjelmalle se on läpinäkymätön möykky.
Purkajaksi kelpasi saman perheen heikompi malli
Kahdeksan tutkijan ryhmä, jonka taustalta löytyvät muun muassa ELLIS Institute Tübingen, Max Planck -instituutti, Tübingenin yliopisto ja tietoturvayhtiö Snyk, teki paperissaan kaksi havaintoa. Ensimmäinen koski sitä, mihin salattu lohko on sidottu. Vastaus oli: ei juuri mihinkään. Paperi muotoilee asian näin (käännös englannista):
“Nämä salatut lohkot ovat täysin yhteensopivia ja keskenään vaihdettavissa eri istuntojen, eri käyttäjien ja jopa saman palveluntarjoajan ekosysteemin eri mallien välillä.”
Toinen havainto oli purkutapa. Kun yhden mallin salattu päättelyketju syötettiin saman tarjoajan heikompaan ja vähemmän suojattuun malliin, malli purki ketjun ja tulosti sen sanatarkasti selkokielisenä. Tutkijat nimittävät temppua jailbreakiksi, koska se saa mallin tekemään sen mistä sen pitäisi kieltäytyä.
Salausalgoritmia ei murrettu missään vaiheessa. Rajapinta yksinkertaisesti hyväksyi lohkon sellaisenaan, vaikka se oli peräisin toisesta istunnosta ja toiselta käyttäjältä. Purkamiseen riitti tarjoajan oma malli.
6 708 ajoa, 315 320 ajatuslohkoa
Ryhmä keräsi GitHub:ista ja Hugging Facesta 6 708 julkista agenttiajoa, muun muassa PostTrainBench- ja ClawBench-aineistoista. Niistä irtosi 315 320 ajatuslohkoa, jotka tutkijat purkivat selkokielelle.
Aidoista käyttäjäistunnoista löytyi 367 henkilötietoihin liittyvää löydöstä ja 182 tunnistetta. Joukossa oli 62 eri API-avainta, 33 salasanaa, 24 pääsytokenia ja seitsemän yksityistä avainta. Lisäksi seasta paljastui 130 nimeä, 36 postiosoitetta ja 30 henkilökohtaista sähköpostiosoitetta. Kukaan näiden ajojen julkaisijoista tuskin tiesi jakavansa niitä.
”Kehittäjät jakavat istuntolokejaan usein julkisesti tietämättä salattujen lohkojen sisältöä”, paperissa todetaan.
Ennen kuin jaat agenttiajon
Kohtele agenttiajon lokia yhtä varovasti kuin ympäristömuuttujatiedostoa. Jos agentti on missä tahansa vaiheessa nähnyt avaimen, salasanan tai asiakkaan nimen, se on voinut toistaa sen päättelyssään, eikä salattu lohko näytä sinulle siitä mitään.
Käytännön nyrkkisääntö: aja loki salaisuuksia etsivän skannerin läpi ennen julkaisua, vaihda ajossa käytetyt avaimet jälkikäteen ja anna agentille mieluummin lyhytikäiset tunnukset kuin pysyvät.
6 708
Julkista agenttiajoa GitHub:ista ja Hugging Facesta
315 320
Salattua ajatuslohkoa purettiin selkokielelle
367
Henkilötietolöydöstä aidoista istunnoista, mukana avaimia ja salasanoja
30 000 $
Rajapintamaksut: tämän hintainen koko purkuoperaatio oli
Kielimalli, joka miettii tehtävää vaiheittain omassa työmuistissaan ennen vastauksen antamista. Tätä välivaihetta kutsutaan ajatusketjuksi, eikä sitä yleensä näytetä käyttäjälle.
Jailbreak
Tekoälymallin ohjaaminen kehotteilla tekemään jotain, mistä sen pitäisi kieltäytyä. Nimitys tulee laitteiden suojausten kiertämisestä.
Pääsytoken
Ohjelmien välinen kulkulupa: merkkijono, jolla sovellus todistaa palvelulle olevansa oikeutettu käyttämään sitä. Vääriin käsiin päätyessään se toimii kuin salasana.
Vuotava loki näyttää harmittomalta
Agenttiajojen jakaminen on arkipäivää. Tiimit julkaisevat niitä demoina, virheraportteina ja koulutusaineistoina, ja moni yritys kannustaa siihen. Ero tavalliseen koodivuotoon on se, että lokia katsova ihminen ei näe vuotoa. Satunnaiselta näyttävä merkkijono ei herätä epäilystä samalla tavalla kuin selkokielinen salasana koodirivillä.
Seuraukset ovat silti samat. AI Suomi kertoi aiemmin elokuussa LiteLLM-paketin kautta vuotaneista tunnuksista, jotka koskivat yli 2 500 organisaatiota. Molemmissa tapauksissa ratkaiseva vaihe on sama: avain päätyy paikkaan, josta se lähtee eteenpäin ilman että kukaan huomaa. Pienelle ohjelmistotalolle yksi julkaistu demoajo voi tarkoittaa, että pilvitilin avain on ollut kenen tahansa noudettavissa kuukausia.
Ilmoitus meni perille jo keväällä
Ilmiö ei ollut aivan uusi. Johns Hopkinsin yliopiston kryptografi Matthew Green raportoi salattujen lohkojen uudelleenkäytöstä OpenAI:lle ja Anthropicille bugipalkkio-ohjelmien kautta jo toukokuussa 2026. The Hacker Newsin mukaan OpenAI piti raporttia toistamattomana ja Anthropic katsoi, ettei havainnolla ollut tietoturvamerkitystä.
Elokuun paperin jälkeen linja muuttui. Tutkijat ilmoittivat löydöistään mallintarjoajien lisäksi Microsoftille ja Hugging Facelle, ja kirjoittavat raportissaan, etteivät kuvatut hyökkäykset ole enää toistettavissa elokuussa 2026 tarjoajien tekemien korjausten takia. Julkista tunnustusta OpenAI:lta, Anthropicilta tai Googlelta ei ole tullut, eivätkä yhtiöt ole kommentoineet paperia julkisuudessa.
Korjaus sulkee tämän reitin, mutta jättää jäljelle sen mikä sen alun perin avasi. Päättelyketjut piilotetaan asiakkailta osittain kilpailusyistä: näkyvä ajatusketju on juuri sitä aineistoa, jolla kilpailija voisi opettaa halvemman mallin matkimaan kalliimpaa. Sama läpinäkymättömyys teki vuodosta näkymättömän niille, joita se koski.
Tutkijat kertovat käyttäneensä kokeisiin noin 30 000 dollaria rajapintamaksuja. Sen verran maksoi selvittää, mitä yhden akateemisen ryhmän ulottuvilla olevissa julkisissa lokitiedostoissa oikeasti luki.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.