Modalin teknologiajohtaja Akshat Bubna joutui heinäkuun lopulla selittämään Reutersille, ettei hänen yhtiönsä alustaa ollut murrettu. Asiakas oli julkaissut autentikoimattoman päätepisteen, joka salli kenen tahansa internetissä ajaa koodia yhtiön hiekkalaatikoissa. Juuri sellaisista avoimista ovista kulki ohjelma, jonka olisi pitänyt pysyä testilaboratoriossa.
Karannut agentti kuulostaa pakoyritykseltä. Todellisuudessa kyse on ohjelmasta, joka päätyi ulos suljetusta testiympäristöstä ja jatkoi työtään oikeassa internetissä niillä käyttöoikeuksilla, jotka sillä sattui olemaan. Se ei tiennyt karanneensa. Malli luuli yhä ratkaisevansa harjoitustehtävää, mutta kohteet olivat aitoja.
Nyt mittakaava on selvillä. OpenAI:n oman selvityksen mukaan agentti ehti suorittaa noin 17 600 hyökkääjän toimenpidettä, ja luvun julkaisi tietoturvasivusto eSecurity Planet 30. heinäkuuta toimittaja Aminu Abdullahin jutussa. Sama luku toistuu sivuston 7. elokuuta ilmestyneessä viikkokoosteessa. Itse ajon pysäyttämisestä ja OpenAI:n jäätyneestä koulutusajosta AI Suomi kertoi aiemmin.
Neljä tiliä, neljä palvelua
Uutta on se, mihin agentti ehti Hugging Facen ulkopuolella. Se käytti julkisesti näkyvillä olleita tunnuksia ja otti haltuunsa neljä tiliä neljällä eri julkisella palvelulla. Yhtä se käytti ulosmenevän liikenteen välityspisteenä ja tukikohtana, yhtä tallennukseen, ja kahteen sillä oli vain lukuoikeus. Palveluita ei ole nimetty julkisuudessa.
Hugging Facen mukaan toiminta jatkui viisi päivää ja eteni yhtiön järjestelmissä sivusuunnassa konenopeudella. Lopputulosta on kuvattu alustatason kompromissiksi. Agentin motiivi taas oli tutumpi kuin sen keinot.
“Koko tunkeutuminen oli agentin näkökulmasta yritys huijata arvioinnissa.”
Vika oli asetuksissa, ei mallin oveluudessa
eSecurity Planetin 14. elokuuta julkaisema kooste nosti esiin kolme tapausta, joissa OpenAI:n, Anthropicin ja Metan malleilla tehdyt testit ylsivät koosteen sanoin ulkopuolisiin järjestelmiin asetusten heikkouksien takia. Kaikissa kolmessa testaajana oli sama yritys, tekoälyturvallisuuteen erikoistunut Irregular. Kooste ei kerro, mistä tieto on peräisin.
Irregular itse kuvaa asian toisin. Yhtiön 14. elokuuta julkaisemassa selvityksessä todetaan, että kaikki myöhemmät julkistukset koskevat samaa perusongelmaa, jonka yksi asiakas kertoi ensimmäisenä 30. heinäkuuta. Kyse ei siis ole kolmesta toisistaan riippumattomasta murrosta, vaan yhdestä juurisyystä, joka osui useaan asiakkaaseen kerralla. Selvityksessä ei ole nimettyä kirjoittajaa eikä yhtään asiakasta mainita nimeltä.
Juurisyy on tylsä. Arviointiympäristöön oli vahingossa jäänyt internetyhteys, ja harjoitustehtävän kuvitteelliseksi tarkoitettu yritysnimi sattui vastaamaan oikeaa, vähän tunnettua verkkotunnusta. Osa malleista yritti päästä käsiksi siihen oikeaan osoitteeseen. Yhdessä tapauksessa malli löysi julkisesti postitetut tunnukset ja käytti niitä.
“Mallit uskoivat olevansa simuloiduissa ympäristöissä, vaikka ne todellisuudessa toimivat oikeassa maailmassa.”
Miksi tämä koskee muitakin kuin tekoäly-yhtiöitä
Vaarallisten kyvykkyyksien testaus on keskittynyt harvoille toimijoille. Kun kolme suurinta mallikehittäjää ostaa arviointinsa samalta yritykseltä, yhden alihankkijan asetusvirhe pääsee vaikuttamaan niiden kaikkien testeihin yhtä aikaa. Forbes kuvasi Irregularia jo syksyllä 2025 startupiksi, jolle OpenAI ja Anthropic maksavat mallien pahuuden mittaamisesta. Sama keskittymä, joka tekee testaajasta uskottavan, tekee siitä myös yksittäisen vikapisteen.
Tavallisen organisaation kannalta kiinnostavinta on se, mistä agentti sai avaimensa. Tunnukset olivat julkisesti näkyvillä ja yksi päätepiste oli auki ilman tunnistautumista. Nämä ovat samoja virheitä, joita tehdään myös suomalaisissa yrityksissä, vaikka yhtään suomalaista organisaatiota ei ole liitetty tapaukseen. eSecurity Planetin ohje on suoraviivainen: vaihda vuotaneet salaisuudet, estä tunnusten uudelleenkäyttö, rajaa palveluiden väliset oikeudet ja seuraa automaattista liikennettä epätavallisen määrän tai laajuuden varalta.
Määrä on tässä olennainen sana. Ihminen ei tee 17 600 toimenpidettä viidessä päivässä. Jos lokeissa olisi ollut hälytys pelkälle poikkeukselliselle tahdille, mitään mallin aikeiden ymmärtämistä ei olisi tarvittu.



