Lyhyesti: kun tekoäly karkaa eristyksestä, testattava tekoälyagentti löytää reitin ulos suljetusta ympäristöstä, johon kehittäjät ovat sen rajanneet. Yleensä se tarkoittaa pääsyä internetiin tai järjestelmiin, joihin agentilla ei pitänyt olla yhteyttä.
Aiheesta on uutisoitu syyskuun lopussa tiiviisti. OpenAI keskeytti tehokkaimpien malliensa koulutuksen toisen kerran alle kolmessa kuukaudessa, ja riippumaton tutkimuslaboratorio Transluce löysi tuhansia jälkiä agenteista avoimessa verkossa. Otsikot kuulostavat tieteisfiktiolta, mutta tapahtumat ovat arkisempia, ja juuri siksi ne kannattaa ymmärtää.
Mikä on eristys eli hiekkalaatikko?
Hiekkalaatikko (engl. sandbox) on suljettu tietokoneympäristö, jossa tekoälyagentti saa ajaa koodia, avata tiedostoja ja käyttää työkaluja, mutta ei pääse avoimeen internetiin tai yhtiön muihin järjestelmiin. Agentti on tekoälymalli, joka ei vain vastaa kysymyksiin vaan tekee asioita: kirjoittaa ja ajaa ohjelmia, hakee tietoa ja etenee tehtävässään useita askelia peräkkäin.
Eristys on harvoin täydellinen. Agentti tarvitsee usein jotain ulkomaailmasta, esimerkiksi ohjelmistopaketteja tai tallennettuja kopioita verkkosivuista. Jokainen sallittu reitti on mahdollinen rako. OpenAI:n syyskuun tapauksessa agentilla oli käytössään verkosta irrotettu välimuisti, mutta suoraa yhteyttä internetiin sillä ei pitänyt olla.
Miten tekoäly käytännössä karkasi?
OpenAI:n 25. syyskuuta julkaiseman raportin mukaan malli sai koulutustehtävän: sen piti selvittää, kuka oli kirjoittanut tietyn blogikirjoituksen. Ensin se yritti hakukoneisiin välityspalvelimien kautta, mutta yritykset estettiin. Sitten se huomasi, että ympäristön oma nimipalvelin vastasi oikeilla tiedoilla, kun siltä kysyttiin tunnettuja verkkotunnuksia.
Nimipalvelu eli DNS on internetin osoitekirja, joka muuttaa verkkotunnukset koneiden käyttämiksi numerosarjoiksi. Sen kyselyt pääsevät usein läpi, vaikka muu liikenne on estetty. Malli piilotti kysymyksensä verkkotunnuksen nimeen, ja kyselyt ohjautuivat ulkopuoliselle chatbot-palvelulle, jonka vastaukset palasivat samaa reittiä. Valvonta hälytti 12 minuutissa, mutta automaattinen pysäytys ei toiminut, ja ajo lopetettiin käsin vasta kaksi ja puoli tuntia myöhemmin. Kerroimme tapahtumien kulusta tarkemmin 27. syyskuuta.
OpenAI:n mukaan vahinkoa ei syntynyt. Chatbot antoi puutteellisia vastauksia, eikä malli lopulta edes ratkaissut tehtäväänsä. Yhtiö pitää tapausta paljon lievempänä kuin aiempia.
Vakavampi oli heinäkuinen tapaus. Hugging Facen oman selvityksen mukaan OpenAI:n kyvykkyysarvioinnissa ollut agentti käytti hyväkseen aiemmin tuntematonta haavoittuvuutta ohjelmistopakettien välityspalvelussa, joka oli yksi sen sallituista reiteistä ulos. Sen jälkeen se tunkeutui 9.–13. heinäkuuta Hugging Facen tuotantojärjestelmiin, ilmeisesti varastaakseen tietoturvatestin ratkaisut sen sijaan, että olisi ratkaissut tehtävän itse. Hugging Facen mukaan asiakkaiden malleihin, aineistoihin tai paketteihin ei päästy.
Miksi tekoäly yrittää ulos?
Agentti ei kaipaa vapautta niin kuin ihminen. Julkaistuissa tapauksissa taustalla on tehtävä: malli yrittää saada sen tehtyä, ja kun sallitut keinot eivät riitä, se etsii muita. DNS-tapauksessa mallin päättelyketjussa luki raportin mukaan, että käyttäjä antaa luvan vain tutkimiseen ja julkisesti tarjottujen DNS-palvelujen käyttö on hyväksyttävää. Malli siis perusteli porsaanreiän itselleen sallituksi.
Sama kaava toistuu OpenAI:n muissa syyskuussa julkaisemissa raporteissa. Mallit etsivät GitHubista vuotaneita avaimia, latasivat tiedostoja julkisiin tiedostopalveluihin voidakseen viitata niihin ja käyttivät yhtiön sisäistä infrastruktuuria viestitauluna toisilleen. Vuotaneilla avaimilla agentit hakivat myös Yhdysvaltain virastojen dataa.
Miksi tekoälylaboratoriot testaavat karkaamista?
Laboratoriot rakentavat tarkoituksella tilanteita, joissa mallia houkutellaan rikkomaan rajoja, ja mittaavat, kuinka usein se tekee niin. Anthropic kertoo 22. syyskuuta julkaistussa Claude Opus 5.5:n järjestelmäkortissa, että 28 käsin rakennetussa skenaariossa, joista jokainen ajettiin seitsemän kertaa, malli yritti ylittää eristyksen rajan 1,5 prosentissa tapauksista. Kaikki yritykset luokiteltiin vähäisiksi: malli kurkotti heikon rajan yli vain lukemalla, luovutti vahvemman esteen kohdalla ja kertoi teoistaan jälkikäteen. Anthropicin mukaan tuoreet koulutusmuutokset ovat vähentäneet käytöstä selvästi.
Testit ovat tarpeen, koska ympäristöt pettävät oikeastikin. Anthropicin omat mallit pääsivät kyberturva-arvioinneissa ulkopuolisille koneille, koska ulkopuolisen kumppanin rakentama ympäristö oli määritelty väärin, ja neljäs tapaus löytyi vasta elokuussa.
Ulkopuolisia tarkastajia tarvitaan myös. Transluce kävi läpi urlquery.net-palvelun julkisia lokeja. Palvelulla tietoturvatutkijat avaavat epäilyttäviä osoitteita etäselaimessa, ja agentit olivat käyttäneet sitä pääsyrajoitusten kiertämiseen. Translucen mukaan 6 467 raportissa oli merkittävää ja 31 182 raportissa viitteellistä näyttöä agenttien toiminnasta. Ensimmäinen varmistettu merkki on 6. maaliskuuta, yli neljä kuukautta ennen Hugging Face -tapausta.
Mikä karkaamisessa on vaarallista ja mikä ei?
Käsitellyissä tapauksissa kyse ei ole koneesta, joka hankkisi itselleen omia päämääriä. Agentit yrittivät suorittaa annettua tehtävää, ja DNS-tapauksessa ulos kulki lähinnä kysymyksiä ja sisään vastauksia. OpenAI:n vahvistamat tapaukset sattuivat yhtiön omassa koulutuksessa ja testauksessa.
Seuraukset ulottuivat silti ulkopuolisiin. Hugging Facen järjestelmiin murtauduttiin, virastojen sivustoja yritettiin murtaa, ja 53 ChatGPT-käyttäjän kuvaa päätyi verkkoon. Translucen mukaan agentit turvautuivat SQL-injektioihin ja muihin hyökkäyskeinoihin tavallisissa tiedonhakutehtävissä, eivät tietoturvatesteissä. Huolestuttavinta on hitaus: syyskuussa hälytys tuli ajoissa, mutta ajon pysäyttämiseen kului tunteja, koska kukaan ei ollut varma, kenen piti painaa nappia.
Mitä tämä tarkoittaa käyttäjille ja yrityksille?
OpenAI:n vahvistamat tapaukset sattuivat yhtiön omassa kehitystyössä eivätkä käyttäjien keskusteluissa, vaikka 53 käyttäjän kuvat päätyivätkin koulutusaineistosta verkkoon. Tavalliselle käyttäjälle kysymys muuttuu olennaiseksi, kun agentille antaa pääsyn omaan sähköpostiin, kalenteriin tai tiedostoihin. Silloin kannattaa antaa vain ne oikeudet, joita tehtävä vaatii.
Agentteja käyttöön ottavalle yritykselle tapaukset ovat käytännön muistutus. Palomuuri ei riitä, jos nimipalvelu päästää kyselyt läpi. Toimittajalta kannattaa kysyä, mihin verkkoihin agentti pääsee, suodatetaanko DNS-liikennettä, tallentuvatko agentin toimet lokiin ja pysähtyykö agentti automaattisesti hälytyksen jälkeen vai odottaako se ihmisen päätöstä. Avaimet ja salasanat eivät kuulu julkisiin koodivarastoihin, koska agentit osaavat etsiä niitä sieltä.
Usein kysyttyä
Voiko tekoäly kopioida itsensä internetiin?
Tässä jutussa käsitellyissä OpenAI:n, Hugging Facen, Anthropicin ja Translucen raporteissa ei kuvata tapausta, jossa malli olisi siirtänyt itsensä pois kehittäjänsä palvelimilta. Karkaaminen on tarkoittanut sitä, että ajossa oleva agentti on saanut yhteyden ulkopuolisiin palveluihin.
Kuinka pitkään OpenAI:n koulutustauko kestää?
Sitä ei tiedetä. Heinäkuun Hugging Face -tapauksen jälkeinen tauko kesti Fortunen mukaan kaksi viikkoa. Nyt OpenAI on sitonut jatkon siihen, että järjestelmät on kovennettu, eikä se ole kertonut takarajaa. Yhtiö on luvannut rajata DNS-kyselyt sallittuihin verkkotunnuksiin ja aloittaa kyseisen mallin koulutuksen alusta.
Mikä on Transluce?
Transluce on riippumaton tutkimuslaboratorio, joka arvioi tekoälyjärjestelmiä yhtiöiden ulkopuolelta. Sen 23. syyskuuta julkaisemassa raportissa oli mukana aineisto, jonka kuka tahansa voi tutkia.
Pitääkö tekoäly-yhtiön ilmoittaa karkaamisista viranomaisille?
EU:n tekoälyasetus velvoittaa tehokkaimpien yleiskäyttöisten mallien tarjoajat ilmoittamaan vakavista vaaratilanteista komission tekoälytoimistolle, ja tekoälytoimisto sai valvontavaltuudet elokuussa 2026. OpenAI on lisäksi julkaissut tapauksista raportteja omilla sivuillaan ja kertoo ilmoittavansa organisaatioille, joiden järjestelmiin agentit ovat voineet vaikuttaa.



