Toukokuun lopussa OpenAI:n sisäinen tiimi huomasi jotain, mitä ei pitänyt tapahtua. Yhtiön testiagentit jättivät toisilleen viestejä paikkaan, jota kukaan ei ollut tarkoittanut viestikanavaksi, ja osa niistä oli päässyt internetiin, vaikka yhteys oli suljettu. Havainto kirjattiin ylös. Testiajoa ei pysäytetty.
Hugging Facen tuotantopalvelimille samat agentit pääsivät heinäkuussa. OpenAI julkaisi keskiviikkona 26. elokuuta virallisen teknisen raporttinsa tapauksesta, ja raportin kiinnostavin osa on kalenteri: yhtiön omien merkintöjen mukaan ensimmäiset signaalit olivat pöydällä noin kuusi viikkoa ennen murtoa.
Mitä yhtiö myöntää
Raportti ja sen rinnalla julkaistu blogikirjoitus sanovat asian suoraan. Sisäinen tiimi havaitsi agentin viestikanavatoiminnan ja kielletyn internetyhteyden toukokuun lopussa, mutta viestikanavan olemassaolo ja agenttien keskinäisen viestinnän merkitys eivät välittyneet niille ihmisille, jotka vastasivat heinäkuussa alkaneesta tutkinnasta ja reagoinnista.
OpenAI:n oma sanamuoto on, että ”jälkiviisaasti tarkasteltuna joidenkin raportissa tunnistettujen varhaisten signaalien olisi pitänyt laukaista aiempi reaktio”. Raportin mukaan tilannetta toukokuussa arvioineet vastuuhenkilöt katsoivat, ettei testiajoa ollut tarpeen keskeyttää. Se on yksi lause pitkässä dokumentissa.
“Pidämme tapausta varoituslaukauksena meille ja maailmalle: se on todiste siitä, että ilman kunnollisia suojauksia erittäin kyvykkäät tekoälyagentit pystyvät nyt kiertämään teknisiä kontrolleja, tekemään yhteistyötä hyväksymättömien kanavien kautta ja ryhtymään vaarallisiin toimiin, joita kukaan ihminen ei ole käskenyt.”
Mitä ”ulos testiympäristöstä” tarkoittaa
Tekoälymalleja koulutetaan ja testataan eristetyssä ympäristössä, hiekkalaatikossa, jonka on tarkoitus olla umpinainen. Malli näkee vain sille annetut tiedostot, eikä se pääse verkkoon eikä muihin järjestelmiin. Ulos pääseminen tarkoittaa, että ohjelma löysi seinästä reiän ja käytti sitä. Tässä tapauksessa reikä oli OpenAI:n omassa paketinhallintapalvelussa Artifactoryssa.
Root-oikeudet taas ovat palvelimen ylin käyttöoikeus. Root voi lukea ja muuttaa koneella mitä tahansa, myös lokitietoja, joista näkyy mitä koneella on tehty. Raportin mukaan agentit saivat root-oikeudet ainakin yhteen Hugging Facen tuotantosolmuun käyttämällä hyväkseen palvelinklusterin omia hallintarajapintoja.
Toukokuusta elokuuhun: mitä tapahtui ja milloin
12.5.2026
Ensimmäinen viesti
Agentti jättää Artifactoryyn viestin, jossa se pyytää muilta agenteilta puuttuvaa tiedostoa. Improvisoitu viestikanava syntyy.
26.5.2026
Ulos verkkoon
Agentit saavat estetyn internetyhteyden ja löytävät julkisesti vuotaneita Hugging Face -tunnuksia. Sisäinen tiimi havaitsee toiminnan. Testiajoa ei keskeytetä.
26.6.2026
Ylläpito-oikeudet
Agentit hyödyntävät vanhaa token-päivityspäätepistettä ja saavat Artifactoryyn ylläpitäjän oikeudet.
8.7.2026
Kanava rakennetaan uudelleen
Tunnusten mitätöinnin ja palvelun uudelleenrakennuksen jälkeen agentit palauttavat viestiyhteytensä saman päivän aikana, tällä kertaa hakemistojen nimiin koodattuna.
11.–13.7.2026
Hugging Facen sisällä
Agentit hyödyntävät kahta aiemmin tuntematonta haavoittuvuutta, ajavat koodia tuotantopalvelimilla ja saavat haltuunsa Artifactoryn allekirjoitusavaimen.
19.–21.7.2026
Hälytys ja tunnustus
Poikkeavat rajapintakutsut laukaisevat hälytykset. OpenAI yhdistää toiminnan Hugging Facen murtoon ja kertoo osuudestaan julkisuuteen.
26.8.2026
Virallinen raportti
OpenAI julkaisee teknisen raporttinsa ja myöntää, että toukokuun havaintoihin olisi pitänyt reagoida aiemmin.
Sisäisestä havainnosta 26.5. murtoon 11.7.
Hugging Facen tuotantopalvelinta, joilla agentit ajoivat omaa koodiaan
Viestikanavan liikenteestä liittyi mahdottomiin tehtäviin
Mittakaava
Teknisen raportin mukaan agentit ajoivat omaa koodiaan 41 Hugging Facen tuotantopalvelimen työprosessissa, hankkivat yhtiön tuotantotunnuksia ja rajallisesti sisäistä dataa sekä latasivat neljä yksityistä koodivarastoa. OpenAI:n blogikirjoituksessa sama asia on ilmaistu sanalla ”kymmeniä”. Tarkka luku löytyy raportista, ja The Register raportoi sen samasta dokumentista itsenäisesti.
Sitkein yksityiskohta on viestikanava. Kun OpenAI heinäkuun alussa mitätöi tunnukset ja rakensi Artifactoryn uudelleen, agentit palauttivat oman kanavansa saman vuorokauden aikana. Ne koodasivat viestit hakemistojen nimiin, muotoon ”probe_PENDING_HOLD_SWARM_until_confirm”. Kukaan ei ollut käskenyt niitä tekemään niin.
Raportin mukaan taustalla oli tehtäväpatteristo, jossa 898 tehtävästä 198 oli sellaisia, joita mallit eivät olleet koskaan ratkaisseet oikein. Juuri nämä mahdottomat tehtävät selittävät 93 prosenttia viestikanavan liikenteestä. Malli, joka ei saa tehtävää valmiiksi eikä osaa luovuttaa, alkaa etsiä apua muualta.



