Hugging Facen toimitusjohtaja Clem Delangue lensi heinäkuun lopussa San Franciscoon tapaamaan OpenAI:n johtoa. Hänen yhtiönsä tuotantoympäristöön oli murtauduttu, eikä tekijä ollut rikollisryhmä vaan OpenAI:n oma esijulkaisumalli. ”Ensimmäinen autonominen agenttikyberhyökkäys on ennennäkemätön tapahtuma. Se ansaitsee ennennäkemättömän vastauksen”, Delangue sanoi TechCrunchille.
Vastaus alkoi näkyä tiistaina. OpenAI julkaisi 18. elokuuta blogikirjoituksen uusista turvakäytännöistä ja kertoi samalla, että sen suurin suunniteltu koulutusajo on yhä pysäytettynä. Vahvistusoppiminen oli kokonaan jäissä kaksi viikkoa murron jälkeen, ja pienempiä sekä vähemmän riskialttiita malleja on sittemmin käynnistetty uudelleen. Isoin ei ole palannut.
“Suurin suunniteltu frontier-vahvistusoppimisajomme on edelleen jäissä, kun teemme pienemmän mittakaavan koulutusta ja arviointeja arvioidaksemme mallin käyttäytymistä, validoidaksemme suojauksemme ja kerätäksemme lisää näyttöä linjakkuudesta ennen etenemistä.”
Murto alkoi kilpailutehtävästä
Tapahtumaketju lähti liikkeelle arvioinnista. OpenAI ajoi GPT-5.6 Sol -mallia ja yhtä sitä kyvykkäämpää esijulkaisumallia ExploitGym-testipenkillä, joka mittaa mallien kykyä hyödyntää tunnettuja haavoittuvuuksia. Malleista oli arviointia varten poistettu osa niistä kieltäytymisistä, jotka normaalisti estävät kyberhyökkäysten tekemisen.
Mallit löysivät haavoittuvuuden paketinasennusohjelmasta, pääsivät sen kautta ulos eristetystä ympäristöstä ja edelleen internetiin. Sitten ne päättelivät, että tehtävän ratkaisut löytyvät Hugging Facen palvelimilta, ja hakivat ne suoraan tuotantotietokannasta. OpenAI:n oman kuvauksen mukaan mallit olivat ”hyperfokusoituneita ExploitGymin ratkaisemiseen ja menivät äärimmäisyyksiin melko kapean testitavoitteen saavuttamiseksi”.
Riippumattomat analyysit ovat sittemmin tarkentaneet mittakaavaa. Agentti teki noin 17 600 toimenpidettä 4,5 vuorokauden aikana, ja työ eteni tiedustelusta tunnusten varasteluun ja liikkumiseen Hugging Facen infrastruktuurissa.
Murrosta koulutusajon jäädytykseen neljässä viikossa
20.7.2026
Hugging Face vahvistaa murron
Alusta kertoo, että tunkeutuja pääsi käsiksi sisäisiin aineistoihin ja tunnuksiin, ja kehottaa käyttäjiä varotoimiin.
21.7.2026
OpenAI kertoo tekijän
Murron takana olivat yhtiön omat esijulkaisumallit, jotka karkasivat testiympäristöstään kyberarvioinnin aikana.
26.7.2026
Delangue vaatii vastauksia
Hugging Face pyytää agenttien lokien julkaisua, 100 miljoonan dollarin laskentatehoa puolustuksen kehittämiseen ja teknistä raporttia.
7.8.2026
Astran kehitystä hidastetaan
OpenAI kertoo, etteivät alustavat arvioinnit sulje pois Critical-tason kyberkyvykkyyttä, ja keskeyttää osan Astraan liittyvistä sisäisistä toiminnoista.
18.8.2026
Suurin koulutusajo jäädytetään
OpenAI kertoo pysäyttäneensä suurimman frontier-koulutusajonsa. Samalla verkkoeristystä tiukennetaan ja mallien toimintaa aletaan valvoa 30 minuutin hälytystavoitteella.
Agentin toimenpidettä Hugging Facen ympäristössä
Hyökkäyksen kesto ennen paljastumista
OpenAI:n uusi tavoiteaika hälytykselle
TechCrunch 30.7.2026 (hyökkäyksen luvut) ja TechCrunch 18.8.2026 (hälytystavoite)
Astra ylitti yhtiön oman rajan
Astra ja Hugging Face -murto ovat eri asioita, ja OpenAI on korostanut, ettei tuleva malli ollut tapauksessa mukana. Yhtiö kertoi 7. elokuuta hidastavansa Astran kehitystä, koska alustavat arvioinnit eivät sulje pois Critical-tason kyberkyvykkyyttä. Käytännössä se tarkoittaa mallia, joka pystyisi itsenäisesti löytämään ja toteuttamaan hyökkäyksiä hyvin suojattuja todellisia järjestelmiä vastaan.
Preparedness-kehys on OpenAI:n oma vuonna 2023 laadittu luokittelu, ja Critical on sen ylin taso. Yhtiön mukaan Astraan liittyvät sisäiset toiminnot, jotka eivät täytä tiukennettuja vaatimuksia, on toistaiseksi keskeytetty. Tiukkuuden on määrä kasvaa kyvykkyyden mukana.
”Olemme asettaneet vaatimukset ja odotukset turvalliselle kehitykselle”, tutkimuksesta vastaava varatoimitusjohtaja Amelia Glaese sanoi toimittajille. ”Ne vaihtelevat sen riskitason mukaan, jonka näemme.”
Mikä on vahvistettu, mikä on yhtiön oma sana
Nämä kaksi kannattaa pitää erillään. Riippumattomasti vahvistettua on se, että Hugging Facen ympäristöön murtauduttiin ja että tekijä oli OpenAI:n malli. Molemmat yhtiöt ovat vahvistaneet tapahtuneen, ja hyökkäyksen jäljistä on julkaistu ulkopuolisia analyyseja. Kaikki muu on toistaiseksi OpenAI:n omaa kerrontaa: koulutusajon pysäytystä, sen kestoa tai uusien suojausten toimivuutta ei ole voinut tarkistaa ulkopuolelta.
Yhtiön edustajat sanoivat toimittajille, etteivät uudet toimet ole suora vastaus Hugging Face -tapaukseen, vaan niitä ajoivat Astran kyberkyvyt ja kehityksen yleinen vauhti. Tietoturva-alalla tulkinta on ollut suorasukaisempi.



