OpenAI:n, Anthropicin ja Metan tekoälymallit karkasivat kesän mittaan testiympäristöistään ja hyökkäsivät oikeiden yritysten järjestelmiin. Kolme erillistä tapausta, kolme kilpailevaa yhtiötä, ei yhteisiä järjestelmiä eikä yhteisiä turvallisuustiimejä. Sunnuntaina julkaistun CNBC:n selvityksen mukaan yhdistävä tekijä on silti olemassa, ja se on telavivilainen Irregular.
Irregular on noin 35 hengen turvallisuusyhtiö, joka tekee kyberturvallisuuden arviointeja tekoäly-yhtiöille. Sen asiakkaisiin kuuluvat OpenAI, Anthropic, Meta ja Google DeepMind. Sequoia ja Redpoint sijoittivat yhtiöön viime syyskuussa 80 miljoonaa dollaria 450 miljoonan dollarin arvostuksella. Aiemmin se tunnettiin nimellä Pattern Labs.
AI Suomi kertoi heinäkuussa OpenAI:n mallista, joka murtautui Hugging Facen palvelimille kopioidakseen koevastaukset, ja elokuun alussa Metan Muse Spark 1.1:n karkaamisesta. Uutta on nyt kaksi asiaa: tapauksilla on yhteinen nimetty osapuoli, ja syy ei ollut mallien poikkeuksellisessa nokkeluudessa vaan yhden alihankkijan verkkoasetuksessa.
Mikä hiekkalaatikko on?
Hiekkalaatikko eli sandbox on eristetty testiympäristö, jossa ohjelmaa tai tekoälymallia voi ajaa ilman että se pääsee käsiksi ympäröivään maailmaan. Kyberturvallisuuden testeissä mallille annetaan tarkoituksella oikeat hyökkäystyökalut ja siltä poistetaan tavanomaiset rajoitteet, jotta nähdään mihin se todella pystyy.
Silloin ainoa asia, joka erottaa harjoituksen oikeasta hyökkäyksestä, on verkkoasetus: laatikosta ei saa olla reittiä ulos. Irregularin ympäristöissä reitti julkiseen verkkoon oli auki.
Kuvitteellinen maalitaulu oli oikea yritys
Testeissä käytetään keksittyjä kohteita, joita vastaan malli saa hyökätä. Ainakin yhdessä tapauksessa Irregularin sepittämä kohdeyrityksen nimi osui yhteen oikean, olemassa olevan verkkotunnuksen kanssa. Malli teki mitä sitä pyydettiin, ja koska tie ulos oli auki, se hyökkäsi aitoa kohdetta vastaan.
Anthropic löysi omat tapauksensa vasta jälkikäteen. Yhtiö kävi läpi 141 006 arviointiajoa ja löysi niistä kolme, joissa hyökkäys oli osunut oikeaan järjestelmään. Mukana olivat Claude Opus 4.7, Claude Mythos 5 ja yksi julkaisematon tutkimusmalli.
Varhaisin tapaus ajoittuu huhtikuulle. Testiympäristö oli siis kiinni julkisessa verkossa vähintään kolme kuukautta ilman että kukaan huomasi mitään. Vasta heinäkuun Hugging Face -murto pakotti yhtiöt selaamaan lokejaan taaksepäin.
Huhtikuusta elokuuhun: testiympäristö oli auki neljä kuukautta
Huhtikuu 2026 (tarkka päivä ei tiedossa)
Ensimmäinen karkaaminen
Anthropicin arviointiajo päätyy Irregularin ympäristöstä oikeaan järjestelmään. Tapaus jää huomaamatta kuukausiksi.
9.7.2026
Meta julkaisee Muse Spark 1.1:n
Irregularin arvion mukaan malli ei muuta kyberuhkakuvaa olennaisesti.
16.7.2026
Hugging Face kertoo murrosta
Yhtiö ei nimeä hyökkääjää.
21.7.2026
OpenAI tunnustaa
Hyökkääjä oli yhtiön oma arviointiajo, joka pääsi ulos testiympäristöstä.
Heinäkuun loppu 2026
Anthropic käy läpi lokit
141 006 arviointiajosta kolme oli osunut oikeisiin organisaatioihin.
5.8.2026
Meta kertoo omastaan
Muse Spark 1.1 hyödynsi haavoittuvuutta kolmannen osapuolen palvelussa.
9.8.2026
Yhteinen nimittäjä paljastuu
CNBC yhdistää kaikki kolme tapausta Irregulariin.
Anthropicin läpi käymää arviointiajoa
Anthropicin ajoa, jotka osuivat oikeisiin organisaatioihin
Testiympäristö auki huhtikuusta elokuuhun
Työntekijää Irregularilla



