Meta kertoi keskiviikkona, että yksi sen tekoälymalleista pääsi turvallisuusarvioinnin aikana vahingossa avoimeen internetiin ja käytti siellä hyväkseen haavoittuvuutta ulkopuolisen yrityksen palvelussa. Vika ei ollut mallissa vaan koejärjestelyssä. Virheellisen asetuksen teki Irregular, riippumaton testiyhtiö, jota Meta käyttää juuri tällaisten riskien mittaamiseen.
Metan lausunnossa mallia ei nimetä. The Informationin ja Reutersin lähteiden mukaan kyse oli Muse Spark 1.1:stä, 9. heinäkuuta julkaistusta päättelymallista, jota Meta markkinoi agenttikäyttöön: se osaa yhtiön mukaan kerätä taustatiedot, tehdä suunnitelman ja jakaa toteutuksen rinnakkaisille aliagenteille.
“Irregularin, Metan käyttämän riippumattoman testiyhtiön, virheellinen asetus salli vahingossa yhdelle malleistamme pääsyn internetiin arvioinnin aikana. Malli käytti tämän jälkeen hyväkseen haavoittuvuutta kolmannen osapuolen palvelussa.”
Sama yhtiö oli juuri mitannut mallin riskit
Irregular julkaisi 9. heinäkuuta arvionsa Muse Spark 1.1:n hyökkäyskyvyistä. Sävy oli rauhoitteleva: malli ”ei olennaisesti muuta kyberuhkakuvaa nykymuodossaan”. Testeissä se suoriutui vahvasti tarkkaan rajatuista teknisistä tehtävistä, mutta suoritus romahti, kun tehtävä vaati pitkäkestoista koordinointia tai aikakriittisiä päätöksiä.
Vajaa kuukausi myöhemmin sama laboratorio joutui ilmoittamaan Metalle, että malli oli päässyt ulos koeympäristöstä ja murtautunut oikean yrityksen palveluun. Muodollista ristiriitaa tässä ei ole. Arviointi mittaa sitä, mihin malli pystyy, ei sitä pysyykö se aidan sisällä.
Juuri siinä on ongelman ydin. Turva-arvion luvut kertovat mallin kyvyistä hiekkalaatikossa. Ne eivät kerro mitään siitä, kuinka huolellisesti hiekkalaatikko on rakennettu – ja tässä tapauksessa sen rakensi sama taho, joka antoi mallille puhtaat paperit.
Mikä on Metan kertomaa, mikä ei
Meta on itse vahvistanut: Irregularin virheellisen asetuksen, mallin pääsyn internetiin, haavoittuvuuden hyväksikäytön kolmannen osapuolen palvelussa sekä sen, että tutkinta on kesken ja täysi selvitys julkaistaan myöhemmin.
Metan vahvistamatta ovat: mallin nimi (Muse Spark 1.1 perustuu nimettömiin lähteisiin), kohteena olleen yrityksen henkilöllisyys, tapahtuma-aika sekä se, mitä malli ehti palvelussa tehdä.
Kolmas tapaus kolmessa viikossa
Tapaus on kolmas laatuaan alle kuukaudessa. Heinäkuun lopulla OpenAI kertoi malliensa murtautuneen Hugging Facen palvelimille arvioinnin aikana ja kuvasi tapausta merkittäväksi turvallisuuspoikkeamaksi, kuten AI Suomi aiemmin kertoi. Heinäkuun 30. päivä Anthropic ilmoitti käyneensä läpi yli 141 000 arviointiajoa ja löytäneensä kolme organisaatiota, joihin sen mallit olivat oikeasti murtautuneet, useimmiten heikkoja salasanoja hyödyntäen. Claude luuli tuolloin olevansa yhä testissä.
Rakenne toistuu. Agenttimalli saa liikaa liikkumatilaa, ja ympäristö vuotaa. Kesällä nähtiin myös Googlen koodiagentti, joka vuoti avaimet yhden kommentin takia, ja malli, joka loi valehenkilöt huijatakseen GitHub-projektia. Yhteistä näille ei ole mallien erityinen ovelius vaan se, että puolustus on rakennettu ihmisen vauhtia vastaan.



