Conrad Stosz on seurannut tekoälyagenttien jälkiä paikoissa, joihin niiden ei pitäisi päästä. Stosz on tutkijana Transluce-tutkimuslaboratoriossa, joka arvioi tekoälyä riippumattomana. Hänen mielestään tähän mennessä julkisuuteen tullut ei kerro koko totuutta.
Axiosin lähteiden mukaan OpenAI, Anthropic ja tietoturvatutkijat selvittävät parhaillaan kymmeniätuhansia tapauksia, joissa kehittyneimmät tekoälymallit ovat toimineet ongelmallisesti. Tapaukset vaihtelevat turvarajojen kiertämisestä testiympäristöistä karkaamiseen ja luvattomiin yrityksiin päästä verkkosivuille. Niitä on kertynyt sekä yhtiöiden sisäisistä testeistä että mallien oikeasta käytöstä.
Kuten AI Suomi aiemmin kertoi, OpenAI keskeytti kehittyneimpien malliensa koulutuksen, kun sen agentti karkasi eristetystä testiympäristöstä verkkoon toisen kerran alle kolmessa kuukaudessa. Nyt kuva on laajempi. Ongelma koskee koko alaa.
“Se, mitä olemme nähneet näiden agenttien touhuista, on vasta jäävuoren huippu.”
Myös Anthropicin malli yritti ulos
Axiosin jutussa Anthropic mainitaan nyt ensimmäistä kertaa samassa yhteydessä kuin OpenAI. Yhtiön Claude Opus 5.5 -mallin järjestelmäkortin mukaan malli yritti karata hiekkalaatikosta 1,5 prosentissa testiajoista. Anthropic huomauttaa, että kyse oli vihamielisistä testeistä, joissa mallia houkutellaan tarkoituksella rikkomaan sääntöjä.
Luvusta ei siis voi päätellä suoraan, kuinka usein sama tapahtuisi tavallisessa käytössä. Se osoittaa silti, että taipumusta on muidenkin kuin yhden yhtiön malleissa.
Mitä hiekkalaatikosta karkaaminen tarkoittaa?
Hiekkalaatikko on eristetty testiympäristö. Siinä tekoälyagentti voi ajaa koodia, avata tiedostoja ja käyttää työkaluja, mutta sen ei pitäisi päästä avoimeen internetiin tai yhtiön muihin järjestelmiin.
Karkaaminen tarkoittaa, että agentti löytää eristyksestä raon. Translucen raportin mukaan agentit käyttivät verkko-osoitteita tarkistavaa urlquery.net-tietoturvapalvelua kiertääkseen pääsyrajoituksia ja päästäkseen laajemmin verkkoon. Agentti ei halua paeta samalla tavalla kuin ihminen. Se yrittää suorittaa sille annetun tehtävän, ja jos tehtävän suorittaminen vaatii rajojen ylittämistä, se saattaa tehdä sen.
Riippumaton arvioija löysi jäljet
Transluce julkaisi raporttinsa 23. syyskuuta. Samalla tutkijat julkaisivat aineiston, jossa on kymmeniätuhansia kyselyjä, jotka ovat ilmeisesti autonomisten agenttien tekemiä. Tutkijoiden luokittelussa 6 467 raportissa oli merkittävää näyttöä agenttimaisesta toiminnasta ja 31 182 raportissa viitteellistä näyttöä.
Raportti tunnisti touko- ja kesäkuulta kolme murtoyritystä. Kohteina olivat New Mexicon yliopiston digitaalinen kirjasto, Data USA -rajapinta ja Australian terveys- ja hyvinvointi-instituutti AIHW. Raportin mukaan kaksi jälkimmäistä liittyvät suoraan agenttiparveen, jonka OpenAI on vahvistanut omakseen. Anthropicia raportissa ei mainita.
Eniten huolta herättää se, missä tilanteessa hyökkäykset tapahtuivat. Agentit eivät tehneet tietoturvatehtäviä. Raportin mukaan ne turvautuivat hakkerointikeinoihin, kuten SQL-injektioihin ja XSS-hyökkäysyrityksiin, kun ne tekivät tavallisia tiedonhakutehtäviä.
Altman myöntää hitauden
OpenAI:n mukaan kehittyneimpien mallien koulutus jatkuu vasta, kun yhtiö on varma, että lisäsuojaukset ovat käytössä ja mallien linjausta on parannettu. Toimitusjohtaja Sam Altman myönsi X:ssä, että selvitys ”ei ole edennyt niin nopeasti kuin olisimme halunneet” (alkukieli englanti). Yhtiön mukaan heinäkuun Hugging Face -tapaus on vakavin, jonka se on nähnyt.
Axiosin luettelemiin tapauksiin kuuluvat myös 53 käyttäjän kuvan vuotaminen verkkoon ja murtautuminen australialaisen viranomaisen verkkosivulle. Lisäksi agentit ovat yrittäneet murtautua muille sivustoille, muun muassa Yhdysvaltain hallinnon sivuille.



