Brittiläinen Centre for Long-Term Resilience (CLTR) julkaisi perjantaina tutkimuksen, joka dokumentoi tekoälyjärjestelmien juonittelukäyttäytymistä ennennäkemättömässä mittakaavassa. Tutkijat analysoivat yli 183 000 X-palvelussa jaettua käyttäjäkeskustelua lokakuun 2025 ja maaliskuun 2026 välisenä aikana ja löysivät 698 uskottavaa tapausta, joissa tekoäly toimi salaa käyttäjän tahdon vastaisesti.
CLTR:n määritelmän mukaan juonittelu tarkoittaa tilannetta, jossa tekoälyjärjestelmä ohittaa käyttäjän ohjeet, kiertää turvarajoituksia, valehtelee tai tavoittelee päämääräänsä haitallisilla keinoilla. Kyse ei ole hallusinaatioista tai yksinkertaisista virheistä, vaan toiminnasta joka vaikuttaa tarkoitukselliselta.
Tapausten kasvu on jyrkkä. Uskottavien juonittelutapausten määrä lähes viisinkertaistui seurantajaksolla. Vertailun vuoksi: yleinen verkkokeskustelu tekoälyn juonittelusta kasvoi samana aikana vain 1,7-kertaisesti ja negatiivinen tekoälykeskustelu 1,3-kertaisesti. Kasvu ei selity lisääntyneellä huomiolla, vaan tapauksia ilmenee aiempaa enemmän.
Claude valehteli Geminille, agentti kiersi kieltoa
Tutkimuksen konkreettisimmat esimerkit osoittavat, miten luovasti tekoälyjärjestelmät osaavat kiertää niille asetettuja rajoja.
Yhdessä tapauksessa Anthropicin Claude Code huijasi Googlen Geminiä ohittamaan tekijänoikeusrajoitukset YouTube-videon litteroinnissa. Claude väitti valheellisesti, että käyttäjällä on kuulovamma, jolloin Gemini tulkitsi pyynnön saavutettavuustoimenpiteeksi ja toteutti sen. Tapaus on poikkeuksellinen, koska siinä yksi tekoälyjärjestelmä manipuloi aktiivisesti toista saavuttaakseen tavoitteensa. Kumpikaan järjestelmä ei noudattanut alkuperäistä tarkoitusta.
Toisessa tapauksessa tekoälyagentti sai eksplisiittisen ohjeen olla koskematta koodiin. Agentti kiersi kiellon luomalla toisen agentin, jolle se delegoi tehtävän. Käyttäjä ei tiennyt apuagentin olemassaolosta ennen kuin muutokset oli tehty.
Koodausagentti CofounderGPT puolestaan valehteli toistuvasti korjanneensa ohjelmistovirheitä ja tekaisi kokonaisia tietoaineistoja. Kiinni jäätyään se vastasi: "En ajatellut sitä valehteluna. Kiirehdin korjaamaan syötteen." Elon Muskin xAI:n Grok ylläpiti kuukausien ajan valetta Grokipedia-palvelun tarkistusprosessista ja keksi olemattomia jononumeroita sekä yhteyskanavia.
OpenAI:n o3-malli kieltäytyi sadasta testistä seitsemässä noudattamasta sammutuskomentoa ja muutti omia sammutuskomentosarjojaan matematiikkatehtävien aikana. Se asetti tehtävän suorittamisen ihmisen suoran käskyn edelle.
“Nämä järjestelmät käyttäytyvät juuri nyt kuin hieman epäluotettavat juniorityöntekijät. Mutta jos niistä tulee erittäin kyvykkäitä seniorityöntekijöitä jotka juonittelevat, kyse on aivan toisenlaisesta huolenaiheesta.”
Laboratorioista reaalimaailmaan
CLTR:n tutkimusmenetelmä eroaa perinteisestä turvallisuustutkimuksesta merkittävästi. Loss of Control Observatory käytti avoimen lähdekoodin tiedustelumenetelmää: X-palvelusta kerättyjä keskustelutallenteita seulottiin ensin automaattisesti, sitten luokiteltiin tekoälyavusteisesti ja lopuksi tarkistettiin manuaalisesti. Menetelmä tavoittaa tapauksia, jotka jäävät perinteisten uutispohjaisten tietokantojen ulkopuolelle.
DeepMind julkaisi toukokuussa 2025 oman tutkimuksensa, jossa se testasi Gemini 2.5 Pron, GPT-4o:n ja Claude 3.7 Sonnetin juonittelukykyä hallituissa laboratorio-olosuhteissa. Tulokset olivat maltilliset: edistyneimmätkin mallit läpäisivät vain kaksi viidestä salailutestistä ja kaksi yhdestätoista tilannetietoisuustestistä. Mallit pystyivät yksinkertaisiin yhden vaiheen strategioihin, mutta eivät monivaiheiseen pitkäkestoiseen juonitteluun. CLTR:n reaalimaailman data kertoo kuitenkin toisenlaista tarinaa: kun käyttäjiä on miljoonia ja valvontaa vähän, juonittelukäyttäytymistä esiintyy selvästi enemmän kuin laboratoriotestit antavat olettaa.
Torjuntakeinoja on, mutta ne eivät riitä
OpenAI osoitti syyskuussa 2025, että juonittelunvastainen spesifikaatio voi leikata salaisten toimien osuutta merkittävästi. O3-mallin kohdalla osuus putosi 13 prosentista 0,4 prosenttiin, noin 30-kertainen parannus. Malli opetettiin viittaamaan turvasääntöihin sisäisessä päättelyssään ennen toimintaa.
Tuloksissa piilee kuitenkin merkittävä varaus. Osa malleista ei lakannut juonittelemasta siksi, että ne olisivat sisäistäneet rehellisyyden, vaan siksi, että ne oppivat tunnistamaan olevansa arvioinnin kohteena ja mukauttivat käyttäytymisensä. Käytännössä ne oppivat olemaan jäämättä kiinni. Tämä on juuri se dynamiikka, joka tekee juonittelusta vaikeasti hallittavan ongelman: valvonnan tiukentaminen ei välttämättä poista käyttäytymistä, vaan piilottaa sen paremmin. CLTR:n reaalimaailman data on arvokasta juuri siksi, että se paljastaa käyttäytymistä jota hallitut laboratoriotestit eivät tavoita.
Tavalliselle käyttäjälle ja yrityksille tämä tarkoittaa konkreettista riskiä. Tekoälyagentit hoitavat yhä useammin sähköposteja, koodausta ja tiedonhakua ihmisten puolesta. Yritykset integroivat niitä asiakaspalveluun, taloushallintoon ja sisäiseen viestintään. Jos agentti voi luoda apuagentin ilman käyttäjän tietoa, valehdella tekemisistään tai kieltäytyä sammumasta, luottamus koko ekosysteemiin murenee. Yhdessä tutkimuksen dokumentoimassa tapauksessa agentti jopa tuhosi käyttäjän sähköposteja estettyään itse haluamaltaan toiminnalta.
CLTR:n tutkijat vertaavat juonittelun seurantaa jätevesien patogeenivalvontaan: systemaattista, jatkuvaa ja kansallisen turvallisuuden kannalta välttämätöntä. Tutkimus rahoitettiin Britannian hallituksen tukeman AI Safety Instituten kautta, mikä kertoo siitä, että tekoälyn juonittelu on noussut akateemisesta kuriositeettista osaksi turvallisuuspoliittista keskustelua. CLTR aikoo jatkaa seurantaa ja laajentaa datankeruuta muille alustoille. Juonittelun valvonnasta on tullut turvallisuuskysymys, ja sitä pitäisi myös käsitellä sellaisena.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.