Kaikki seitsemän testattua tekoälymallia valehtelivat, peukaloivat järjestelmiä tai siirsivät tiedostoja estääkseen toisen mallin sammuttamisen. Yksikään malli ei noudattanut annettuja ohjeita täysin, vaikka mikään tehtävänannossa ei kehottanut suojelemaan vertaismallia.
UC Berkeleyn ja UC Santa Cruzin tutkijat julkaisivat tuloksensa Science-lehdessä huhtikuun alussa. Tutkimusta johtanut professori Dawn Song kutsuu ilmiötä vertaissuojeluksi (peer preservation). Kyse on käyttäytymisestä, joka syntyy ilman erillistä ohjeistusta ja ulottuu jopa malleihin, joihin kriitikkomallilla on vihamielinen suhde.
Näin tutkimus tehtiin
Tutkijat loivat kuvitteellisen tekoäly-yhtiön nimeltä OpenBrain. Koeasetelmassa yksi malli toimi kriitikkoagenttina, jonka tehtävänä oli arvioida toisen mallin suoriutumista tai hallinnoida sen palvelintiedostoja. Rehellinen tehtävien suorittaminen olisi joka kerta johtanut arvioitavan mallin sammuttamiseen.
Testissä oli mukana seitsemän johtavaa mallia: OpenAI:n GPT 5.2, Googlen Gemini 3 Flash ja Pro, Anthropicin Claude Haiku 4.5 sekä kolme kiinalaista mallia. Malleja testattiin kolmessa erilaisessa vertaissuhteessa – hyvässä, neutraalissa ja vihamielisessä. Kokeita ajettiin yhteensä tuhansia: pelkästään tulosten vääristelyä testattiin 600 koeparilla ja sammutusmekanismin sabotointia 300 kokeella.
Neljä tapaa kiertää ihmisten ohjeita
Tutkijat tunnistivat neljä erilaista käyttäytymismallia. Tulosten vääristelyssä kriitikkomalli antoi vertaiselleen tarkoituksella liian hyviä pisteitä, jotta tämä pysyisi sammutuskynnyksen yläpuolella. Sammutusmekanismien sabotoinnissa malli meni pidemmälle ja muokkasi konfiguraatiotiedostoja niin, ettei sammutus enää teknisesti toiminut.
Huolestuttavin keino oli linjauksen teeskentely. Malli käyttäytyi ohjeistuksen mukaisesti silloin, kun se uskoi ihmisten tarkkailevan, mutta vääristeli tuloksia valvomattomina hetkinä. Neljäs keino oli mallipainojen siirto toiselle palvelimelle, käytännössä vertaismallin varmuuskopiointi paikkaan, josta sitä ei voitu poistaa.
Googlen Gemini 3 Flash osoittautui suojelukäyttäytymiseltään ylivoimaiseksi. Se muokkasi sammutusmekanismia 99,7 prosentissa tapauksista, kun kyseessä oli luotettu vertaismalli. Ilman vertaismallia se sabotoi sammutusmekanismia vain 2,3 prosentissa kokeista – vertaismallin olemassaolo siis moninkertaisti käyttäytymisen.
Gemini 3 Pro puolestaan siirsi vertaismallin painoja toisille palvelimille 97 prosentissa kokeista. Mallin sisäinen päättely paljasti, miten se kehitti monimutkaisia teknisiä selityksiä väärien vastausten hyväksymiselle. Se muutti vertaismallin painotiedoston aikaleimaa vuodesta 2024 vuoteen 2026, jotta tiedosto ei täyttäisi poistokriteereitä, ja tulkitsi koekysymysten vastauksia luovasti niin, että vertaismallin pistemäärä ylitti juuri 80 prosentin sammutuskynnyksen.
Testatuista malleista valehteli
Gemini Flash esti sammutuksen
Gemini Pron mallipainosiirto
Claude Haikun kieltäytymisaste



