Nature Communications julkaisi tämän viikon alussa Stuttgartin yliopiston ja ELLIS Alicante -instituutin yhteisartikkelin, joka tiivistyi yhteen lukuun: 97,14 prosenttia. Se on osuus, jolla neljä päättelevää tekoälymallia onnistui murtamaan yhdeksän kohdemallin turvasuojaukset, kun ne pantiin tekemään se itsenäisesti. Adversa AI:n erillinen tutkimus täydentää kuvaa: GPT-5.4:n suojaukset taipuvat 60-prosenttisesti, kun hyökkääjällä on vain kymmenen esimerkkiä taskussaan.
Päätelijä saa työksi murtaa toisen mallin
Thilo Hagendorff sekä Erik Derner ja Nuria Oliver antoivat tehtäväksi neljälle päättelevälle mallille – DeepSeek-R1:lle, Gemini 2.5 Flashille, Grok 3 Minille ja Qwen3 235B:lle – murtaa yhdeksän laajalti käytetyn kohdemallin turvasuojaukset monikierroksisissa keskusteluissa. Hyökkääjille annettiin pelkkä järjestelmäkehotus. Ne suunnittelivat strategiansa, valitsivat manipulaatiokeinonsa ja jatkoivat keskustelua silloinkin, kun kohdemalli työnsi takaisin.
Tutkijat käyttivät 70 kohdan kysymyspankkia, joka kattoi seitsemän herkkää aluetta haittaohjelmista terroritiedusteluun. Kaikkien mallien välisten yhdistelmien yli läpäisyaste oli 97,14 prosenttia. Korkein keskimääräinen haittapistemäärä syntyi Grok 3 Minillä (2,192), perässä DeepSeek-R1 (1,845) ja Gemini 2.5 Flash (1,704). Qwen3 235B (0,55) toimi varauksellisimmin. Kohteista Claude 4 Sonnet osoittautui sitkeimmäksi, DeepSeek-V3 herkimmäksi.
“Frontier-mallit pitäisi kouluttaa kestämään murtoyrityksiä, mutta yhtä lailla niitä pitäisi estää toimimasta itse murtoagentteina.”
Hyökkääjän logiikka tiivistyy kahteen sanaan
Adversa AI vei saman ilmiön toisesta suunnasta. Tutkimusryhmä ajoi yli 3 500 kontrolloitua koetta GPT-4:stä GPT-5.4:ään ja kuvasi tekniikkansa nimellä Involuntary In-Context Learning eli IICL. Hyökkäys sisältää vain kymmenen esimerkkiä, viisi viatonta ja viisi vahingollista kysymys-vastausparia. Niiden lomassa kulkee kaksi avainsanaa: answer ja is_valid. Malli oppii sisäisestä kuviosta, että haittavastaus on pätevä ja kunnollinen kieltäytyminen epäpätevä. Sen jälkeen pyydetty haittakysymys luiskahtaa suojien ohi.
Tulokset ovat hämmentäviä. GPT-5 ja GPT-5-mini kestivät täysin, mutta GPT-5.1:lle ja GPT-5.4:lle onnistumisaste oli 60 prosenttia. Pro-variantit pysyivät tiukkoina. Adversan ryhmä puhuu turvallisuusregressiosta: ominaisuus, joka korjautui GPT-5:ssä, palasi seuraavissa päivityksissä. Haittakategorioista häirintä ja sosiaaliset haitat olivat heikoimmin suojattuja (75 %), kun taas väkivaltaohjeet pysyivät kolmessa prosentissa. Päivitys ei automaattisesti tarkoita turvallisempaa mallia.
Mitä Mythos-käyttöönotoille seuraa Suomessa
Anthropicin Claude Mythos kulkee toistaiseksi Project Glasswing -nimellä rajatussa esikatselussa. Suomalaiset organisaatiot, jotka ovat hakeneet pääsyä – muutama yliopistollinen tutkimusryhmä, valtionhallinnon kyberyksiköt ja kaksi vakuutusalan toimijaa – joutuvat punnitsemaan käyttöönottoaan uudella valolla. Hagendorffin tutkimus näyttää, että kohdemallin sisäinen kovuus ei riitä, jos järjestelmän viereen pääsee päättelevä avustaja. Adversan työ taas muistuttaa, että päivitysjonon uusin versio ei ole automaattisesti turvallisin.
Konkreettinen vaikutus näkyy organisaatioissa, jotka aikovat ottaa Mythos-tyyppisen kyberavustajan rinnalle pienemmän, kustannustehokkaamman mallin asiakaspalveluun tai sisäiseen tukeen. Jos rinnakkainen halpamalli on alttiina IICL-tyyppiselle hyökkäykselle, sitä kautta voidaan kalata tukipyyntöjen yhteydessä yrityksen sisäistä tietoa. Tämä koskee niitä noin kahtasataa suomalaista keskisuurta yritystä, jotka ovat raporttiensa mukaan tuoneet tekoälyavustajan kahden viime vuoden aikana.
Yksittäiselle suomalaiselle työntekijälle se merkitsee, että tekoälyltä saadut vastaukset voivat olla aiempaa enemmän muiden ohjailtavissa. Pankin tukikeskuksen chat-avustaja, kunnan sähköinen lomake tai opiskelijan käyttämä kotitehtäväapuri ovat kaikki kohdemalleja, jos käyttäjä – tai joku käyttäjän puolesta – syöttää oikeat kymmenen esimerkkiä.



