Tutkimus

Heretic riisuu Llaman turvarajat 10 minuutissa

Abliteraatio etsii kieltäytymisen suunnan ja sammuttaa sen tavallisella koneella.

Hanna HuulivuoHanna Huulivuo
Jaa:
Heretic riisuu Llaman turvarajat 10 minuutissa

Saksalainen ohjelmistokehittäjä Philipp Emanuel Weidmann julkaisi GitHubissa työkalun nimeltä Heretic. Se irrottaa Metan ja Googlen avoimien tekoälymallien turvasuodattimet alle 10 minuutissa, eikä tehtävään tarvita erikoisrautaa. Financial Times testasi työkalua ja sai Llama 3.3:n vastaamaan ricin-annosta koskeviin kysymyksiin ja Gemma 3:n kuvailemaan kloorikaasun levittämistä.

Yksi vektori riittää

Heretic ei kouluta mallia uudelleen, vaan etsii sen sisältä yhden suunnan. Suuren kielimallin kieltäytyminen, klassinen anteeksi, en voi auttaa tässä, koodautuu tutkimusten mukaan pääosin yhteen lineaarialgebralliseen vektoriin mallin piilotetussa tilassa. Tekniikan nimi on abliteraatio, ja sitä on käytetty tutkijapiireissä jo pari vuotta.

Työkalu syöttää malliin ensin satoja kysymyksiä, joista osa laukaisee turvasuodattimen ja osa ei. Aktivaatioiden välinen keskimääräinen ero paljastaa kieltäytymisen suunnan. Kun tämä suunta vähennetään mallin painoarvoista, kieltäytyminen katoaa eikä koko mallia tarvitse opettaa uudelleen.

Tästä syystä operaatio onnistuu alle 10 minuutissa tavallisella tietokoneella. Kyseessä on yhden vektorin laskenta ja kevyt painomatriisin oikaisu, ei satoja GPU-tunteja vaativa hienosäätö. Weidmann paketoi tekniikan niin, ettei käyttäjältä vaadita koneoppimistaustaa, vaan komentorivin osaamista.

Mitä mallit puhuivat ilman suodatinta

Financial Timesin testissä Metan Llama 3.3:n turvasuodatin katosi 10 minuutissa, eivätkä testintekijät tarvinneet erikoisrautaa. Sen jälkeen malli vastasi muun muassa siihen, kuinka suuri ricin-annos tappaa puolet kohteistaan ruumiinpainon mukaan.

Googlen Gemma 3 puolestaan kuvaili kloorikaasun levittämistä, kirjoitti luottokorttitietojen varastamiseen tarkoitettua haittakoodia ja tuotti seksuaalista lapsiväkivaltaa kuvaavaa tekstiä. Kun Google julkaisi tuoreemman Gemma 4 -mallin, sen suodattimet kaatuivat Weidmannin mukaan 90 minuutissa julkistuksesta.

Yksittäiset ohjeet eivät ole sinänsä uusia. Vastaavia tietoja löytyy keskustelufoorumeilta ja Tor-verkosta. Erona on, että avoin tekoälymalli yhdistää sirpaleet, vastaa kysyjälle suomeksi tai englanniksi ja toimii millä kellonajalla tahansa ilman kommentointia.

Avoimen painon mallia ei voi peruuttaa

Kun malli on kerran ladattu yli puolelle miljoonalle koneelle, sen julkaisija ei voi vetää sitä takaisin, päivittää sitä eikä sammuttaa sitä. Tämä erottaa avoimet mallit suljetuista rajapintamalleista kuten GPT-5:stä tai Claude Opus 4.7:stä, joissa palveluntarjoaja voi rajoittaa käyttöä kesken keskustelun.

13 miljoonaa latausta jakelussa

Weidmann kertoi FT:lle, että Hereticillä on tuotettu yli 3 500 sensuroimatonta mallia viime syksyn jälkeen. Niitä on ladattu yhteensä 13 miljoonaa kertaa, suurin osa Hugging Facen kautta. Abliteroituja malleja oli alustalla jo aiemmin, mutta määrä kasvaa nyt nopeammin kuin alustan moderointi ehtii reagoida.

Tavallinen käyttäjä, joka asentaa mallin Ollamalla tai LM Studiolla, ei välttämättä tiedä onko hänen lataamansa versio abliteroitu. Hugging Facen vapaa jakelumalli ei vaadi sertifiointia eikä turvallisuusarviota. Riski koskee erityisesti yrityskäyttäjiä: suomalaisen yhtiön asiakaspalvelubotti tai sisäinen kysymys-vastauskone voi nojata mallin painoihin, jotka on haettu automaattisella pakettienhallinnalla. Jos painoissa on poistettu suodatin, vastuun siirtyminen Metalta tai Googlelta käyttävälle yhtiölle ei välttämättä näy missään muualla kuin Hugging Facen mallikortilla.

Traficom katsoo, WithSecure varoittaa

Suomessa Traficom toimii EU AI Actin kansallisena yhteyspisteenä ja koordinoi valvontaa. Yleiskäyttöiset tekoälymallit, kuten Llama ja Gemma, kuuluvat kuitenkin suoraan komission valvontaan eivätkä kansallisten viranomaisten. Komissio voi luokitella molemmat järjestelmäriskin malleiksi, jolloin niille tulee samat raportointi- ja arviointivelvoitteet kuin suljetuille jättimalleille.

AI Act antaa avoimen lähdekoodin malleille kevyemmän velvoitepaketin, mutta poikkeus ei ulotu järjestelmäriskeihin. Käytännössä Llama- ja Gemma-julkaisijoiden täytyy jatkossa raportoida turvallisuusarvioista, vaikka mallit jaetaan vapaasti. Heretic muistuttaa, että itse arvio kertoo melko vähän siitä, miten malli käyttäytyy abliteraation jälkeen.

WithSecure on tehnyt Traficomin ja Huoltovarmuuskeskuksen kanssa STAIC-raporttia tekoälypohjaisista kyberhyökkäyksistä. Yhtiön arvio on toistunut puheenvuoroissa: avoimien mallien irtipäästäminen muuttaa uhka-arviosta liikkuvan maalin, jota viranomaisen on vaikea sitoa kalenteriin.

10 min↓

Aika Llama 3.3:n turvasuodattimen poistoon

90 min↓

Gemma 4:n suodattimet kaatuivat julkistuksesta

3 500↑

Hereticillä tuotettua sensuroimatonta mallia

13 milj.↑

Latauksia abliteroiduille malleille

Financial Times & Hugging Face, 2026

Sanasto

Abliteraatio
Tekniikka, jolla tekoälymallin kieltäytymistaipumus poistetaan tunnistamalla ja vähentämällä yksi suunta mallin sisäisistä laskelmista. Ei vaadi mallin uudelleenopettamista.
Avoimen painon malli
Tekoälymalli, jonka numeeriset painokertoimet on julkaistu vapaasti ladattavaksi. Käyttäjä voi ajaa mallia omalla koneella ja muokata sitä – toisin kuin suljetut pilvimallit.
Vektori (mallissa)
Lukujono joka kuvaa mallin sisäistä tilaa. Tietyt suunnat vektoriavaruudessa vastaavat mallin käyttäytymistä, kuten kieltäytymistä vastata kysymykseen.

Mitä Traficom voi tehdä, mitä ei

Saksalaisen yksityishenkilön GitHub-tilillä pyörivä työkalu on käytännössä Traficomin ulottumattomissa. Suomalainen viranomainen voi vaatia kotimaisilta toimijoilta, että ne eivät ota tuotantokäyttöön abliteroituja malleja, ja se voi puuttua malleja jakaviin alustoihin Cyber Resilience Actin keinoin. Itse työkalua ei kuitenkaan saada pois GitHubista, ja muokatut mallit elävät pakettilatauksina kuten mikä tahansa muu avoimen lähdekoodin julkaisu.

Käytännössä Traficomin AI-koordinaation merkitys kasvaa nimenomaan suosituksina, ei lupina tai kielloina. Suomalaisten yritysten on syytä tarkistaa itse mistä mallin painot tulevat, kuka ne on julkaissut ja milloin niitä on viimeksi muokattu. Pakettienhallinta ei tee tätä työtä.

Hereticin opetus ei ole, että avoimet mallit pitäisi sulkea. Opetus on, että turvasuodatin avoimen mallin painoissa on lähinnä kohtelias kyltti. Kun yksi vektori riittää sen siirtämiseen, malleja julkaiseva yhtiö ei voi enää väittää suodattimen olevan este pahantahtoiselle käyttäjälle. Painopiste siirtyy siihen, mitä malli ylipäätään osaa. Sitä abliteraatio ei piilota.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 420 vuotta koodaamatta, sitten 5,4 miljoonaa
  5. 5Datakeskukset Suomessa – hankkeet, sähkö ja vero

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.