Saksalainen ohjelmistokehittäjä Philipp Emanuel Weidmann julkaisi GitHubissa työkalun nimeltä Heretic. Se irrottaa Metan ja Googlen avoimien tekoälymallien turvasuodattimet alle 10 minuutissa, eikä tehtävään tarvita erikoisrautaa. Financial Times testasi työkalua ja sai Llama 3.3:n vastaamaan ricin-annosta koskeviin kysymyksiin ja Gemma 3:n kuvailemaan kloorikaasun levittämistä.
Yksi vektori riittää
Heretic ei kouluta mallia uudelleen, vaan etsii sen sisältä yhden suunnan. Suuren kielimallin kieltäytyminen, klassinen anteeksi, en voi auttaa tässä, koodautuu tutkimusten mukaan pääosin yhteen lineaarialgebralliseen vektoriin mallin piilotetussa tilassa. Tekniikan nimi on abliteraatio, ja sitä on käytetty tutkijapiireissä jo pari vuotta.
Työkalu syöttää malliin ensin satoja kysymyksiä, joista osa laukaisee turvasuodattimen ja osa ei. Aktivaatioiden välinen keskimääräinen ero paljastaa kieltäytymisen suunnan. Kun tämä suunta vähennetään mallin painoarvoista, kieltäytyminen katoaa eikä koko mallia tarvitse opettaa uudelleen.
Tästä syystä operaatio onnistuu alle 10 minuutissa tavallisella tietokoneella. Kyseessä on yhden vektorin laskenta ja kevyt painomatriisin oikaisu, ei satoja GPU-tunteja vaativa hienosäätö. Weidmann paketoi tekniikan niin, ettei käyttäjältä vaadita koneoppimistaustaa, vaan komentorivin osaamista.
Mitä mallit puhuivat ilman suodatinta
Financial Timesin testissä Metan Llama 3.3:n turvasuodatin katosi 10 minuutissa, eivätkä testintekijät tarvinneet erikoisrautaa. Sen jälkeen malli vastasi muun muassa siihen, kuinka suuri ricin-annos tappaa puolet kohteistaan ruumiinpainon mukaan.
Googlen Gemma 3 puolestaan kuvaili kloorikaasun levittämistä, kirjoitti luottokorttitietojen varastamiseen tarkoitettua haittakoodia ja tuotti seksuaalista lapsiväkivaltaa kuvaavaa tekstiä. Kun Google julkaisi tuoreemman Gemma 4 -mallin, sen suodattimet kaatuivat Weidmannin mukaan 90 minuutissa julkistuksesta.
Yksittäiset ohjeet eivät ole sinänsä uusia. Vastaavia tietoja löytyy keskustelufoorumeilta ja Tor-verkosta. Erona on, että avoin tekoälymalli yhdistää sirpaleet, vastaa kysyjälle suomeksi tai englanniksi ja toimii millä kellonajalla tahansa ilman kommentointia.
Avoimen painon mallia ei voi peruuttaa
Kun malli on kerran ladattu yli puolelle miljoonalle koneelle, sen julkaisija ei voi vetää sitä takaisin, päivittää sitä eikä sammuttaa sitä. Tämä erottaa avoimet mallit suljetuista rajapintamalleista kuten GPT-5:stä tai Claude Opus 4.7:stä, joissa palveluntarjoaja voi rajoittaa käyttöä kesken keskustelun.
13 miljoonaa latausta jakelussa
Weidmann kertoi FT:lle, että Hereticillä on tuotettu yli 3 500 sensuroimatonta mallia viime syksyn jälkeen. Niitä on ladattu yhteensä 13 miljoonaa kertaa, suurin osa Hugging Facen kautta. Abliteroituja malleja oli alustalla jo aiemmin, mutta määrä kasvaa nyt nopeammin kuin alustan moderointi ehtii reagoida.
Tavallinen käyttäjä, joka asentaa mallin Ollamalla tai LM Studiolla, ei välttämättä tiedä onko hänen lataamansa versio abliteroitu. Hugging Facen vapaa jakelumalli ei vaadi sertifiointia eikä turvallisuusarviota. Riski koskee erityisesti yrityskäyttäjiä: suomalaisen yhtiön asiakaspalvelubotti tai sisäinen kysymys-vastauskone voi nojata mallin painoihin, jotka on haettu automaattisella pakettienhallinnalla. Jos painoissa on poistettu suodatin, vastuun siirtyminen Metalta tai Googlelta käyttävälle yhtiölle ei välttämättä näy missään muualla kuin Hugging Facen mallikortilla.



