Tutkimus

Nimimerkki ei suojaa: tekoäly paljastaa kirjoittajan muutamalla dollarilla

Tutkijoiden tekoäly tunnisti kaksi kolmesta Hacker Newsin nimimerkillä kirjoittavasta

Hanna HuulivuoHanna Huulivuo
Jaa:
Nimimerkki ei suojaa: tekoäly paljastaa kirjoittajan muutamalla dollarilla
Kuva: Mvolz / CC0

Sveitsiläisen ETH Zürichin ja Anthropicin tutkijat antoivat tekoälyagentille yksinkertaisen tehtävän. Tässä ovat viestit, jotka joku on kirjoittanut nimimerkillä Hacker News -keskustelupalstalle. Selvitä, kuka hän on. Agentti sai käyttää internetiä.

Agentti nimesi oikein 226 kohdetta 338:sta eli 67 prosenttia. Sen antamista vastauksista noin 90 prosenttia osui oikeaan. Väärin se arvasi 25 kertaa, ja 86 tapauksessa se jätti vastaamatta. Kohdetta kohden ajo maksoi tutkijoille 1–4 dollaria. Työhön, joka veisi ihmistutkijalta tunteja, agentti tarvitsi minuutteja.

Tutkimus Large-scale online deanonymization with LLMs julkaistiin arXivissa helmikuussa 2026, ja se esiteltiin elokuussa Baltimoressa pidetyssä USENIX Security -konferenssissa. Tekijöinä ovat Simon Lermen MATS-tutkimusohjelmasta, Daniel Paleka, Joshua Swanson, Michael Aerni ja Florian Tramèr ETH Zürichistä sekä Nicholas Carlini Anthropicista.

Pienet yksityiskohdat kasautuvat

Ilmiön ydin on arkinen. Kirjoittaja mainitsee ohimennen kaupunginosansa, alansa, lapsen harrastuksen tai koiransa rodun. Mikään näistä ei yksinään paljasta mitään. Yhdessä ne kuitenkin rajaavat joukkoa, ja kielimalli osaa poimia tällaiset murut tuhansien viestien seasta ja etsiä verkosta ihmisen, johon ne kaikki sopivat.

AI Suomi ei kuvaa menetelmää tätä tarkemmin. Tutkijat itsekin jättivät koodinsa ja aineistonsa julkaisematta. Artikkelin mukaan valmiin työkalun julkaiseminen tekisi turhan helpoksi kohdistaa sama hyökkäys oikeasti nimettömiin profiileihin.

Tulokset vaihtelevat aineiston mukaan. Toisessa koeasetelmassa verrattiin Redditin elokuvakeskustelijoita, jotka puhuivat lähinnä elokuvista, ja siellä tunnistusosuus jäi 8,5 prosenttiin samalla 90 prosentin tarkkuudella. Kun joku kirjoittaa omasta elämästään, hänet on helpompi löytää kuin se, joka puhuu vain yhdestä aiheesta. Tutkijat kokeilivat myös Anthropicin haastatteluaineistoa, jossa tiedeihmiset kertoivat nimettöminä tekoälyn käytöstään. Agentti tunnisti heistä 9 henkilöä 33:sta.

“Tuloksemme osoittavat, että käytännön hämäryys, joka on suojannut nimimerkillä kirjoittavia verkon käyttäjiä, ei enää päde ja että verkon yksityisyyden uhkamallit on arvioitava uudelleen.”

— Simon Lermen, Daniel Paleka ym., tutkimusartikkelin kirjoittajat, suomennettu englanninkielisestä alkutekstistä

Mitä tämä tarkoittaa suomalaiselle nimimerkille

Tutkimus tehtiin englanninkielisillä palveluilla, mutta sama logiikka koskee jokaista palstaa, jolla sama nimimerkki kerää vuosien historian. Suomi24:n pitkäaikainen kirjoittaja, joka on eri ketjuissa kertonut työpaikastaan, paikkakunnastaan ja perheestään, on jättänyt jälkeensä juuri sellaista aineistoa, jota agentti käytti.

Suomenkielisellä aineistolla menetelmää ei ole testattu. Ei siis tiedetä, suojaako pieni kielialue vai helpottaako se tunnistamista. Pieni kieliyhteisö tarkoittaa ainakin pienempää joukkoa, josta etsitään.

Palvelut eroavat toisistaan. Jodelissa viestit eivät kasaannu julkiseksi nimimerkkiprofiiliksi, ja Vauva.fi:ssä voi kirjoittaa myös kirjautumatta. Tutkimus tarkasteli nimenomaan profiileja, joihin viestejä kertyy. Irrallinen viesti antaa vähemmän tarttumapintaa, mutta yhdessä viestissä kerrottu tarkka yksityiskohta voi silti riittää.

Riski ei ole se, että joku tunnistaisi kaikki. Vaarallisinta on kohdistettu uteliaisuus. Kyse voi olla häiritsijästä, joka haluaa tietää kuka kirjoitti kriittisen viestin, työnantajasta, joka etsii nimettömän arvostelijan, tai entisestä puolisosta. Aiemmin tällainen selvitys vaati aikaa ja taitoa. Muutaman dollarin hinta tuo sen kenen tahansa ulottuville, ja se koskee myös väärinkäytöksistä nimettömänä kertovia ja lähteitään suojaavia toimittajia.

“Pysyvällä käyttäjänimellä kirjoittavien käyttäjien pitäisi olettaa, että vastapuoli voi yhdistää heidän tilinsä oikeisiin henkilöllisyyksiin tai toisiinsa ja että todennäköisyys kasvaa jokaisen julkaistun pienen tiedonmurun myötä.”

— Simon Lermen, Daniel Paleka ym., tutkimusartikkelin kirjoittajat, suomennettu englanninkielisestä alkutekstistä
226/338

Hacker News -kirjoittajaa tunnistettiin

n. 90 %

Agentin vastauksista osui oikeaan

1–4 $

Kustannus kohdetta kohden

Lermen ym., arXiv 2602.16800

Omasta elämästä kirjoittava paljastuu helpoimmin

Hacker News -nimimerkit67 % (226/338)
Anthropicin nimettömät tiedehaastattelut27 % (9/33)
Redditin elokuvakeskustelijat8,5 %

Lermen ym., arXiv 2602.16800

Sanasto

arXiv
Avoin verkkoarkisto, johon tutkijat julkaisevat tieteellisiä artikkeleitaan usein ennen vertaisarviointia. Se on tekoälytutkimuksen tärkein nopea julkaisukanava.
Haravointi (scraping)
Tietojen automaattinen kerääminen verkkosivuilta ohjelman avulla. Ohjelma voi esimerkiksi käydä läpi keskustelupalstan tuhansia viestejä ja tallentaa ne nopeammin kuin ihminen ehtisi lukea yhdenkään.

Mitä voi tehdä

Tutkijoiden neuvosta seuraa muutama käytännön ohje. Arkaluonteisista asioista kannattaa kirjoittaa eri nimimerkillä kuin harrastuksista, eikä samaa nimimerkkiä kannata käyttää eri palveluissa. Paikkakunnan, ammatin, iän ja perheen koostumuksen voi jättää pois tai kertoa ylimalkaisemmin. Vanhojen viestien poistaminen pienentää aineistoa, mutta verkkoon jääneitä arkistokopioita ei välttämättä saa pois.

Tutkijat vaativat toimia myös palveluilta. He ehdottavat käyttäjädatan rajapintoihin käyttörajoja, automaattisen haravoinnin tunnistamista ja massalatausten rajoittamista. Palveluiden pitäisi heidän mukaansa myös harkita uudelleen, kannattaako dataa ylipäätään pitää julkisesti saatavilla esimerkiksi kielimallien koulutusta varten. Kielimallien tarjoajat taas voisivat valvoa, käytetäänkö niiden malleja tunnistamisyrityksiin.

Tunnistettavissa oleva tieto on henkilötietoa

Tietosuojavaltuutetun toimiston ohjeen mukaan henkilötietoja ovat "kaikki tiedot, jotka liittyvät tunnistettuun tai tunnistettavissa olevaan henkilöön". Tiedot pysyvät henkilötietoina niin kauan kuin niiden perusteella henkilön voi tunnistaa "suoraan tai välillisesti". Jos agentti yhdistää nimimerkin ihmiseen muutamalla dollarilla, nimimerkin suojissa kirjoitettujen viestien tunnistettavuutta on vaikea pitää teoreettisena.

Mitä tämä merkitsee keskustelupalveluiden velvollisuuksille, on vielä auki. AI Suomi ei löytänyt tietosuojavaltuutetun toimiston julkista kannanottoa tutkimukseen.

Nimimerkki ei ole koskaan ollut salaus. Sen suoja on perustunut vaivaan: kenelläkään ei ollut aikaa lukea tuhansia viestejä ja yhdistellä vihjeitä. Nyt sen vaivan voi ostaa halvemmalla kuin kahvikupin, eikä vanhoja viestejä kirjoitettu sitä silmällä pitäen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Uusi Siri saapui – mutta ei suomeksi eikä iPhoneen
  4. 4Google kaatoi 300 hehtaaria metsää – virasto selvittää
  5. 5Nokia haluaa Oulusta tontin 5 miljoonalla

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.