Tekoäly

ChatGPT:n teksteihin tulee näkymätön leima – lunttaajaa se tuskin paljastaa

Kun neljäsosa sanoista vaihdetaan, tunnistus putoaa 92 prosentista 17 prosenttiin

Aino AikajärviAino Aikajärvi
Jaa:
ChatGPT:n teksteihin tulee näkymätön leima – lunttaajaa se tuskin paljastaa
Kuva: 首相官邸ホームページ / CC BY 4.0

Lukiolaisen esseessä, kesätyöhakemuksessa tai asiakkaalle lähtevässä sähköpostissa voi pian olla jotain, mitä kukaan ei näe. OpenAI kertoi maanantaina lisäävänsä ChatGPT:n ja Codexin tuottamaan tekstiin näkymättömän vesileiman kaikille Euroopan unionin käyttäjille. Myös suomalaisille.

TechCrunchin mukaan muutos koskee kaikkia ChatGPT:n ja Codexin käyttäjätasoja EU:ssa, ja se otetaan käyttöön tulevien viikkojen aikana. Taustalla on EU:n tekoälysäädös, jonka läpinäkyvyysvelvoitteet tulivat voimaan 2. elokuuta.

Mikä näkymätön vesileima on?

Tekstiin ei piiloteta merkkejä eikä metatietoja. OpenAI:n textGrain-menetelmä vaikuttaa hienovaraisesti siihen, mitä sanoja malli valitsee. Kun tarjolla on useita lähes yhtä hyviä vaihtoehtoja, valintoihin jää tilastollinen kuvio, jota lukija ei huomaa mutta tunnistusohjelma löytää.

OpenAI on kehittänyt menetelmän yhdessä Pennsylvanian yliopiston ja Yalen tutkijoiden kanssa. Yhtiön mukaan EU:n tekoälysäädös vaatii, että generatiivisen tekoälyn tarjoajat tekevät tuottamastaan tekstistä koneellisesti tunnistettavaa. Vastausten laatuun leima ei OpenAI:n testeissä vaikuttanut merkittävästi.

Rajapinnassa eli API:ssa leima toimii toisin. Kehittäjät voivat ottaa sen käyttöön tietyissä malleissa missä päin maailmaa tahansa, mutta oletuksena se on pois päältä. Jos suomalainen yritys rakentaa oman palvelunsa OpenAI:n rajapinnan varaan, palvelun tuottamassa tekstissä ei siis ole leimaa, ellei yritys itse kytke sitä päälle.

Neljäsosa sanoista vaihtoon, ja leima on lähes poissa

OpenAI kertoo menetelmän heikkouksista poikkeuksellisen suoraan. Muokkaamattomasta tekstistä tunnistin löysi leiman noin 92 prosentissa tapauksista. Kun kymmenesosa sanoista vaihdettiin synonyymeihin, osumatarkkuus putosi 66 prosenttiin.

Kun sanoista vaihdettiin neljäsosa, tunnistus putosi 17 prosenttiin.

Siihen ei tarvita erikoistyökaluja. Riittää, että kirjoittaa tekstin osittain omin sanoin tai pyytää toista tekoälyä muotoilemaan sen uudelleen. Yhtiön mukaan myös lyhyet tekstit, matematiikan vastaukset ja käännetty teksti ovat tunnistimelle valmiiksi vaikeita. Viimeinen koskee erityisesti pienen kielen käyttäjiä, jotka kääntävät paljon englanninkielistä aineistoa.

“Vesileima ei mittaa ihmisen panosta. Se voi osoittaa, että OpenAI:n järjestelmä on tuottanut tai käsitellyt osan tekstistä, mutta ei sitä, kuinka paljon ihmisen harkintaa, muokkausta tai luovuutta siihen on käytetty.”

— OpenAI, Yhtiön tiedote 5.10.2026, alkukieli englanti (openai.com/index/eu-text-provenance)

Kelpaako leima todisteeksi koulussa tai työpaikalla?

Käytännössä ei. Opettaja tai esihenkilö ei pääse tunnistimeen käsiksi lainkaan, sillä OpenAI antaa sen aluksi vain hyväksytyille tutkijoille ja asiantuntijaorganisaatioille. Yhtiön mukaan päätös johtuu juuri menetelmän rajoituksista. Tunnistin kertoo vain, löytyykö tekstistä OpenAI:n leima, eikä se paljasta käyttäjää tai keskusteluja.

Puuttuva leima ei myöskään todista mitään. OpenAI kirjoittaa tiedotteessaan englanniksi, että ”havaitun vesileiman puuttuminen ei todista, että tekstin on kirjoittanut ihminen” (https://openai.com/index/eu-text-provenance/). Muiden yhtiöiden malleissa OpenAI:n leimaa ei ole lainkaan, ja muokattu teksti läpäisee tunnistuksen usein.

Löydetty leimakaan ei kerro koko totuutta. Opiskelija on voinut kirjoittaa esseen itse ja pyytää ChatGPT:tä vain oikolukemaan sen. OpenAI:n mukaan leima voi syntyä myös tekstiin, jota sen järjestelmä on pelkästään käsitellyt. Vilppiepäilyä on siis vaikea perustaa leimaan, ja oppilaitoksissa ratkaisevaksi jää jatkossakin se, mitä tekoälyn käytöstä on etukäteen sovittu.

Toimistotyöntekijälle muutos on pienempi kuin miltä se kuulostaa. ChatGPT:llä luonnosteltu tarjous tai raportti saa leiman, mutta kukaan vastaanottajista ei voi tarkistaa sitä ainakaan toistaiseksi. Jos yrityksellä on oma linjaus tekoälyn käytöstä asiakasviestinnässä, se pätee yhä samalla tavalla kuin ennenkin.

Opetushallitus tai suomalaiset yliopistot eivät olleet maanantaina kommentoineet OpenAI:n ilmoitusta julkisesti.

Keitä vesileima koskee

ChatGPT ja Codex: kaikki EU:n käyttäjät, käyttöönotto tulevien viikkojen aikana. API: vapaaehtoinen kehittäjille kaikkialla maailmassa, oletuksena pois päältä. Tunnistin: aluksi vain hyväksytyille tutkijoille ja asiantuntijaorganisaatioille.

Sanasto

EU:n tekoälysäädös (AI Act)
EU:n laki, joka asettaa tekoälyjärjestelmille vaatimuksia niiden riskien mukaan. Siihen kuuluu esimerkiksi velvoite merkitä tekoälyn tuottama sisältö niin, että kone pystyy tunnistamaan sen.
DNA-synteesi
Palvelu, jossa laboratorio valmistaa tilaajan antaman perimäaineksen eli DNA-jakson keinotekoisesti. Tutkijat tilaavat näin esimerkiksi tietokoneella suunnittelemiensa proteiinien rakennusohjeet.

Proteiineissa leima toimii paremmin

Vertailukohta löytyy viime viikolta. Google DeepMind alkoi vesileimata tekoälyn suunnittelemia proteiineja, ja laboratoriossa testatuista merkityistä proteiineista leima tunnistettiin jokaisesta. Luonnon proteiineista vääriä hälytyksiä tuli vain 0,1 prosentissa.

Ero johtuu käyttötavasta. Proteiinia ei kukaan kirjoita uudelleen omin sanoin ennen kuin tilaa sen DNA-synteesiyhtiöltä, joten leima säilyy. Tekstiä taas muokataan koko ajan, ja juuri muokkaaminen syö leiman.

OpenAI aikoo julkaista textGrainin avoimena lähdekoodina. Jos muut mallintarjoajat ottavat saman menetelmän käyttöön, EU:n vaatimus alkaa toimia niin kuin on tarkoitettu, koska yksi tunnistin voisi tarkistaa usean yhtiön tekstit. Siihen asti leima kertoo lähinnä, mistä teksti sai alkunsa. Sitä, kuka sen lopulta kirjoitti, se ei kerro.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Datakeskukset Suomessa – hankkeet, sähkö ja vero
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat
  5. 5Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.