Lukiolaisen esseessä, kesätyöhakemuksessa tai asiakkaalle lähtevässä sähköpostissa voi pian olla jotain, mitä kukaan ei näe. OpenAI kertoi maanantaina lisäävänsä ChatGPT:n ja Codexin tuottamaan tekstiin näkymättömän vesileiman kaikille Euroopan unionin käyttäjille. Myös suomalaisille.
TechCrunchin mukaan muutos koskee kaikkia ChatGPT:n ja Codexin käyttäjätasoja EU:ssa, ja se otetaan käyttöön tulevien viikkojen aikana. Taustalla on EU:n tekoälysäädös, jonka läpinäkyvyysvelvoitteet tulivat voimaan 2. elokuuta.
Mikä näkymätön vesileima on?
Tekstiin ei piiloteta merkkejä eikä metatietoja. OpenAI:n textGrain-menetelmä vaikuttaa hienovaraisesti siihen, mitä sanoja malli valitsee. Kun tarjolla on useita lähes yhtä hyviä vaihtoehtoja, valintoihin jää tilastollinen kuvio, jota lukija ei huomaa mutta tunnistusohjelma löytää.
OpenAI on kehittänyt menetelmän yhdessä Pennsylvanian yliopiston ja Yalen tutkijoiden kanssa. Yhtiön mukaan EU:n tekoälysäädös vaatii, että generatiivisen tekoälyn tarjoajat tekevät tuottamastaan tekstistä koneellisesti tunnistettavaa. Vastausten laatuun leima ei OpenAI:n testeissä vaikuttanut merkittävästi.
Rajapinnassa eli API:ssa leima toimii toisin. Kehittäjät voivat ottaa sen käyttöön tietyissä malleissa missä päin maailmaa tahansa, mutta oletuksena se on pois päältä. Jos suomalainen yritys rakentaa oman palvelunsa OpenAI:n rajapinnan varaan, palvelun tuottamassa tekstissä ei siis ole leimaa, ellei yritys itse kytke sitä päälle.
Neljäsosa sanoista vaihtoon, ja leima on lähes poissa
OpenAI kertoo menetelmän heikkouksista poikkeuksellisen suoraan. Muokkaamattomasta tekstistä tunnistin löysi leiman noin 92 prosentissa tapauksista. Kun kymmenesosa sanoista vaihdettiin synonyymeihin, osumatarkkuus putosi 66 prosenttiin.
Kun sanoista vaihdettiin neljäsosa, tunnistus putosi 17 prosenttiin.
Siihen ei tarvita erikoistyökaluja. Riittää, että kirjoittaa tekstin osittain omin sanoin tai pyytää toista tekoälyä muotoilemaan sen uudelleen. Yhtiön mukaan myös lyhyet tekstit, matematiikan vastaukset ja käännetty teksti ovat tunnistimelle valmiiksi vaikeita. Viimeinen koskee erityisesti pienen kielen käyttäjiä, jotka kääntävät paljon englanninkielistä aineistoa.
“Vesileima ei mittaa ihmisen panosta. Se voi osoittaa, että OpenAI:n järjestelmä on tuottanut tai käsitellyt osan tekstistä, mutta ei sitä, kuinka paljon ihmisen harkintaa, muokkausta tai luovuutta siihen on käytetty.”
Kelpaako leima todisteeksi koulussa tai työpaikalla?
Käytännössä ei. Opettaja tai esihenkilö ei pääse tunnistimeen käsiksi lainkaan, sillä OpenAI antaa sen aluksi vain hyväksytyille tutkijoille ja asiantuntijaorganisaatioille. Yhtiön mukaan päätös johtuu juuri menetelmän rajoituksista. Tunnistin kertoo vain, löytyykö tekstistä OpenAI:n leima, eikä se paljasta käyttäjää tai keskusteluja.
Puuttuva leima ei myöskään todista mitään. OpenAI kirjoittaa tiedotteessaan englanniksi, että ”havaitun vesileiman puuttuminen ei todista, että tekstin on kirjoittanut ihminen” (https://openai.com/index/eu-text-provenance/). Muiden yhtiöiden malleissa OpenAI:n leimaa ei ole lainkaan, ja muokattu teksti läpäisee tunnistuksen usein.
Löydetty leimakaan ei kerro koko totuutta. Opiskelija on voinut kirjoittaa esseen itse ja pyytää ChatGPT:tä vain oikolukemaan sen. OpenAI:n mukaan leima voi syntyä myös tekstiin, jota sen järjestelmä on pelkästään käsitellyt. Vilppiepäilyä on siis vaikea perustaa leimaan, ja oppilaitoksissa ratkaisevaksi jää jatkossakin se, mitä tekoälyn käytöstä on etukäteen sovittu.
Toimistotyöntekijälle muutos on pienempi kuin miltä se kuulostaa. ChatGPT:llä luonnosteltu tarjous tai raportti saa leiman, mutta kukaan vastaanottajista ei voi tarkistaa sitä ainakaan toistaiseksi. Jos yrityksellä on oma linjaus tekoälyn käytöstä asiakasviestinnässä, se pätee yhä samalla tavalla kuin ennenkin.
Opetushallitus tai suomalaiset yliopistot eivät olleet maanantaina kommentoineet OpenAI:n ilmoitusta julkisesti.



