Liiketoiminta

Tietosanakirja haastaa OpenAI:n – ChatGPT muistaa liikaa

Britannica ja Merriam-Webster syyttävät 100 000 artikkelin kopioinnista

Hanna HuulivuoHanna Huulivuo
Jaa:
Tietosanakirja haastaa OpenAI:n – ChatGPT muistaa liikaa

Encyclopædia Britannica ja sanakirjakustantaja Merriam-Webster jättivät 13. maaliskuuta kanteen OpenAI:ta vastaan New Yorkin liittovaltion tuomioistuimessa. Kustantajat syyttävät tekoäly-yhtiötä laajamittaisesta tekijänoikeusrikkomuksesta ja tavaramerkin loukkaamisesta.

Kanteen ytimessä on väite, jonka mukaan OpenAI on kouluttanut kielimallinsa lähes 100 000 Britannican verkkoartikkelilla ilman lupaa tai korvausta. Kustantajien mukaan ChatGPT ei ainoastaan oppinut näistä teksteistä, vaan suorastaan muisti ne ja tuottaa sisältöä käyttäjille lähes alkuperäisessä muodossaan.

Kielimalli, joka muistaa liikaa

Kanteessa kuvataan yksityiskohtaisesti, miten GPT-4 tuottaa käyttäjän pyynnöstä lähes sanasta sanaan kopioita Britannican artikkeleista ja Merriam-Websterin sanakirjamääritelmistä. Väite haastaa suoraan OpenAI:n aiemman kannan, jonka mukaan kielimallit oppivat kielestä yleisiä rakenteita eivätkä tallenna yksittäisiä tekstejä muistiinsa.

Britannica kuvaa tilannetta "vapaamatkustamiseksi" yhtiön luotettavalla sisällöllä. Käytännössä tämä tarkoittaa, että kun käyttäjä kysyy ChatGPT:ltä tietoa aiheesta, jonka Britannica on käsitellyt, tekoäly tuottaa vastauksen, joka korvaa vierailun Britannican verkkosivuilla. Kustantaja menettää sekä lukijan huomion että tilaustulot, joiden varaan sen liiketoimintamalli rakentuu.

Kanteen mukaan tekijänoikeutta rikotaan kolmessa vaiheessa: verkkosisältöjen keräämisessä, mallin kouluttamisessa ja vastausten tuottamisessa. Britannica huomauttaa, että OpenAI käyttää sen artikkeleita myös RAG-työnkulussa eli hakupohjaisessa generoinnissa, jossa malli hakee ulkoisia lähteitä vastaustensa tueksi.

Kun ChatGPT keksii Britannican puolesta

Tekijänoikeusväitteiden rinnalla kanne nostaa esiin yllättävän tavaramerkkiongelman. ChatGPT tuottaa toisinaan täysin keksittyjä väitteitä ja merkitsee niiden lähteeksi Encyclopædia Britannican. Ilmiötä kutsutaan tekoälyn hallusinaatioksi – malli luo uskottavan mutta väärän vastauksen ja liittää siihen tunnetun tietolähteen nimen uskottavuuden tueksi.

Kustantajien näkökulmasta kyse on vakavasta tavaramerkin loukkauksesta. Britannica on rakentanut maineensa 256 vuoden aikana huolellisella toimitustyöllä ja faktantarkistuksella. Kun tekoäly keksii tietoa ja väittää sen tulevan Britannicasta, se nakertaa brändin luotettavuutta. Tavallinen käyttäjä ei pysty erottamaan, onko ChatGPT:n antama Britannica-viittaus aito vai keksitty.

Kanne nojaa Yhdysvaltojen Lanham Act -tavaramerkkilakiin, joka kieltää harhaanjohtavan alkuperämerkinnän kaupallisessa toiminnassa. Aiemmat tekoälykanteet ovat keskittyneet tekijänoikeuteen, mutta tavaramerkkiväite avaa kokonaan uuden rintaman. Jos tuomioistuin hyväksyy Britannican argumentin, mikä tahansa brändi, jonka nimissä tekoäly hallusinoi, voisi nostaa vastaavan kanteen.

Oikeusjuttujen vyyhti kasvaa

Britannican kanne liittyy laajempaan oikeustaisteluun, joka alkoi New York Timesin haastettua OpenAI:n joulukuussa 2023. New Yorkin eteläisen piirikunnan liittovaltion tuomioistuin käsittelee parhaillaan yli tusinaa tekijänoikeuskannetta yhdistettyinä oikeudenkäynteinä. Todisteluvaiheen odotetaan jatkuvan läpi vuoden 2026.

Tuomari Sidney Stein teki tammikuussa 2026 merkittävän päätöksen ja määräsi OpenAI:n luovuttamaan 20 miljoonan ChatGPT-keskustelun anonymisoidun otoksen kantajien asianajajille. Päätös avaa ensimmäistä kertaa ikkunan siihen, miten kielimalli käyttää koulutusdataansa käytännössä ja kuinka usein käyttäjien saamat vastaukset muistuttavat alkuperäisiä lähteitä. Fair use -ratkaisua ei odoteta ennen kesää 2026.

Britannican tapaus eroaa aiemmista kanteista yhdellä olennaisella tavalla. Tavaramerkkiväite hallusinoiduista lähdeviittauksista on uusi juridinen argumentti, jota ei ole aiemmin nostettu yhtä selvästi esiin. Jos se menestyy, sisällöntuottajat saavat käyttöönsä kokonaan toisen juridisen väylän tekoäly-yhtiöiden haastamiseen – sellaisen, joka ei edellytä näyttöä suorasta kopioinnista.

“Mallimme on koulutettu julkisesti saatavilla olevalla datalla, ja käyttö perustuu fair use -doktriiniin.”

— OpenAI, yhtiön tiedottaja

OpenAI:n tekijänoikeustaistelun eteneminen

2023-12

New York Times haastaa OpenAI:n

Ensimmäinen merkittävä tekijänoikeuskanne tekoäly-yhtiötä vastaan.

2026-01

Tuomari määrää keskusteludatan luovutuksen

20 miljoonan ChatGPT-keskustelun anonymisoitu otos luovutetaan kantajille.

2026-03

Britannica ja Merriam-Webster haastavat

Uusi kanne nojaa tekijänoikeuteen ja tavaramerkin loukkaukseen hallusinoiduista viittauksista.

2026-06

Fair use -ratkaisu aikaisintaan

Yhdistettyjen oikeudenkäyntien odotetaan tuottavan ennakkopäätöksen.

Sanasto

Fair use
Yhdysvaltain tekijänoikeuslain doktriini joka sallii suojatun materiaalin rajallisen käytön ilman lupaa, esimerkiksi arvostelun tai tutkimuksen tarkoituksiin. Tekoäly-yhtiöt vetoavat tähän puolustaessaan koulutusdatan käyttöä.

Mitä tämä tarkoittaa Suomessa?

Suomalaiset kustantajat seuraavat yhdysvaltalaisia oikeustapauksia tarkasti, vaikka Euroopassa tilanne on juridisesti erilainen. Sanoma, Otava ja WSOY tuottavat merkittävän osan suomenkielisestä verkkosisällöstä, ja niiden asema muistuttaa monin tavoin Britannican tilannetta: laadukasta, toimitettua sisältöä, jonka arvo perustuu luotettavuuteen.

EU:n tekoälysäädös velvoittaa elokuusta 2025 alkaen yleismallien tarjoajia kunnioittamaan tekijänoikeuksia ja noudattamaan opt-out-mekanismeja. Käytännössä kustantajat voivat koneluettavalla merkinnällä kieltää sisältönsä käytön tekoälyn koulutuksessa. Euroopan parlamentti ehdotti maaliskuussa 2026 myös korvausvelvollisuutta tekoäly-yhtiöille, jotka hyödyntävät lehtikustantajien sisältöä hakutuloksissa ja muissa palveluissa.

Suomessa tekijänoikeuslain 13 b § mahdollistaa tekstin- ja tiedonlouhinnan tutkimustarkoituksiin, mutta kaupallinen käyttö edellyttää oikeudenhaltijan lupaa. Yksikään suomalainen kustantaja ei ole toistaiseksi nostanut kannetta tekoäly-yhtiötä vastaan, mutta EU:n tiukentuva sääntely ja Yhdysvalloissa kertyvä oikeuskäytäntö voivat muuttaa tilannetta. Erityisesti hallusinoidut viittaukset suomalaisiin lähteisiin voisivat synnyttää tavaramerkkikanteen myös Euroopassa.

Britannican tapaus osoittaa, ettei kyse ole pelkästään isojen mediajättien taistelusta. Myös tietosanakirjat, sanakirjat ja erikoisjulkaisut voivat joutua tilanteeseen, jossa niiden vuosikymmenten työ päätyy tekoälyn raaka-aineeksi ilman korvausta. Suomalaisille kustantajille se on selkeä viesti: opt-out-mekanismien käyttöönotto ja tekijänoikeusstrategian päivittäminen kannattaa tehdä nyt eikä vasta silloin, kun oma sisältö löytyy tekoälyn vastauksista.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.