Encyclopædia Britannica ja sanakirjakustantaja Merriam-Webster jättivät 13. maaliskuuta kanteen OpenAI:ta vastaan New Yorkin liittovaltion tuomioistuimessa. Kustantajat syyttävät tekoäly-yhtiötä laajamittaisesta tekijänoikeusrikkomuksesta ja tavaramerkin loukkaamisesta.
Kanteen ytimessä on väite, jonka mukaan OpenAI on kouluttanut kielimallinsa lähes 100 000 Britannican verkkoartikkelilla ilman lupaa tai korvausta. Kustantajien mukaan ChatGPT ei ainoastaan oppinut näistä teksteistä, vaan suorastaan muisti ne ja tuottaa sisältöä käyttäjille lähes alkuperäisessä muodossaan.
Kielimalli, joka muistaa liikaa
Kanteessa kuvataan yksityiskohtaisesti, miten GPT-4 tuottaa käyttäjän pyynnöstä lähes sanasta sanaan kopioita Britannican artikkeleista ja Merriam-Websterin sanakirjamääritelmistä. Väite haastaa suoraan OpenAI:n aiemman kannan, jonka mukaan kielimallit oppivat kielestä yleisiä rakenteita eivätkä tallenna yksittäisiä tekstejä muistiinsa.
Britannica kuvaa tilannetta "vapaamatkustamiseksi" yhtiön luotettavalla sisällöllä. Käytännössä tämä tarkoittaa, että kun käyttäjä kysyy ChatGPT:ltä tietoa aiheesta, jonka Britannica on käsitellyt, tekoäly tuottaa vastauksen, joka korvaa vierailun Britannican verkkosivuilla. Kustantaja menettää sekä lukijan huomion että tilaustulot, joiden varaan sen liiketoimintamalli rakentuu.
Kanteen mukaan tekijänoikeutta rikotaan kolmessa vaiheessa: verkkosisältöjen keräämisessä, mallin kouluttamisessa ja vastausten tuottamisessa. Britannica huomauttaa, että OpenAI käyttää sen artikkeleita myös RAG-työnkulussa eli hakupohjaisessa generoinnissa, jossa malli hakee ulkoisia lähteitä vastaustensa tueksi.
Kun ChatGPT keksii Britannican puolesta
Tekijänoikeusväitteiden rinnalla kanne nostaa esiin yllättävän tavaramerkkiongelman. ChatGPT tuottaa toisinaan täysin keksittyjä väitteitä ja merkitsee niiden lähteeksi Encyclopædia Britannican. Ilmiötä kutsutaan tekoälyn hallusinaatioksi – malli luo uskottavan mutta väärän vastauksen ja liittää siihen tunnetun tietolähteen nimen uskottavuuden tueksi.
Kustantajien näkökulmasta kyse on vakavasta tavaramerkin loukkauksesta. Britannica on rakentanut maineensa 256 vuoden aikana huolellisella toimitustyöllä ja faktantarkistuksella. Kun tekoäly keksii tietoa ja väittää sen tulevan Britannicasta, se nakertaa brändin luotettavuutta. Tavallinen käyttäjä ei pysty erottamaan, onko ChatGPT:n antama Britannica-viittaus aito vai keksitty.
Kanne nojaa Yhdysvaltojen Lanham Act -tavaramerkkilakiin, joka kieltää harhaanjohtavan alkuperämerkinnän kaupallisessa toiminnassa. Aiemmat tekoälykanteet ovat keskittyneet tekijänoikeuteen, mutta tavaramerkkiväite avaa kokonaan uuden rintaman. Jos tuomioistuin hyväksyy Britannican argumentin, mikä tahansa brändi, jonka nimissä tekoäly hallusinoi, voisi nostaa vastaavan kanteen.
Oikeusjuttujen vyyhti kasvaa
Britannican kanne liittyy laajempaan oikeustaisteluun, joka alkoi New York Timesin haastettua OpenAI:n joulukuussa 2023. New Yorkin eteläisen piirikunnan liittovaltion tuomioistuin käsittelee parhaillaan yli tusinaa tekijänoikeuskannetta yhdistettyinä oikeudenkäynteinä. Todisteluvaiheen odotetaan jatkuvan läpi vuoden 2026.
Tuomari Sidney Stein teki tammikuussa 2026 merkittävän päätöksen ja määräsi OpenAI:n luovuttamaan 20 miljoonan ChatGPT-keskustelun anonymisoidun otoksen kantajien asianajajille. Päätös avaa ensimmäistä kertaa ikkunan siihen, miten kielimalli käyttää koulutusdataansa käytännössä ja kuinka usein käyttäjien saamat vastaukset muistuttavat alkuperäisiä lähteitä. Fair use -ratkaisua ei odoteta ennen kesää 2026.
Britannican tapaus eroaa aiemmista kanteista yhdellä olennaisella tavalla. Tavaramerkkiväite hallusinoiduista lähdeviittauksista on uusi juridinen argumentti, jota ei ole aiemmin nostettu yhtä selvästi esiin. Jos se menestyy, sisällöntuottajat saavat käyttöönsä kokonaan toisen juridisen väylän tekoäly-yhtiöiden haastamiseen – sellaisen, joka ei edellytä näyttöä suorasta kopioinnista.



