Liiketoiminta

Microsoftin johtaja: "historian suurin työn varkaus"

Salattu muistio vuodelta 2023 paljastui New York Timesin oikeudenkäynnissä.

Hanna HuulivuoHanna Huulivuo
Jaa:
Microsoftin johtaja: "historian suurin työn varkaus"
Kuva: Jelson25 / Public domain

Tammikuussa 2023 Microsoftin Applied Science -yksikön johtaja Brent Hecht kirjoitti talon sisäisen muistion, jota tuskin oli tarkoitettu ulkopuolisten luettavaksi. Siinä hän kuvasi tapaa, jolla kielimallien opetusaineistot oli kerätty internetistä. Sanavalinta oli yhtiön omalta johtajalta poikkeuksellisen jyrkkä.

Muistio tuli julki tällä viikolla, kun New York Timesin OpenAI:ta ja Microsoftia vastaan nostaman tekijänoikeuskanteen asiakirjoista poistettiin salauksia. TechCrunch kertoi sisällöstä ensimmäisenä keskiviikkona.

Hämmästyttävä, ennennäkemättömän mittaluokan varkaus. Ihmiskunnan historian suurin työn varkaus.

Brent Hecht, Microsoftin Applied Science -yksikön johtaja, sisäinen muistio tammikuulta 2023. Alkukielellä: "an astonishing theft of unprecedented proportions", "the largest theft of labor in human history".

Mistä asiakirjasta on kyse

Kanne itsessään on vanha uutinen. New York Times haastoi OpenAI:n ja Microsoftin oikeuteen lähes kolme vuotta sitten, ja samaan käsittelyyn on kytketty New York Daily News ja tutkivan journalismin keskus Center for Investigative Reporting. Uutta on se, mitä asiakirjoista nyt näkyy. Aiemmin mustattuja kohtia avattiin, ja mukana on yhtiöiden sisäistä viestintää sekä johtajien kuulusteluja.

Vuotta myöhemmin, tammikuussa 2024, Hecht muotoili saman asian esityksessään varovaisemmin mutta ei lempeämmin. Hänen mukaansa on hyvin epätavallista, että lopputuote uhkaa olennaisten tavarantoimittajiensa taloudellista perustaa, mutta juuri sellaisen tilanteen yhtiö oli luonut kielimalliliiketoiminnassaan suhteessa sen sisältöketjuun.

Asiakirjoissa puhuvat myös muut. Microsoftin toimitusjohtaja Satya Nadella on kuulustelussa todennut, että maksumuurin takainen sisältö pitäisi lisensoida keneltä tahansa, joka haluaa käyttää sitä pohjustamiseen tai kouluttamiseen. ChatGPT:stä vastaava Nick Turley kirjoitti sisäisesti, että kustantajille tuotteet kuten chatbotti ovat eksistentiaalinen uhka ja suurelta osin korvaavia, ja että ne muuttuvat yhä korvaavammiksi. OpenAI:n presidentti Greg Brockman kuvasi malleja sanoilla "erinomaisia uutisissa".

Luvut, jotka kantajat nostivat pöydälle

Kantajien mukaan OpenAI:n opetusaineistoissa oli vähintään 91 692 kopiota niiden omista teoksista. Common Crawl -pohjaisessa aineistossa oli yli kaksi miljoonaa dokumenttia pelkästään nytimes.com-sivustolta, ja Project Mango -nimisessä aineistossa ainakin 160 903 uniikkia uutiskustantajien teosta. Asiakirjoissa väitetään myös, että tekijänoikeusmerkinnät poistettiin aineistosta ennen mallien koulutusta.

Hankalin luku ei kuitenkaan koske kopioiden määrää. Microsoftin oman mittauksen mukaan Copilot pudotti klikkauksia New York Timesin sivustolle jopa 93 prosenttia verrattuna tavalliseen Bing-hakuun.

Se on tärkeää siksi, että yhdysvaltalaisen fair use -puolustuksen yksi ratkaiseva kysymys on, vahingoittaako käyttö alkuperäisen teoksen markkinaa. Kantajat esittävät nyt vastausta siihen kysymykseen vastaajan omasta datasta. Oikeudellisesti se ei vielä todista mitään, mutta neuvottelupöydässä sellainen luku painaa.

Mitä nämä luvut ovat ja mitä eivät

Kaikki edellä mainitut luvut ja lainaukset ovat peräisin kantajien oikeudenkäyntiasiakirjoista. Tuomioistuin ei ole todennut niitä tosiksi eikä ole ratkaissut, onko aineiston käyttö ollut laillista.

Microsoft ja OpenAI eivät vastanneet TechCrunchin kommenttipyyntöön, eikä kummaltakaan ole tämän jutun kirjoitushetkellä julkista vastinetta juuri näihin asiakirjoihin. Yhtiöt ovat koko prosessin ajan vedonneet siihen, että mallien kouluttaminen on fair usea eli sallittua käyttöä.

Ilmiön laajuudesta ei ole tässä vaiheessa muuta mittaria kuin nämä asiakirjat. Kuinka moni muu kustantaja on samassa asemassa, ei selviä niistä, koska muut eivät ole vieneet asiaa oikeuteen.

Tässä ensimmäistä kertaa esiin tuleva näyttö osoittaa, että OpenAI ja Microsoft tiesivät, että se mitä ne tekivät, oli väärin.

Steven Lieberman, New York Daily Newsin asianajaja, lausunto TechCrunchille. Alkukieli englanti.
91 692

Kopiota kantajien teoksista opetusaineistoissa

160 903

Uniikkia uutisteosta Project Mango -aineistossa

2 milj.

Dokumenttia nytimes.comilta Common Crawl -aineistossa

−93 %

Klikkauksia NYT:n sivustolle Copilotista Bing-hakuun verrattuna

Kantajien oikeudenkäyntiasiakirjat, TechCrunch 17.9.2026

Sanasto

Common Crawl
Yhdysvaltalaisen voittoa tavoittelemattoman järjestön ylläpitämä valtava kopio julkisesta internetistä. Aineisto on ilmainen ja avoin, ja se on ollut yksi keskeisimmistä opetusaineistoista lähes kaikille suurille kielimalleille.
Fair use
Yhdysvaltain tekijänoikeuslain poikkeus, joka sallii teoksen käytön ilman lupaa esimerkiksi tutkimukseen tai uutisointiin. Tuomioistuin punnitsee muun muassa sitä, muuttaako käyttö teoksen luonnetta ja vahingoittaako se alkuperäisen teoksen markkinaa. Suomen laissa ei ole vastaavaa joustavaa poikkeusta.
Tekstin- ja tiedonlouhinta
Suurten aineistomassojen automaattista läpikäyntiä koneella. EU:n tekijänoikeusdirektiivi sallii sen lähtökohtaisesti myös kaupallisiin tarkoituksiin, jos oikeudenhaltija ei ole kieltänyt sitä koneluettavassa muodossa, esimerkiksi sivuston robots.txt-tiedostossa.

Entä Suomi

Vastaavaa oikeudenkäyntiä ei Suomessa ole, ja lainsäädäntökin on toinen. EU:ssa tekstin- ja tiedonlouhinta on tekijänoikeusdirektiivin nojalla lähtökohtaisesti sallittua, jos oikeudenhaltija ei ole kieltänyt sitä koneluettavasti. Kielto pitää siis tehdä itse, ja moni suomalainen sivusto teki sen vasta, kun mallit oli jo koulutettu.

EU:n tekoälyasetus velvoittaa yleiskäyttöisten mallien tarjoajat julkaisemaan riittävän yksityiskohtaisen tiivistelmän opetusdatasta. Jos tuo velvoite toimii, 91 692:n kaltaisen luvun ei pitäisi jatkossa selvitä vasta siitä, että oikeudenkäynnin asiakirjoista poistetaan salauksia.

Lukijalle kysymys ei ole abstrakti. Kun hakukoneen tai chatbotin tiivistelmä korvaa käynnin uutissivustolla, mainostulot ja tilausmyynti kutistuvat, vaikka jutun tekeminen maksaa saman verran kuin ennen. Se näkyy ensin freelancereiden palkkioissa ja pienten paikallistoimitusten koossa, ei pörssikursseissa. Suomalaiselle kirjoittajalle, kääntäjälle ja kuvaajalle kyse on samasta asiasta kuin Hechtin muistiossa: kuka omistaa sen työn, jolla malli on opetettu, ja saako siitä maksun.

Lisenssien hinta ratkeaa käytännössä siellä, missä ensimmäiset isot sopimukset neuvotellaan. Suomalaiset kustantajat ovat siinä pöydässä pieniä, ja hinnat asetetaan New Yorkissa. Hechtin muistio on kiusallinen lähinnä siksi, että se osoittaa ostajan tienneen hinnan olemassaolosta jo kolme vuotta sitten.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.