Tekoäly

60 tapaa tunnistaa tekoälysisältöä – vain kolmannes toimii

Microsoftin tutkimus tulee juuri kun EU:n merkintäpakko lähestyy

Hanna HuulivuoHanna Huulivuo
Jaa:
60 tapaa tunnistaa tekoälysisältöä – vain kolmannes toimii

Kolme menetelmää, 60 yhdistelmää

Microsoftin pitkän aikavälin tekoälyturvallisuusohjelma LASER julkaisi helmikuussa raportin, joka kartoittaa systemaattisesti keinot erottaa aito sisältö tekoälyn tuottamasta. Johtopäätös on karua luettavaa kaikille, jotka toivovat nopeaa ratkaisua disinformaation torjuntaan: tutkijat mallinsivat 60 erilaista yhdistelmää kolmesta todentamismenetelmästä ja totesivat, että vain 20 niistä saavuttaa korkean luotettavuuden.

Raportin taustalla on Microsoftin päätutkija Eric Horvitz, jonka vetämä monitieteinen ryhmä arvioi kolmea ydintekniikkaa: kryptografista alkuperäseurantaa (C2PA-standardi), näkymättömiä vesileimoja ja pehmeään tiivisteeseen perustuvia digitaalisia sormenjälkiä. Jokaista tekniikkaa testattiin erikseen ja yhdessä kuvien, äänen ja videon todentamiseen erilaisissa häiriötilanteissa – metatietojen poistamisesta sisällön tahalliseen muokkaamiseen.

Kolme tekniikkaa, kolme heikkoutta

C2PA-standardi on kolmikosta kypsyin. Se liittää mediatiedostoon kryptografisesti allekirjoitetun manifestin, joka kertoo kuka sisällön loi, millä työkalulla ja mitä muokkauksia on tehty. Manifestin peukaloiminen rikkoo allekirjoituksen, jolloin väärentäminen paljastuu. Heikkous on silti ilmeinen: manifestin voi poistaa pelkällä kuvakaappauksella.

Näkymätön vesileima upottaa tietoa suoraan sisältöön tavalla, joka ei näy ihmissilmälle. Se voi selvitä monista käsittelyvaiheista, kuten pakkauksesta ja sosiaalisen median uudelleenkoodauksesta. Menetelmä on kuitenkin todennäköisyyspohjainen, mikä tarkoittaa väistämättömiä vääriä hälytyksiä kumpaankin suuntaan. Sataprosenttista varmuutta ei ole tarjolla.

Digitaalinen sormenjälki laskee sisällöstä matemaattisen tiivisteen, jota verrataan tietokantaan tallennettuihin alkuperäisiin. Microsoftin mukaan sormenjälki ei kuitenkaan riitä korkean luotettavuuden todentamiseen. Mittakaavassa se on myös kallis: miljardien tiedostojen tiivisteiden vertaaminen vaatii valtavaa infrastruktuuria ja tuottaa väistämättä tiivistetörmäyksiä.

Olennainen rajoitus koskee kaikkia kolmea menetelmää: ne kertovat vain onko sisältöä muokattu, eivät sitä onko se totta. Faktantarkistusta mikään niistä ei korvaa.

Hyökkääjät ovat askeleen edellä

Raportin huolestuttavin havainto koskee niin sanottuja sosioteknisiä alkuperähyökkäyksiä. Hyökkääjä voi kääntää todentamissignaalit päälaelleen: aito sisältö saadaan näyttämään tekoälyn tuottamalta ja tekoälysisältö aidolta. Kun aitoa valokuvaa muokataan minimaalisesti tekoälytyökalulla, koko kuva voi saada "tekoälyn generoima" -leiman ilman tietoa muokkauksen todellisesta laajuudesta. Luottamus järjestelmään kääntyy itseään vastaan.

Tunnistimien tarkkuusluvut ovat karumpia kuin yleensä kerrotaan. Parhaat kaupalliset deepfake-tunnistimet yltävät noin 95 prosentin tarkkuuteen laboratorio-olosuhteissa, mutta vapaasti saatavilla olevat työkalut jäävät alle 70 prosentin. Kohdennetuilla hyökkäyksillä joidenkin tunnistimien tarkkuus putoaa alle 30 prosenttiin. Raportti nostaa esiin paradoksin: mitä enemmän tunnistimeen luotetaan, sitä suurempaa vahinkoa sen virheet aiheuttavat.

Microsoft suosittelee laitteistopohjaisia suojattuja enklaaveja kameroihin ja muihin tallennuslaitteisiin. Tavalliset tietokoneet eivät tarjoa riittävää suojaa, koska laitteen ylläpitäjä voi muokata ohjelmistoja ja vaarantaa kryptografiset avaimet. Pilvipohjaiset allekirjoitusympäristöt ovat turvallisempia, mutta ne eivät kata tilanteita, joissa yhteys verkkoon puuttuu.

Kokeile itse

Microsoftin raportti Media Integrity and Authentication: Status, Directions, and Futures on vapaasti luettavissa Microsoft Research -sivustolla. Sisällön alkuperätietoja voi tutkia käytännössä Content Credentials Verify -työkalulla osoitteessa contentauthenticity.org.

Sisällön todentaminen pettää kenttäolosuhteissa

Laboratorio-olosuhteet~95 %
Vapaasti saatavat työkalut<70 %
Kohdennettu manipulointi<30 %

Microsoft Research, 2026

60

Testattua menetelmäyhdistelmää

~20↓

Saavutti korkean luotettavuuden

Elokuu 2026

EU:n merkintävelvoite alkaa

Microsoft Research, EU AI Act, 2026

Sanasto

C2PA-standardi
Avoin tekninen standardi, joka liittää mediatiedostoon suojatun todisteen sen alkuperästä ja muokkaushistoriasta. Adoben, Microsoftin ja useiden mediatalojen yhteishanke.
Deepfake
Tekoälyllä luotu tai muokattu kuva, ääni tai video, joka esittää henkilön sanovan tai tekevän jotain mitä ei oikeasti tapahtunut.
Vesileima (digitaalinen)
Mediatiedostoon piilotettava näkymätön merkintä, jonka avulla sisällön alkuperä voidaan myöhemmin todentaa koneellisesti.
Kryptografinen allekirjoitus
Matemaattinen menetelmä, jolla voidaan todistaa tiedoston alkuperä ja se, ettei sisältöä ole muutettu allekirjoituksen jälkeen.

EU vaatii merkintöjä – teknologia ei ole valmis

Microsoftin tutkimus osuu arkaan paikkaan. EU:n tekoälylain artikla 50 velvoittaa 2. elokuuta 2026 alkaen, että tekoälyjärjestelmien tuottama sisältö merkitään koneluettavasti. Laiminlyönnistä voi seurata jopa 15 miljoonan euron sakko tai kolme prosenttia yrityksen maailmanlaajuisesta liikevaihdosta. Kalifornian samanaikaisesti voimaan tuleva laki vaatii vesileimoja, jotka ovat pysyviä tai äärimmäisen vaikeita poistaa – vaatimus, jonka Microsoftin oma tutkimus osoittaa epärealistiseksi.

Suomalaiselle mediakentälle tilanne on konkreettinen. Yle osallistuu jo BBC:n ja ITN:n vetämään kansainväliseen C2PA-hankkeeseen, jossa kehitetään avoimen lähdekoodin työkaluja sisällön alkuperän todentamiseen. Standardi on toistaiseksi käytössä lähinnä ammattilaiskalustossa, kuten Sonyn PXW-Z300-videokamerassa ja Googlen Pixel 10 -puhelimessa. Suomalaisten mediatalojen, alustojen ja sisällöntuottajien on päätettävä, miten ne täyttävät EU:n vaatimukset tilanteessa, jossa teknologia ei vielä toimi luotettavasti.

Raportti ei anna helppoa vastausta, mutta se piirtää ensimmäisen rehellisen kartan maaston vaikeudesta. Microsoft itse jätti avoimeksi, toteuttaako se suositukset omilla alustoillaan – Copilotissa, Azuressa ja LinkedInissä. Suomessa kannattaa seurata Ylen C2PA-kokeilua ja alkaa valmistautua elokuun määräaikaan. Aikaa on puoli vuotta, eikä kukaan ole valmis.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.