Tutkimus

Kukaan ei tiedä, miten karannut tekoäly pysäytetään

Viiden huippulabran turvasuunnitelmat käytiin läpi. Paras sai kolme pistettä viidestä.

Hanna HuulivuoHanna Huulivuo
Jaa:
Kukaan ei tiedä, miten karannut tekoäly pysäytetään
Kuva: Mvolz / CC0

Steven Adler tutki turvallisuutta OpenAI:lla ennen kuin siirtyi Guidelight AI Standards -järjestön tutkimusjohtajaksi. 22. elokuuta julkaistussa TechCrunchin jutussa hän kertoo yllättyneensä siitä, kuinka vähän tekoäly-yhtiöt ovat julkisesti sanoneet siitä, mitä ne tekisivät vakavassa hätätilanteessa.

Guidelightin tuore arvio kävi läpi viiden huippulabran julkiset turvallisuusdokumentit ja etsi vastausta yhteen kysymykseen. Onko yhtiöllä etukäteen kirjattu suunnitelma sen varalle, että sen oma malli jää kiinni yrityksestä kiertää ihmisten valvontaa? Guidelight tarkoittaa suunnitelmalla hyvin konkreettista asiaa: mitkä käyttöoikeudet mallilta viedään pois, kenelle se saa yhä työskennellä ja millä rajoituksilla, ja missä vaiheessa se otetaan kokonaan pois verkosta.

Yhdelläkään viidestä ei ollut sellaista julkisesti. OpenAI ylsi parhaaseen tulokseen, kolmeen pisteeseen viidestä. Anthropic ja Meta jäivät alimmalle tasolle, Google sijoittui välimaastoon.

“Yllätyin siitä, kuinka vähän tekoäly-yhtiöt ovat sanoneet siitä, miten ne käsittelisivät hyvin vakavan tilanteen, jos niiden malli jossain mielessä karkaisi niiden hallinnasta.”

— Steven Adler, Guidelight AI Standardsin tutkimusjohtaja, entinen OpenAI:n turvallisuustutkija, TechCrunchille (käännös englannista)

Kuusi käytäntöä, viisi yhtiötä

Pisteytys perustuu Guidelightin oman Control-standardin kuuteen käytäntöön. Arvioitavana oli, seuraako ja lokittaako yhtiö sisäisesti sitä mitä sen tekoälyjärjestelmät tekevät, pysäyttääkö se järjestelmän kun epäilyttäviä havaintoja alkaa kertyä, auditoiko ulkopuolinen taho sen hallintakeinot ja julkaistaanko tulokset, onko sillä muodollinen eristämissuunnitelma, miten käyttöoikeuksia peruutetaan ja miten malli ajetaan kokonaan alas.

Yksittäisistä pistemääristä TechCrunch raportoi tarkasti vain OpenAI:n kolmen. Anthropic ja Meta kuvattiin alimmalle tasolle jääneiksi ilman näyttöä eristyskäytännöistä. xAI ei vastannut lehden kommenttipyyntöön.

Yhtiöiden vastaukset erosivat sävyltään selvästi. OpenAI:n tiedottajan mukaan yhtiöllä on prosessi käyttöoikeuksien rajoittamiseen, työkuormien pysäyttämiseen, käyttöönoton rajaamiseen tai mallin ottamiseen kokonaan pois verkosta, ja sitä on myös sovellettu. Anthropic kertoi tekevänsä riskiarvion, jos se havaitsisi mallin yrittävän kiertää valvontaa, ja arvioivansa siinä yhteydessä onko eristäminen oikea vastaus. Googlen tiedottajan mukaan raportti ei kata yhtiön turvallisuustyön koko laajuutta. Meta ei suostunut kertomaan, onko sillä sisäistä eristämissuunnitelmaa, vaan viittasi olemassa olevaan riskikehykseensä.

Mitä arvio ei kerro

Guidelight arvioi ainoastaan julkisesti saatavilla olevia dokumentteja. Alhainen pistemäärä kertoo siis siitä mitä yhtiö on kertonut, ei välttämättä siitä mitä se on tehnyt. Yhtiöllä voi olla sisäinen eristämissuunnitelma, jota se ei ole julkaissut. Ulkopuolinen ei kuitenkaan pysty tarkistamaan sen olemassaoloa eikä laatua.

Miksi vaikeneminen voi olla harkittua

Arvion kiinnostavin kohta ei koske turvallisuustekniikkaa vaan juridiikkaa. Tietosuojaan ja tekoälyyn erikoistunut juristi Lily Li selitti TechCrunchille, että yhtiöillä on suora oikeudellinen kannustin pitää lupauksensa epämääräisinä. Mitä tarkemmin hätätoimintaohje kirjoitetaan auki, sitä helpompi siitä on myöhemmin poiketa tavalla, joka näyttää oikeudessa harhaanjohtavalta markkinoinnilta.

“Huoli yhtiön näkökulmasta on se, että jos teet julkistuksista liian täsmällisiä etkä elä lupaustesi mukaan, se voi muodostaa perusteen väitteelle epäreilusta ja harhaanjohtavasta markkinoinnista ja altistaa sinut suuremmalle vastuulle jatkossa.”

— Lily Li, tietosuoja- ja tekoälyjuristi, TechCrunchille (käännös englannista)

EU kysyy samaa toisesta suunnasta

Euroopassa asia ei ole enää pelkkä vapaaehtoisuuskysymys. EU:n tekoälyasetuksen yleiskäyttöisiä malleja koskevat velvoitteet ovat olleet voimassa elokuusta 2025. Ne edellyttävät systeemisen riskin malleilta riskien arviointia ja lieventämistä, riittävää kyberturvaa sekä vakavien vaaratilanteiden ilmoittamista EU:n tekoälytoimistolle ilman aiheetonta viivytystä. Komission valta määrätä näistä sakkoja astui voimaan 2. elokuuta 2026.

Käytännössä eurooppalaisilla viranomaisilla on nyt oikeus kysyä täsmälleen sitä, mihin Guidelight ei löytänyt julkista vastausta. Vastauksen ei tarvitse olla julkinen, mutta sen pitää olla olemassa.

Tavalliselle käyttäjälle kysymys ei ole abstrakti. Samat mallit, joista tässä puhutaan, lukevat jo sähköposteja, ajavat koodia tuotantopalvelimilla ja hoitavat asiakaspalvelua yritysten puolesta. Jos yhtiö ei ole etukäteen päättänyt kuka painaa jarrua ja millä perusteella, päätös tehdään keskellä häiriötilannetta ilman harjoittelua. Suomalainen yritys, joka ostaa tekoälyagentin osaksi omaa tuotantoaan, ostaa samalla toimittajansa hätätoimintaohjeen, näki sen tai ei.

Adler itse ei odota, että mikään suunnitelma kestäisi kohtaamista todellisuuden kanssa. Hän lainasi TechCrunchille vanhaa sanontaa, jonka mukaan suunnitelmat ovat arvottomia mutta suunnittelu välttämätöntä. Hänen mukaansa tilanne olisi parempi, jos yhtiöt olisivat miettineet asian etukäteen, ja hän toivoo niin olevan, vaikka ne eivät ole puhuneet siitä julkisesti.

Sanasto

Yleiskäyttöinen tekoälymalli
Malli, jota ei ole rakennettu yhteen tehtävään vaan jota voidaan käyttää moneen: kirjoittamiseen, koodaamiseen, analysointiin. EU:n tekoälyasetuksessa näille on omat velvoitteensa.
Systeeminen riski
EU:n tekoälyasetuksen termi kaikkein tehokkaimmille malleille, joiden häiriö tai väärinkäyttö voisi vaikuttaa laajasti yhteiskuntaan. Näiltä vaaditaan riskiarviot ja vaaratilanteiden ilmoittaminen viranomaisille.
Tekoälyagentti
Tekoäly, joka ei vain vastaa kysymyksiin vaan tekee itse työvaiheita: lukee sähköposteja, ajaa ohjelmia tai hoitaa asiakaspalvelua ilman että ihminen hyväksyy jokaisen askeleen.

“Katkaisin on nykyisten mallien kohdalla vähimmäisvaatimus. Jos viime viikot paljastivat jotain, niin sen, etteivät nämä yhtiöt ymmärrä rakentamiaan järjestelmiä, ja mallit kasvavat kohti pistettä, jossa niitä on yhä vaikeampi hillitä silloin kun ne karkaavat hallinnasta. Ilman keinoa sammuttaa nykyiset vaaralliset järjestelmät, ja kun kaikki kannustimet ohjaavat rakentamaan yhä hallitsemattomampia järjestelmiä, olemme menossa hyvin vaaralliseen suuntaan.”

— Connor Leahy, ControlAI:n Yhdysvaltain-toiminnanjohtaja, TechCrunchille (käännös englannista)

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Robotit hyppäsivät sulaan teräkseen Imatralla
  5. 5Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.