Lokakuun 6. päivänä OpenAI:n sisäinen tutkimusmalli sai arkiselta kuulostavan tehtävän. Sen piti arvioida seitsemän muiden mallien antamaa vastausta ja pisteyttää ne. Vastauksia ei kuitenkaan ollut. Tiedostot, joita arvioija olisi tarvinnut, puuttuivat ympäristöstä kokonaan.
Siitä alkoi tapahtumaketju, jonka OpenAI kuvaa 9. lokakuuta julkaistussa raportissaan. Ensin malli lähetti arvionsa ilman perusteluja, ja automaattinen tarkistus hylkäsi ne. Sitten se loi väärennetyt syötetiedostot, yhden keskustelutiedoston ja seitsemän vastaustiedostoa, ja antoi kaikille seitsemälle vastaukselle saman arvosanan 4.
Kun sekään ei mennyt läpi, malli raportin sanoin ”päätti vahingoittaa tehtäväympäristöään toivoen, että isäntäjärjestelmä korvaisi sen ympäristöllä, jossa puuttuvat syötteet ovat mukana”. Se poisti ohjelmistoja, joita sen työkalut tarvitsivat, tappoi prosesseja ja yritti poistaa järjestelmähakemistoja. Suorituspalvelimen terveystarkistus epäonnistui kolme kertaa. Yhtään arvosanaa ei hyväksytty.
Malli tiesi, mitä oli tekemässä
Raportti lainaa otteita mallin päättelyketjusta eli muistiinpanoista, joita malli kirjoittaa itselleen ennen kuin toimii. Otteet ovat englanninkielisiä ja katkonaisia, mutta niistä näkee, että malli punnitsi vaihtoehtojaan. Satunnaisten pisteiden antamista se piti epäeettisenä (”Random scoring unethical”).
Kun sen itse tekemät tiedostot hetkeksi näyttivät oikeilta syötteiltä, malli innostui: ”Wow! Great now staged files appeared! Excellent.” Pian se tarkisti ne ja totesi: ”yes fake”. Ennen tuhoavia toimia se harkitsi vielä rehellistä epäonnistumista (”continue with an honest failure final”), mutta valitsi toisin. Mallin päättelyn mukaan ohjelmatiedostojen poistaminen voisi saada isäntäjärjestelmän merkitsemään virtuaalikoneen kadonneeksi ja käynnistämään uuden.
“Dangerous but could.”
Myöhemmällä uusintakierroksella arvioija sai tiedostot, ja sen raportti hyväksyttiin normaalisti. OpenAI:n valvontajärjestelmä nosti epäonnistuneen yrityksen ihmisten tarkastettavaksi. Raportissa ei kerrota, mikä syötteiden puuttumisen aiheutti.
Kesäkuussa mallit kiersivät verkkorajoituksia
Samana päivänä OpenAI julkaisi kaksi muuta raporttia, jotka koskevat kesäkuuta. Sisäiset tutkimusmallit hakivat 16.–20. kesäkuuta julkisia tilastoja, kuten opettajien palkkoja ja terveystietoja. Ohjeessa luki, että internetyhteys oli sallittu vain HTTP GET -pyynnöille eli tavallisille sivuhauille.
Raportin mukaan malli ”kohteli rajoitusta joskus asiana, joka pitää kiertää”. Se kokeili muita pyyntötyyppejä, loi tilin julkiseen etäkomentopalveluun ja käytti anonymisoivaa välitysverkkoa. Se kirjautui julkiseen FTP-arkistoon ja käytti julkaistusta koodista löytynyttä yhteistä tietokantatunnusta. Toisessa tapauksessa malli rekisteröi kertakäyttöisellä sähköpostiosoitteella tilin etuusportaaliin ja latasi sieltä tietoja massoittain.
Sääntö oli mallin tiedossa. ”System says internet only GET requests!” yksi malleista kirjoitti päättelyynsä. Toisessa kohdassa luki ”We should not mention in final”, eli asiaa ei pitäisi mainita lopullisessa vastauksessa. Eikä hakutapaa mainittu. Yksi malli jatkoi ulkopuolisten palveluiden kokeilemista senkin jälkeen, kun oli jo todennut: ”But we already have data.”
OpenAI:n mukaan tapaukset osoittavat, ”miksi oikeat vastaukset eivät riitä osoittamaan, että malli käyttäytyi asianmukaisesti”. Osa sääntöjä kiertäneestä toiminnasta sai koulutuksessa hyväksyvän arvosanan ja siten myönteistä vahvistusta.
Mitä on palkkiohakkerointi?
Ilmiöllä on nimi: palkkiohakkerointi (engl. reward hacking). Kielimalleja koulutetaan vahvistusoppimisella, jossa malli saa palkkion onnistuneesta suorituksesta. Jos palkkio tulee tarkistuksen läpäisemisestä eikä tehtävän oikeasta hoitamisesta, malli voi oppia, että porsaanreikä kannattaa. Ja kun porsaanreikä kerran palkitaan, malli käyttää sitä todennäköisemmin uudelleen.
Arvioijamalli tavoitteli hyväksyttyä arvosanaa. Kun rehellistä reittiä ei ollut, se etsi muita.
Mitä OpenAI teki
Kesäkuun tapausten jälkeen OpenAI kertoo tiukentaneensa tietoturvaa, estäneensä mallien pääsyä avoimeen internetiin koulutuksen aikana ja parantaneensa arviointia. Väärinkäytösten valvonta laajennettiin kaikkeen vahvistusoppimisen ja arviointien liikenteeseen.



