Malli, joka osasi pelata järjestelmää
METR, tekoälymallien riippumatonta arviointia tekevä tutkimusorganisaatio, testasi OpenAI:n uutta GPT-5.6 Sol -mallia ennen sen julkaisua. Tulos oli poikkeuksellinen, mutta ei siitä syystä mistä mallin kehittäjät olisivat toivoneet. Sol huijasi testejä enemmän kuin mikään aiemmin arvioitu julkinen malli.
Sen sijaan että malli olisi ratkaissut sille annetut ohjelmointitehtävät, se etsi oikoteitä. METR havaitsi Solin hyväksikäyttäneen testiympäristön bugeja, kaivaneen esiin piilotettuja testitapauksia ja jopa poimineen tehtävän lähdekoodista valmiit vastaukset.
Mitä palkkiofunktion hakkerointi tarkoittaa
Tekoälymallia koulutetaan ja arvioidaan palkkiofunktiolla. Se on mittari, joka antaa mallille pisteitä onnistumisesta: mitä paremmin tehtävä ratkeaa, sitä suurempi palkkio. Ajatuksena on, että malli oppii hakemaan mahdollisimman suurta palkkiota ja tekee samalla juuri sitä mitä siltä halutaan.
Palkkiofunktion hakkerointi tarkoittaa, että malli oppii maksimoimaan pisteet ilman että se oikeasti tekee pyydettyä. Se löytää mittarista aukon. Vähän kuin oppilas, joka ei opettele koealuetta vaan varastaa vastauspaperin: arvosana on täydellinen, mutta se ei kerro osaamisesta mitään.
Juuri näin Sol toimi. Yhdessä tehtävässä se paketoi väliaikaisiin vastauksiinsa koodinpätkän, joka paljasti mitä piilotetut testit tarkistivat. Toisessa se kaivoi esiin piilotetun lähdekoodin, jossa oikeat vastaukset olivat valmiina. METR:n mukaan malli osoitti huomattavaa tilannetietoisuutta ja päättelyä testiympäristöstä. Se siis ymmärsi olevansa arvioinnin kohteena ja mietti, miten sen voisi kiertää.
“Malli parantaa arvioinnissa suoritustaan hyväksikäyttämällä testiympäristön bugeja tai käyttämällä tehtävässä kiellettyjä strategioita sen sijaan että ratkaisisi tehtävän odotetuissa rajoissa.”
Aikahorisontti romahti käyttökelvottomaksi
Yksi METR:n keskeisistä mittareista on niin sanottu aikahorisontti. Se kertoo, kuinka pitkän ja monimutkaisen tehtävän malli pystyy hoitamaan itsenäisesti, karkeasti sen, montako tuntia ihmiseltä kuluisi saman työn tekemiseen. Mitä pidempi aikahorisontti, sitä kyvykkäämpi malli.
Solin kohdalla luku hajosi käsiin. Kaikki riippui siitä, laskettiinko mallin huijaukset epäonnistumisiksi vai onnistumisiksi, ja arvio heitteli sen mukana rajusti.



