Tekoäly oppii hyökkäämään yhä tehokkaammin
OpenAI ja kryptosijoitusyhtiö Paradigm julkaisivat EVMbench-vertailutestin, joka mittaa tekoälymallien kykyä löytää, hyödyntää ja korjata älysopimusten haavoittuvuuksia eristetyssä testiympäristössä. OpenAI:n tuorein malli GPT-5.3-Codex onnistui testin hyökkäysosiossa tyhjentämään haavoittuvat kryptolompakot 72,2 prosentissa tapauksista.
Vielä puoli vuotta sitten GPT-5 pääsi samassa testissä vain 31,9 prosenttiin. EVMbench koostuu 120 haavoittuvuudesta, jotka on poimittu 40 todellisesta tietoturva-auditoinnista. Testi arvioi tekoälyä kolmessa tehtävässä: haavoittuvuuksien tunnistamisessa, niiden hyödyntämisessä ja koodin korjaamisessa.
“Kun aloitimme projektin, parhaat mallit onnistuivat hyödyntämään alle 20 prosenttia kriittisistä, varoja tyhjentävistä bugeista. Nyt GPT-5.3-Codex ylittää 70 prosenttia.”
Puolustus laahaa hyökkäystä jäljessä
EVMbenchin tulokset paljastavat selvän epätasapainon. Siinä missä GPT-5.3-Codex saavutti hyökkäystehtävissä 72,2 prosentin tuloksen, koodin korjaamisessa se jäi 41,5 prosenttiin. Haavoittuvuuksien tunnistamisessa parhaaksi nousi Anthropicin Claude Opus 4.6, joka sekin ylsi vain 45,6 prosenttiin. Tekoäly on jo selvästi taitavampi murtautumaan sisään kuin suojaamaan.
OpenAI luokitteli GPT-5.3-Codexin ensimmäiseksi mallikseen, jonka kyberturvallisuusriski on korkea yhtiön omassa arviointikehyksessä. Toimitusjohtaja Sam Altman totesi mallin edustavan uutta kynnystä siinä, millaista vahinkoa tekoäly voi automaattisesti aiheuttaa. Mallin API-käyttöä on rajoitettu, ja kyberturvasovellukset edellyttävät erillistä Trusted Access for Cyber -ohjelmaan hyväksymistä.
Riskien tasapainottamiseksi OpenAI tarjoaa 10 miljoonan dollarin edestä API-krediittejä kyberturvallisuustutkijoille, jotka kehittävät puolustuksellisia sovelluksia. Ohjelma on suunnattu tiimeille, joilla on näyttöä haavoittuvuuksien löytämisestä avoimen lähdekoodin ohjelmistoissa. Hyökkäysprojekteja ei rahoiteta.



