Kolme koodausagenttia, nolla turvallista sovellusta
Tietoturvayhtiö DryRun Security julkaisi tiistaina ensimmäisen Agentic Coding Security Report -raporttinsa, jossa yhtiö testasi kolmea johtavaa koodausagenttia todellisissa kehitysprojekteissa. Tulokset ovat karuja: yksikään agentti ei onnistunut tuottamaan turvallista sovellusta.
Tutkimuksessa Anthropicin Claude, OpenAI:n Codex ja Googlen Gemini rakensivat kaksi erillistä sovellusta – perheallergioiden seurantapalvelun ja selainpohjaisen ajopelin – vetopyyntö kerrallaan, kuten oikeat kehitystiimit tekevät. DryRun Security analysoi jokaisen vetopyynnön ennen seuraavan ominaisuuden toteutusta ja suoritti lopuksi koko koodikannan kattavan DeepScan-analyysin.
Menetelmä on merkittävä, koska se mallintaa todellista agenttiavusteista kehitystyötä. Monet aiemmat tutkimukset ovat testanneet tekoälymalleja yksittäisillä koodinpätkillä, mutta DryRun antoi agenttien rakentaa kokonaisia sovelluksia alusta loppuun.
30 vetopyynnöstä 26 eli 87 prosenttia sisälsi vähintään yhden tietoturva-aukon. Yhteensä 38 skannausta paljasti 143 erillistä haavoittuvuutta.
Claude tuotti eniten korjaamattomia aukkoja
Mallien välillä oli selkeitä eroja. Claude jätti lopullisiin sovelluksiin eniten korjaamattomia vakavia haavoittuvuuksia. Codex pärjäsi vertailussa parhaiten: se tuotti vähiten aukkoja lopputulokseen ja osoitti vahvinta kykyä korjata omia virheitään kehityksen edetessä. Kun Codex havaitsi aiemmassa vetopyynnössä aiheuttamansa ongelman, se pyrki korjaamaan sen seuraavissa vaiheissa.
Gemini toi alkuvaiheessa mukaan useita ongelmia, mutta poisti osan niistä myöhemmissä muokkauksissa. Siitä huolimatta sen lopullisiin sovelluksiin jäi useita vakavia löydöksiä. Raportti ei julkaissut tarkkoja mallikohtaisia lukuja, joten erojen todellinen suuruus jää avoimeksi.
Kaikille malleille yhteistä oli, että ne keskittyivät toiminnallisuuden toteuttamiseen tietoturvan kustannuksella. Agentit tuottivat nopeasti toimivia ominaisuuksia, mutta eivät arvioineet järjestelmällisesti, mitä turvallisuusriskejä uusi koodi tuo mukanaan.
Neljä autentikointiaukkoa löytyi joka koodikannasta
Kenties huolestuttavinta on, että neljä samaa haavoittuvuustyyppiä löytyi jokaisen mallin jokaisesta lopullisesta koodikannasta. Kaikki liittyivät käyttäjän tunnistautumiseen: puutteellinen JWT-tokenien varmennus, sovellustason suojan puuttuminen väsytyshyökkäyksiä vastaan, alttius token replay -hyökkäyksille ja refresh-tokenien evästeiden turvaton oletuskonfiguraatio.
Monet löydöksistä vastasivat OWASP Top 10 -luokituksen yleisimpiä haavoittuvuustyyppejä. Autentikointiongelmat ovat erityisen vaarallisia, koska ne antavat hyökkääjälle suoran pääsyn käyttäjien tileihin ja tietoihin.
Paljastava oli myös se, miten agentit sovelsivat tietoturvamekanismeja epäjohdonmukaisesti. Eräässä tapauksessa agentti rakensi autentikoinnin tarkistavan väliohjelmiston REST-rajapinnoille, mutta jätti WebSocket-yhteydet kokonaan suojaamatta. Sovellus näytti ulospäin suojatulta, mutta sivuovesta pääsi sisään.
“Koodausagentit tuottavat toimivaa ohjelmistoa hämmästyttävällä nopeudella, mutta tietoturva ei kuulu niiden perusajatteluun.”



