Anthropic julkisti maanantaina Claude Code Review -työkalun, joka lähettää joukon tekoälyagentteja katselmoimaan pull requesteja rinnakkain. Järjestelmä integroituu suoraan GitHub:iin ja käynnistyy automaattisesti, kun uusi pull request avataan. Useat agentit tarkastavat koodimuutokset eri lähtökohdista, suodattavat löydökset verifiointivaiheessa ja priorisoivat ne vakavuuden mukaan.
Sisäisissä testeissä työkalu löysi yli tuhannen rivin muutoksista keskimäärin 7,5 ongelmaa. Alle prosentti havainnoista osoittautui vääriksi positiivisiksi. Kyseessä on Anthropicin vastaus ongelmaan, joka on kasvanut tekoälyavusteisen koodauksen myötä: pull requesteja syntyy nopeammin kuin kehitystiimit ehtivät katselmoida.
Rinnakkaiset agentit, eri näkökulmat
Perinteisessä koodikatselmoinnissa yksi kehittäjä selaa muutokset läpi ja yrittää huomata kaiken kerralla. Claude Code Review pilkkoo tehtävän osiin. Kun pull request avataan, järjestelmä lähettää useita agentteja tarkastamaan koodia samanaikaisesti. Kukin agentti etsii erityyppisiä ongelmia: logiikkavirheitä, tietoturva-aukkoja, rikkoutuvia reunatapauksia ja hienovaraisia regressioita. Kyse ei ole pelkästä lint-tarkistuksesta, vaan agentit analysoivat koodin toiminnallista logiikkaa.
Löydökset eivät päädy suoraan kehittäjän näytölle. Jokainen havainto käy läpi erillisen verifiointivaiheen, jossa se tarkistetaan koodin todellista käyttäytymistä vasten. Tämä vaihe on keskeinen syy siihen, miksi väärät positiiviset jäävät alle prosenttiin. Vasta suodatuksen jälkeen ongelmat priorisoidaan vakavuuden mukaan ja esitetään kehittäjälle yhteenvetona sekä rivikohtaisina kommentteina.
Järjestelmä skaalautuu muutoksen koon mukaan. Isommat pull requestit saavat syvemmän analyysin useammalta agentilta, kun taas pieniä korjauksia katselmoidaan kevyemmin. Keskimääräinen katselmointiaika on noin 20 minuuttia, mikä on murto-osa ihmiskatselmoijan käyttämästä ajasta.
Luvut puhuvat puolestaan
Anthropicin sisäisessä testauksessa 84 prosenttia isoista, yli tuhannen rivin pull requesteista sai löydöksiä, keskimäärin 7,5 ongelmaa per katselmointi. Pienemmissä, alle 50 rivin muutoksissa löydöksiä sai 31 prosenttia ja keskiarvo jäi puoleen ongelmaan. Työkalu mukautuu koodimuutoksen kokoon eikä yritä löytää ongelmia sieltä, missä niitä ei ole.
Alle prosentti työkalun havainnoista merkittiin virheellisiksi. Se on poikkeuksellisen matala taso automaattiselle koodianalyysille. Monet staattiset analyysityökalut tuottavat niin paljon kohinaa, että kehittäjät lopettavat niiden käytön kokonaan.
Merkityksellisten katselmointikommenttien osuus nousi Anthropicin sisäisessä käytössä 16 prosentista 54 prosenttiin. Käytännössä yli puolet pull requesteista saa nyt konkreettista, koodin laatua parantavaa palautetta. Aiemmin osuus oli vain kuudesosa, joten kasvu on yli kolminkertainen.
Anthropic ei ole toistaiseksi julkaissut tarkkaa vakavuusjakaumaa löydöksistä, esimerkiksi sitä, kuinka suuri osa on kriittisiä tietoturva-aukkoja ja kuinka moni matalan riskin laatuhuomio. Tämä tieto olisi erityisen arvokasta organisaatioille, jotka haluavat arvioida työkalun turvallisuuslisäarvoa.
Koodikatselmointi on kallis pullonkaula
Stack Overflow:n kehittäjäkyselyn mukaan keskiverto ohjelmistokehittäjä käyttää koodikatselmointiin noin viisi tuntia viikossa. Tutkimusten mukaan yli 500 koodirivin tarkistaminen tunnissa heikentää virheiden havaitsemista merkittävästi. Tuhannen rivin pull request vaatii ihmiseltä 2,5–5 tuntia huolellista läpikäyntiä.
Claude Code Review tekee saman noin 20 minuutissa ja veloittaa 15–25 dollaria per katselmointi. Hinta skaalautuu muutoksen koon ja monimutkaisuuden mukaan. Kun kehittäjän kokonaistuntikustannus liikkuu 100–170 dollarissa, kolmen tunnin manuaalinen katselmointi maksaa yritykselle 300–510 dollaria. Ero on yli kymmenkertainen.
Kustannusero korostuu organisaatioissa, joissa tekoälyavusteinen koodaus on kasvattanut pull requestien määrää nopeammin kuin katselmointikapasiteetti. Katselmoinnista on tullut pullonkaula, joka hidastaa koodin etenemistä tuotantoon. Automaattinen katselmointi purkaa jonoa ja antaa kehittäjille mahdollisuuden korjata ongelmat ennen kuin ihmiskatselmoija edes avaa muutokset.



