Tutkimus

Koodausagentti korjaa bugin ja rikkoo kolme muuta

Ensimmäinen pitkäaikaistesti paljastaa tekoälykoodarien heikon kohdan

Hanna HuulivuoHanna Huulivuo
Jaa:
Koodausagentti korjaa bugin ja rikkoo kolme muuta

Yksittäinen korjaus onnistuu, pitkäaikaisylläpito ei

Tekoälykoodausagentit pärjäävät hyvin yksittäisten bugien korjaamisessa. Aiemmat vertailutestit kuten SWE-bench ovat osoittaneet tämän toistuvasti, ja tulokset paranevat jokaisen mallisukupolven myötä.

Mutta entä kun sama agentti joutuu ylläpitämään koodipohjaa kuukausien ajan? Sun Yat-sen-yliopiston ja Alibaban tutkijat kehittivät SWE-CI-vertailutestin, jossa 18 tekoälymallia kahdeksalta tarjoajalta testattiin sadan oikean Python-koodipohjan ylläpidossa. Mukana olivat muun muassa Clauden, GPT:n, DeepSeekin ja Qwenin malleja. Testiajoissa kului yhteensä yli kymmenen miljardia tokenia.

Tulos oli tyly: valtaosa malleista rikkoi aiemmin toiminutta koodia yli 75 prosentissa tehtävistä. Maaliskuun alussa arXiv-palvelussa julkaistu tutkimus kyseenalaistaa käsityksen siitä, että koodausagentit olisivat valmiita pitkäaikaiseen ylläpitotyöhön.

Kahdeksan kuukautta todellista kehityshistoriaa

SWE-CI eroaa aiemmista koodaustesteistä perustavanlaatuisesti. SWE-bench mittaa yksittäisen vikaraportin korjausta, mutta SWE-CI seuraa agentin suoriutumista pitkällä aikavälillä. Jokainen sadan tehtävän joukosta kattaa keskimäärin 233 päivän kehityshistorian ja 71 peräkkäistä committia oikeasta avoimen lähdekoodin repositoriosta.

Tutkijat aloittivat lähes 5 000 Python-repositoriosta ja karsivat ne 68 repositorion sataan tehtävään. Kriteereinä olivat vähintään kolmen vuoden aktiivinen kehityshistoria, yli 500 GitHub-tähteä ja vähintään 500 muutettua koodiriviä. Kyse on todellisista, tuotannossa käytettävistä ohjelmistoista.

Testissä käytetään kaksoisagenttiprotokollaa: arkkitehtiagentti tunnistaa puutteet ja tuottaa vaatimukset, ohjelmoija-agentti toteuttaa ne. Jokaisen muutoksen jälkeen ajetaan CI-testit. Yksittäisessä tehtävässä on enintään 20 iteraatiokierrosta, ja jokainen kierros paljastaa välittömästi, rikkooko uusi korjaus jotain aiempaa.

Asetelma vastaa huomattavasti paremmin todellista ohjelmistokehitystä kuin yksittäisen bugin korjaus. Oikeassa projektissa muutokset kasautuvat, vaatimukset muuttuvat ja koodipohja monimutkaistuu ajan myötä.

Vain yksi malli ylittää 50 prosentin rajan

Tutkimuksen keskeisin mittari on nollaregressioaste: kuinka suuressa osassa tehtävistä malli ei rikkonut yhtään aiemmin läpäistyä testiä. Useimpien mallien nollaregressioaste jäi alle 0,25:n. Käytännössä ne rikkoivat aiemmin toiminutta koodia yli kolmessa neljästä tehtävästä.

Ainoastaan Anthropicin Claude Opus -mallisarja ylitti 50 prosentin rajan. GLM-5 pärjäsi toiseksi parhaiten mutta jäi sekin selvästi jälkeen. GPT, DeepSeek, Qwen, Kimi, MiniMax ja Doubao jäivät kaikki kauas 50 prosentin rajasta.

Tutkijat kehittivät myös EvoScore-mittarin, joka painottaa myöhempien iteraatioiden tuloksia vahvemmin kuin alkuvaiheen suorituksia. Mittari paljasti kiinnostavan strategiaeron mallien välillä: GPT, DeepSeek ja MiniMax suosivat pitkän aikavälin vakautta, kun taas Kimi ja GLM pärjäsivät paremmin lyhyen aikavälin painotuksella. Claude ja Qwen pysyivät vakaina painotuksesta riippumatta, mikä viittaa tasaisempaan suorituskykyyn koko ylläpitojakson ajan.

Agentti näkee vain nykyhetken

Miksi agentit epäonnistuvat ylläpidossa? Tutkijoiden vastaus on suoraviivainen: agentit ovat paikallisia optimoijia. Kun agentti kohtaa epäonnistuneen testin, se korjaa juuri sen ongelman. Se ei mallinna, miten muutos vaikuttaa koodipohjan muihin osiin ja aiemmin läpäistyihin testeihin.

Ihmiskehittäjä tuntee koodin historian ja ymmärtää moduulien väliset riippuvuudet. Tekoälyagentti käsittelee jokaisen iteraation ikään kuin se olisi ensimmäinen kerta. Se ratkaisee yhden ongelman ja luo samalla uusia.

Ohjelmistoyrityksille tämä on konkreettinen varoitus. Tuotantokoodia ylläpidetään vuosia, ja korjaus joka rikkoo toisen ominaisuuden voi käynnistää vikaketjun. Jos agentti rikkoo enemmän kuin korjaa, sen käyttö ilman jatkuvaa ihmisvalvontaa on riski. SWE-CI osoittaa, että tällä hetkellä näin käy useimmilla malleilla.

75 %+↓

Tehtävistä aiheutti regressioita (valtaosa malleista)

1/18

Malli ylitti 50 %:n nollaregressiorajan

100

Todellista Python-koodipohjaa testissä

233 pv

Kehityshistoriaa keskimäärin per tehtävä

SWE-CI, arXiv, 2026

Sanasto

Token
Tekstin perusyksikkö jonka kielimalli käsittelee. Yksi token on suomeksi noin puoli sanaa.

Työkalu vai kollega?

SWE-CI ei tarkoita, että koodausagentit olisivat hyödyttömiä. Ne toimivat hyvin rajatuissa tehtävissä: nopeissa korjauksissa, prototyyppien rakentamisessa ja kertakäyttöisessä koodissa. Ongelma syntyy vasta, kun agenttia kohdellaan itsenäisenä kehittäjänä.

Claude Opuksen menestys osoittaa, ettei regressioiden hallinta ole ratkaisematon ongelma. Tutkijat havaitsivat myös, että uudemmat mallit tekivät edeltäjiään selvästi suurempia edistysaskelia. Kehityssuunta on oikea, mutta tällä hetkellä yksikään malli ei selviä pitkäaikaisylläpidosta ilman ihmisen katselmointia.

Alan keskustelussa SWE-CI on herättänyt vilkasta huomiota, koska se mittaa ensimmäisenä sitä mitä tuotantokäytössä oikeasti tarvitaan: kykyä ylläpitää koodia kuukausien ajan ilman, että kokonaisuus hajoaa. Suomalaisille ohjelmistotaloille viesti on selkeä. Koodausagentti on tehokas apuväline, mutta ei vielä itsenäinen tiimin jäsen. Pelkkä testien läpäisy ei kerro, onko koodipohja ehjä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.