Viikko ilman kahvitaukoja
Nvidia julkaisi tutkimuksen, joka antaa aihetta arvioida uudelleen ihmisen roolia koodin optimoinnissa. AVO eli Agentic Variation Operators on tekoälyagentti, joka optimoi GPU-laskentaytimiä itsenäisesti ilman ihmisen ohjausta tai väliintuloa.
Tutkimusryhmä antoi agentille yhden tehtävän: parantaa attention-laskentaytimien suorituskykyä Nvidian Blackwell B200 -siruilla. Agentti sai käyttöönsä CUDA-ohjelmointioppaat, Blackwell-arkkitehtuurin dokumentaation ja FlashAttention-4:n lähdekoodin. Sen jälkeen ihmiset poistuivat huoneesta.
Seitsemän vuorokautta myöhemmin agentti oli tutkinut yli 500 erilaista optimointisuuntaa ja kehittänyt 40 peräkkäistä ydinversiota. Se profiloi koodia, tunnisti pullonkauloja, kokeili ratkaisuja ja aloitti uudelleen, kun jokin meni pieleen. Kehitys eteni portaittain: viisi suurta arkkitehtuurista läpimurtoa, joiden välillä agentti hioi yksityiskohtia.
AVO perustuu evoluutioalgoritmien ideaan, mutta korvaa perinteiset mutaatio- ja risteytysmenetelmät tekoälyagentilla. Perinteisessä evoluutiohaussa ohjelma kokeilee satunnaisia muutoksia ja valitsee parhaat. AVO:n agentti toimii toisin: se lukee dokumentaatiota, analysoi aiempien versioiden heikkoudet ja tekee harkittuja muutoksia profiilidatan perusteella.
Numerot puhuvat
AVO:n kehittämät attention-ytimet osoittautuivat jopa 3,5 prosenttia nopeammiksi kuin Nvidian oma cuDNN-kirjasto ja jopa 10,5 prosenttia nopeammiksi kuin FlashAttention-4. Paras ydin saavutti 1 668 teraflopsin laskentatehon BF16-tarkkuudella. Molemmat vertailukohteet ovat vuosien ihmistyöllä hiottuja huippukirjastoja, joita hyödynnetään käytännössä jokaisessa suuressa kielimallissa.
Agentin löytämät optimoinnit siirtyivät nopeasti myös toiseen tehtävään. Kun AVO sai soveltaa oppimaansa grouped-query attention -tekniikkaan, se tarvitsi vain 30 minuuttia itsenäistä työtä. Tulos: 7,0 prosentin parannus cuDNN:ään ja 9,3 prosentin parannus FlashAttention-4:ään verrattuna.
Agentti löysi kolme optimointia, joita ihmistiimit eivät olleet keksineet. Suurin yksittäinen parannus oli haaraton akkumulaattorien uudelleenskaalaus, joka yksinään nopeutti laskentaa 8,1 prosenttia. Agentti lomitti myös laskentavaiheiden ajastusta ja tasapainotti rekistereitä prosessorin warp-ryhmien välillä. Nämä ovat matalan tason arkkitehtuurioptimointeja, jotka vaativat syvällistä ymmärrystä sekä laitteistosta että ohjelmistosta.
Sokea koodaus
Tutkimuksen taustalla on käsite, jota tekijät kutsuvat sokeaksi koodaukseksi. Tutkijat Xu Bing ja Terry Chen aloittivat AVO-projektin puolitoista vuotta sitten. Lähtökohtana oli rakentaa järjestelmä, jossa kukaan ihminen ei koskaan näe tai muokkaa agentin tuottamaa koodia kesken prosessin.
AI-koodaustyökalut kuten GitHub Copilot ja Claude Code toimivat nykyään ihmisen apuna: ne ehdottavat koodia, jonka ohjelmoija tarkistaa ja hyväksyy. AVO kääntää asetelman päälaelleen. Agentti tekee kaikki päätökset itse, ja ihminen näkee vain lopputuloksen.
Xu Bingin mukaan AVO edustaa "ensimmäistä todellista ylihmisen tason suoritusta ohjelmistokentällä". Väite on rohkea. Vertailun vuoksi: tekoälyagentit ovat oppineet korjaamaan ohjelmistovirheitä yhä tehokkaammin, ja SWE-bench Verified -testissä parhaat mallit ylittävät jo 80 prosentin rajan. AVO vie kunnianhimon eri tasolle, sillä kyse ei ole virheiden korjaamisesta vaan uusien, ihmisasiantuntijat päihittävien ratkaisujen luomisesta.
Attention on valittu tutkimuskohteeksi tarkoituksella. Se on yksi aggressiivisimmin optimoiduista laskentaytimistä koko tekoälyinfrastruktuurissa, ja siihen on kohdistunut vuosia intensiivistä insinöörityötä. Jos agentti pystyy voittamaan ihmisasiantuntijat juuri tällä kentällä, se kertoo paljon menetelmän voimasta.



