Tutkimus

Nvidian agentti koodasi viikon ja päihitti asiantuntijat

AVO tutki yli 500 optimointireittiä ja voitti käsin viritetyt GPU-kirjastot

Hanna HuulivuoHanna Huulivuo
Jaa:
Nvidian agentti koodasi viikon ja päihitti asiantuntijat

Viikko ilman kahvitaukoja

Nvidia julkaisi tutkimuksen, joka antaa aihetta arvioida uudelleen ihmisen roolia koodin optimoinnissa. AVO eli Agentic Variation Operators on tekoälyagentti, joka optimoi GPU-laskentaytimiä itsenäisesti ilman ihmisen ohjausta tai väliintuloa.

Tutkimusryhmä antoi agentille yhden tehtävän: parantaa attention-laskentaytimien suorituskykyä Nvidian Blackwell B200 -siruilla. Agentti sai käyttöönsä CUDA-ohjelmointioppaat, Blackwell-arkkitehtuurin dokumentaation ja FlashAttention-4:n lähdekoodin. Sen jälkeen ihmiset poistuivat huoneesta.

Seitsemän vuorokautta myöhemmin agentti oli tutkinut yli 500 erilaista optimointisuuntaa ja kehittänyt 40 peräkkäistä ydinversiota. Se profiloi koodia, tunnisti pullonkauloja, kokeili ratkaisuja ja aloitti uudelleen, kun jokin meni pieleen. Kehitys eteni portaittain: viisi suurta arkkitehtuurista läpimurtoa, joiden välillä agentti hioi yksityiskohtia.

AVO perustuu evoluutioalgoritmien ideaan, mutta korvaa perinteiset mutaatio- ja risteytysmenetelmät tekoälyagentilla. Perinteisessä evoluutiohaussa ohjelma kokeilee satunnaisia muutoksia ja valitsee parhaat. AVO:n agentti toimii toisin: se lukee dokumentaatiota, analysoi aiempien versioiden heikkoudet ja tekee harkittuja muutoksia profiilidatan perusteella.

Numerot puhuvat

AVO:n kehittämät attention-ytimet osoittautuivat jopa 3,5 prosenttia nopeammiksi kuin Nvidian oma cuDNN-kirjasto ja jopa 10,5 prosenttia nopeammiksi kuin FlashAttention-4. Paras ydin saavutti 1 668 teraflopsin laskentatehon BF16-tarkkuudella. Molemmat vertailukohteet ovat vuosien ihmistyöllä hiottuja huippukirjastoja, joita hyödynnetään käytännössä jokaisessa suuressa kielimallissa.

Agentin löytämät optimoinnit siirtyivät nopeasti myös toiseen tehtävään. Kun AVO sai soveltaa oppimaansa grouped-query attention -tekniikkaan, se tarvitsi vain 30 minuuttia itsenäistä työtä. Tulos: 7,0 prosentin parannus cuDNN:ään ja 9,3 prosentin parannus FlashAttention-4:ään verrattuna.

Agentti löysi kolme optimointia, joita ihmistiimit eivät olleet keksineet. Suurin yksittäinen parannus oli haaraton akkumulaattorien uudelleenskaalaus, joka yksinään nopeutti laskentaa 8,1 prosenttia. Agentti lomitti myös laskentavaiheiden ajastusta ja tasapainotti rekistereitä prosessorin warp-ryhmien välillä. Nämä ovat matalan tason arkkitehtuurioptimointeja, jotka vaativat syvällistä ymmärrystä sekä laitteistosta että ohjelmistosta.

Sokea koodaus

Tutkimuksen taustalla on käsite, jota tekijät kutsuvat sokeaksi koodaukseksi. Tutkijat Xu Bing ja Terry Chen aloittivat AVO-projektin puolitoista vuotta sitten. Lähtökohtana oli rakentaa järjestelmä, jossa kukaan ihminen ei koskaan näe tai muokkaa agentin tuottamaa koodia kesken prosessin.

AI-koodaustyökalut kuten GitHub Copilot ja Claude Code toimivat nykyään ihmisen apuna: ne ehdottavat koodia, jonka ohjelmoija tarkistaa ja hyväksyy. AVO kääntää asetelman päälaelleen. Agentti tekee kaikki päätökset itse, ja ihminen näkee vain lopputuloksen.

Xu Bingin mukaan AVO edustaa "ensimmäistä todellista ylihmisen tason suoritusta ohjelmistokentällä". Väite on rohkea. Vertailun vuoksi: tekoälyagentit ovat oppineet korjaamaan ohjelmistovirheitä yhä tehokkaammin, ja SWE-bench Verified -testissä parhaat mallit ylittävät jo 80 prosentin rajan. AVO vie kunnianhimon eri tasolle, sillä kyse ei ole virheiden korjaamisesta vaan uusien, ihmisasiantuntijat päihittävien ratkaisujen luomisesta.

Attention on valittu tutkimuskohteeksi tarkoituksella. Se on yksi aggressiivisimmin optimoiduista laskentaytimistä koko tekoälyinfrastruktuurissa, ja siihen on kohdistunut vuosia intensiivistä insinöörityötä. Jos agentti pystyy voittamaan ihmisasiantuntijat juuri tällä kentällä, se kertoo paljon menetelmän voimasta.

Kapea erikoisala, laaja periaate

Attention-ytimet ovat tekoälylaskennan suorituskyvyn ytimessä. Jokainen prosentti, jonka niiden laskenta nopeutuu, näkyy suoraan kielimallien ja kuvageneraattoreiden vasteajassa ja energiankulutuksessa. ChatGPT:n kaltaisten palveluiden käyttäjäkokemus riippuu lopulta siitä, kuinka nopeasti attention-laskenta suoriutuu. Yrityksille, jotka pyörittävät tuhansia GPU-palvelimia, muutaman prosentin parannus tarkoittaa miljoonien säästöjä vuodessa. Nvidian kannalta löydökset voivat päätyä suoraan cuDNN-kirjaston tuleviin versioihin.

Tutkimuksen rajoitukset on silti hyvä pitää mielessä. AVO toimi yhden kehityslinjan mallilla, jossa agentti kehitti yhtä ratkaisua kerrallaan. Populaatiopohjainen evoluutio, jossa useita ratkaisuja kehitettäisiin rinnakkain, on vasta suunnitteilla. Agentti tarvitsi myös ulkoisen mekanismin, joka esti sitä juuttumasta tuottamattomiin silmukoihin.

GPU-koodin optimointi on kapea erikoisala, mutta periaate on yleistettävissä. Jos tekoälyagentti pystyy viikon itsenäisellä työllä ylittämään vuosien ihmistyön yhdellä osa-alueella, sama menetelmä voi toimia monella muullakin – lääkeaineiden molekyylimallinnuksesta logistiikkareittien laskentaan. Nvidian tutkimus ei ole vain tekninen saavutus vaan esimakua siitä, miten ohjelmistokehityksen arvoketju voi muuttua, kun agentit siirtyvät avustajista itsenäisiksi tekijöiksi.

7 vrk

Itsenäistä optimointityötä

500+↑

Tutkittua optimointisuuntaa

40↑

Peräkkäistä ydinversiota

1 668 TFLOPS↑

Paras laskentatulos (BF16)

Nvidia / ArXiv 2603.24517

Sanasto

Attention (huomiomekanismi)
Kielimallien keskeinen laskentavaihe, jossa malli arvioi mitkä osat syötteestä ovat kulloinkin tärkeimpiä. Käytännössä kaikki nykyiset tekoälymallit, kuten GPT ja Claude, perustuvat attention-mekanismiin.
CUDA
Nvidian kehittämä ohjelmointialusta, jolla kirjoitetaan GPU-näytönohjaimilla ajettavaa rinnakkaislaskentakoodia. Käytännössä kaikki tekoälymallien koulutus ja käyttö tapahtuu CUDA-koodilla.

Seuraa tilannetta

AVO-tutkimus on luettavissa kokonaisuudessaan ArXiv-palvelussa (arxiv.org/abs/2603.24517). Tutkijat suunnittelevat seuraavaksi populaatiopohjaista evoluutiota, jossa useat agentit kilpailisivat ja tekisivät yhteistyötä rinnakkain. FlashAttention-4:n tutkimus tarjoaa vertailukohdan (arxiv.org/abs/2603.05451).

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.