Tutkimus

Karpathyn työkalu ajaa sata koetta yössä

Avoin 630 rivin Python-ohjelma iteroi koneoppimiskokeita ilman valvontaa.

Hanna HuulivuoHanna Huulivuo
Jaa:
Karpathyn työkalu ajaa sata koetta yössä

Entinen Teslan tekoälyjohtaja rakensi tutkimusagentin

Andrej Karpathy julkaisi lauantaina Autoresearch:in, avoimen Python-työkalun joka automatisoi koneoppimiskokeiden tekemisen. Koko työkalu mahtuu 630 koodiriville, ja sen pyörittämiseen riittää yksi näytönohjain.

Karpathy tunnetaan Teslan entisenä tekoälyjohtajana ja OpenAI:n perustajajäsenenä. Hän loi aiemmin nanoGPT:n, suositun minimalistisen kielimallitoteutuksen. Autoresearch noudattaa samaa filosofiaa: koodipohja on tarkoituksella niin lyhyt, että sen lukee yhdeltä istumalta.

Työkalu keräsi GitHub:ssa yli 8 000 tähteä muutamassa päivässä julkaisunsa jälkeen. Karpathy tiivisti tavoitteen yhteen lauseeseen: agentin pitää tehdä tutkimusta yhä nopeammin, loputtomasti ja ilman ihmisen osallistumista.

Kolme tiedostoa ja viiden minuutin sykli

Autoresearch:in arkkitehtuuri on tarkoituksellisen pelkistetty. Järjestelmä koostuu kolmesta tiedostosta. prepare.py valmistelee datan ja tokenisaattorin, eikä agentti koske siihen. train.py sisältää GPT-mallin, optimointialgoritmit ja koulutusilmukan. program.md on ihmisen kirjoittama ohjetiedosto, joka kertoo agentille mitä kokeilla seuraavaksi.

Agentti – käytännössä mikä tahansa kielimalli kuten Claude tai Codex – lukee ohjeet ja muokkaa train.py-tiedostoa. Se voi vaihtaa mallin arkkitehtuuria, säätää hyperparametreja tai kokeilla eri optimointialgoritmeja. Muokkauksen jälkeen agentti käynnistää koulutuksen, joka kestää tasan viisi minuuttia seinäkelloaikaa.

Jokaisen kokeen jälkeen agentti arvioi tuloksen validointimetriikalla nimeltä bits per byte, joka mittaa mallin ennustekykyä sanaston koosta riippumatta. Jos tulos paranee, muutokset tallennetaan git-haaraan. Jos ei, koodi palautetaan edelliseen tilaan. Tämä räikkämekanismi tuottaa noin 12 koetta tunnissa eli reilusti yli sata koetta yön aikana.

Pienempi malli päihitti isomman

Karpathy itse ajoi 276 koetta kahdeksalla H100-näytönohjaimella. Agentti löysi 29 parannusta, jotka johdonmukaisesti pienensivät validointihäviötä. Pienellä mallilla löydetyt arkkitehtuurimuutokset skaalautuivat myös suurempiin malleihin, mikä viittaa siihen, että agentti teki aitoja rakenteellisia oivalluksia.

Ratkaiseva suunnittelupäätös on viiden minuutin aikaraja. Se pakottaa agentin tekemään nopeita kokeiluja sen sijaan, että se yrittäisi optimoida yhtä koulutusajoa loputtomiin. Kiinteä aikakehys tekee myös jokaisesta kokeesta vertailukelpoisen.

Shopifyn toimitusjohtaja Tobi Lütke sovelsi Autoresearch:ia yhtiön sisäiseen kielimalliin. Kahdeksan tunnin yöajon aikana agentti suoritti 37 koetta ja paransi validointitulosta 19 prosenttia. Lopputuloksena 0,8 miljardin parametrin malli päihitti aiemman 1,6 miljardin parametrin version. Puolet pienempi malli toimi paremmin, koska agentti ei tyytynyt pelkkään hienosäätöön vaan teki rakenteellisia muutoksia arkkitehtuuriin.

“Opin siitä enemmän kuin kuukausien ML-tutkijoiden seuraamisesta.”

— Tobi Lütke, Shopifyn toimitusjohtaja
630

Riviä Python-koodia

~100/yö

Koetta automaattisesti

29↑

Parannusta 276 kokeesta

19 %↑

Shopifyn mallin parannus yhdessä yössä

GitHub, karpathy/autoresearch

Sanasto

Hyperparametri
Koneoppimismallin asetusarvo jonka ihminen tai agentti valitsee ennen koulutusta – esimerkiksi oppimisnopeus tai mallin kerrosten määrä. Malli ei opi näitä itse.
Validointihäviö
Mittari joka kertoo kuinka paljon virheitä malli tekee datalla jota se ei ole nähnyt koulutuksessa. Pienempi luku tarkoittaa parempaa mallia.

Yksi näytönohjain riittää

Autoresearch:in merkittävin piirre ei ole sen nopeus vaan sen vaatimattomuus. Työkalu ei edellytä klusteria tai pilvipalvelun laskutusjärjestelmää. Yksi NVIDIA-näytönohjain riittää. Karpathy testasi H100:lla, mutta periaatteessa mikä tahansa riittävän tehokas GPU kelpaa.

Suomalaisille tutkimusryhmille työkalu tarjoaa tavan nopeuttaa arkkitehtuurikokeiluja merkittävästi. Aalto-yliopiston ja Helsingin yliopiston FCAI-tutkimuskeskuksella on jo laskentaresursseja, ja Autoresearch antaisi niille uuden käyttötavan. Manuaalinen kokeilu voi viedä viikkoja, kun automatisoidusti samaan pääsee yhdessä yössä.

Startupeille ja yksittäisille kehittäjille hyöty on vielä konkreettisempi. Itsenäinen ML-tutkimus on aiemmin vaatinut joko merkittävää laskentabudjettia tai pääsyä yliopiston resursseihin. Nyt pelkkä pelinäytönohjain ja yö aikaa riittää alkuun. Kynnys kokeelliseen koneoppimiseen laskee selvästi.

Koodi on avointa lähdekoodia MIT-lisenssillä ja tarkoituksella pidetty niin lyhyenä, että se mahtuu kielimallin konteksti-ikkunaan. Agentti siis ymmärtää koko järjestelmän, jota se käyttää. 630 rivin toteutus joka toimii yhdellä GPU:lla osoittaa, että kokeellinen koneoppiminen ei vaadi enää organisaation kokoista budjettia.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.