Entinen Teslan tekoälyjohtaja rakensi tutkimusagentin
Andrej Karpathy julkaisi lauantaina Autoresearch:in, avoimen Python-työkalun joka automatisoi koneoppimiskokeiden tekemisen. Koko työkalu mahtuu 630 koodiriville, ja sen pyörittämiseen riittää yksi näytönohjain.
Karpathy tunnetaan Teslan entisenä tekoälyjohtajana ja OpenAI:n perustajajäsenenä. Hän loi aiemmin nanoGPT:n, suositun minimalistisen kielimallitoteutuksen. Autoresearch noudattaa samaa filosofiaa: koodipohja on tarkoituksella niin lyhyt, että sen lukee yhdeltä istumalta.
Työkalu keräsi GitHub:ssa yli 8 000 tähteä muutamassa päivässä julkaisunsa jälkeen. Karpathy tiivisti tavoitteen yhteen lauseeseen: agentin pitää tehdä tutkimusta yhä nopeammin, loputtomasti ja ilman ihmisen osallistumista.
Kolme tiedostoa ja viiden minuutin sykli
Autoresearch:in arkkitehtuuri on tarkoituksellisen pelkistetty. Järjestelmä koostuu kolmesta tiedostosta. prepare.py valmistelee datan ja tokenisaattorin, eikä agentti koske siihen. train.py sisältää GPT-mallin, optimointialgoritmit ja koulutusilmukan. program.md on ihmisen kirjoittama ohjetiedosto, joka kertoo agentille mitä kokeilla seuraavaksi.
Agentti – käytännössä mikä tahansa kielimalli kuten Claude tai Codex – lukee ohjeet ja muokkaa train.py-tiedostoa. Se voi vaihtaa mallin arkkitehtuuria, säätää hyperparametreja tai kokeilla eri optimointialgoritmeja. Muokkauksen jälkeen agentti käynnistää koulutuksen, joka kestää tasan viisi minuuttia seinäkelloaikaa.
Jokaisen kokeen jälkeen agentti arvioi tuloksen validointimetriikalla nimeltä bits per byte, joka mittaa mallin ennustekykyä sanaston koosta riippumatta. Jos tulos paranee, muutokset tallennetaan git-haaraan. Jos ei, koodi palautetaan edelliseen tilaan. Tämä räikkämekanismi tuottaa noin 12 koetta tunnissa eli reilusti yli sata koetta yön aikana.
Pienempi malli päihitti isomman
Karpathy itse ajoi 276 koetta kahdeksalla H100-näytönohjaimella. Agentti löysi 29 parannusta, jotka johdonmukaisesti pienensivät validointihäviötä. Pienellä mallilla löydetyt arkkitehtuurimuutokset skaalautuivat myös suurempiin malleihin, mikä viittaa siihen, että agentti teki aitoja rakenteellisia oivalluksia.
Ratkaiseva suunnittelupäätös on viiden minuutin aikaraja. Se pakottaa agentin tekemään nopeita kokeiluja sen sijaan, että se yrittäisi optimoida yhtä koulutusajoa loputtomiin. Kiinteä aikakehys tekee myös jokaisesta kokeesta vertailukelpoisen.
Shopifyn toimitusjohtaja Tobi Lütke sovelsi Autoresearch:ia yhtiön sisäiseen kielimalliin. Kahdeksan tunnin yöajon aikana agentti suoritti 37 koetta ja paransi validointitulosta 19 prosenttia. Lopputuloksena 0,8 miljardin parametrin malli päihitti aiemman 1,6 miljardin parametrin version. Puolet pienempi malli toimi paremmin, koska agentti ei tyytynyt pelkkään hienosäätöön vaan teki rakenteellisia muutoksia arkkitehtuuriin.
“Opin siitä enemmän kuin kuukausien ML-tutkijoiden seuraamisesta.”



