Tutkimus

Nous Researchin temppu nopeuttaa LLM-koulutusta 2,5-kertaiseksi

Token-niput alkuun, normaali koulutus loppuun – ei muutoksia arkkitehtuuriin.

Hanna HuulivuoHanna Huulivuo
Jaa:
Nous Researchin temppu nopeuttaa LLM-koulutusta 2,5-kertaiseksi

Tekoälytutkimusryhmä Nous Research julkaisi menetelmän, joka kutistaa suurten kielimallien esiopetusajan alle puoleen muuttamatta arkkitehtuuria. Token Superposition Training -nimellä kulkeva temppu (lyh. TST) tuottaa 2–3-kertaisen nopeutuksen samalla laskentamäärällä. 10 miljardin parametrin Mixture-of-Experts -mallilla nopeutus on noin 2,5-kertainen.

Idea on tutkijoiden mukaan yksinkertainen. Ensimmäisen 20–40 prosentin ajan koulutuksesta malli ei lue tokeneita yksittäin vaan käsittelee niitä nipuissa. Syötepuolella nipun token-vektorit keskiarvoistetaan, ja tappiofunktio palkitsee mallia siitä, että se ennustaa kerralla seuraavan nipun. Loppukoulutuksessa malli palaa normaaliin next-token-ennustukseen.

Mitään muuta ei tarvitse koskea. AdamW-optimoija pysyy, Llama 3:n tokenisoija pysyy, datakin pysyy. Tutkijoiden omin sanoin menetelmä on 'pohjimmiltaan vain reshape, keskiarvo ja summattu cross-entropy'.

Vahvistettu pienestä 10 miljardiin

Tulokset on testattu neljällä kokoluokalla: 270 miljoonan, 600 miljoonan ja 3 miljardin parametrin tiheillä malleilla sekä 10B-A1B-kokoluokan MoE-mallilla. 10 miljardin mallia ajettiin kahteen biljoonaan tokeniin asti. TST-versio päätyi pienempään loppukoulutustappioon kuin laskentabudjetiltaan vastaava verrokki, ja päihitti sen myös HellaSwag-, ARC- ja MMLU-vertailuissa.

Vahvistus useassa kokoluokassa on harvinaista. Monet aiemmat esiopetustemput ovat näyttäneet hyvältä alle miljardin parametrin koeasetelmissa mutta menettäneet voimansa isommissa malleissa. Nipun koko muuttuu mallin koon mukana: 270 miljoonan mallilla optimi on 3–8 tokenin nippu, 10 miljardin mallilla 16. Tämä viittaa siihen, että menetelmä kestää myös tuotantomittakaavan, ei vain akateemista koejärjestelyä.

Halpa nopeutus, kalliimpi data

TST kuluttaa enemmän dataa kuin perinteinen menetelmä. Hyöty syntyy, kun laskenta on pullonkaula. Jos koulutusdataa on niukasti, temppu ei ratkaise mitään.

Mitä tämä tarkoittaa suomalaiselle tekoälytutkimukselle

Esiopetus on tekoälyn rakentamisen kallein vaihe. GPU-tunnit, sähkö ja datakeskustila menevät pääosin tähän. Jos Nous Researchin menetelmä toistuu muiden ryhmien käsissä, FCAI:n ja Aalto-yliopiston perustutkimuksen budjetit yltäisivät kerralla suurempiin malleihin, tai sama malli saataisiin koulutettua sähkösopimuksen halvempina tunteina.

Silo AI:n suomalaisesta Poro-mallista vastannut tiimi on sanonut aiemmin, että pohjoismaisten kielten esiopetus on rajoittunut nimenomaan laskentakapasiteetin saatavuuteen, ei datan puutteeseen. Pyysin perjantaina kommenttia FCAI:n johtoryhmään kuuluvalta professori Sasu Tarkomalta sekä Aalto-yliopiston tekoälytutkijoilta. Vastauksia ei ehtinyt tulla ennen julkaisua, ja juttu päivittyy, kun kommentit saadaan.

Tavallisen lukijan kannalta hyöty näkyy myöhemmin. Halvempi esiopetus tarkoittaa, että pohjoismaisilla kielillä koulutettuja malleja syntyy enemmän, ja sen myötä esimerkiksi suomenkielisten asiakaspalvelubottien ja viranomaispalvelujen tekstinkäsittely paranee. Yritysten kassasta ero näkyy laskuissa: jos koulutus maksaa 2,5 kertaa vähemmän, samaan budjettiin mahtuu joko isompi malli tai useampi rinnakkainen koe.

Sanasto

Esiopetus (pre-training)
Tekoälymallin ensimmäinen ja kallein koulutusvaihe, jossa mallille syötetään valtava määrä tekstiä jotta se oppii kielen ja maailman perusrakenteet. Tämän jälkeen tulevat hienosäätövaiheet.
Mixture-of-Experts (MoE)
Mallirakenne, jossa yhden ison verkon sijaan käytetään useita pienempiä asiantuntijaverkkoja. Jokaista syötettä varten aktivoidaan vain tarvittavat asiantuntijat, mikä säästää laskentatehoa.
RLHF ja DPO
Menetelmiä, joilla tekoälymalli opetetaan vastaamaan ihmisen toivomalla tavalla esiopetuksen jälkeen. RLHF käyttää ihmisten antamia arvosanoja, DPO suoraa vertailua hyvien ja huonojen vastausten välillä.

Mitä tempussa voi mennä pieleen

Avoin kysymys koskee jatkokoulutusta ja hienosäätöä. Paperi kertoo tappiofunktioista ja vertailutehtävistä, mutta ei vielä siitä, miten TST-valmiit mallit käyttäytyvät pitkäaikaisessa RLHF- tai DPO-vaiheessa. Tämä on syy odottaa toistettavuutta muilta ryhmiltä ennen kuin temppua kannattaa siirtää omaan tuotantoputkeen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.