Tekoälytutkimusryhmä Nous Research julkaisi menetelmän, joka kutistaa suurten kielimallien esiopetusajan alle puoleen muuttamatta arkkitehtuuria. Token Superposition Training -nimellä kulkeva temppu (lyh. TST) tuottaa 2–3-kertaisen nopeutuksen samalla laskentamäärällä. 10 miljardin parametrin Mixture-of-Experts -mallilla nopeutus on noin 2,5-kertainen.
Idea on tutkijoiden mukaan yksinkertainen. Ensimmäisen 20–40 prosentin ajan koulutuksesta malli ei lue tokeneita yksittäin vaan käsittelee niitä nipuissa. Syötepuolella nipun token-vektorit keskiarvoistetaan, ja tappiofunktio palkitsee mallia siitä, että se ennustaa kerralla seuraavan nipun. Loppukoulutuksessa malli palaa normaaliin next-token-ennustukseen.
Mitään muuta ei tarvitse koskea. AdamW-optimoija pysyy, Llama 3:n tokenisoija pysyy, datakin pysyy. Tutkijoiden omin sanoin menetelmä on 'pohjimmiltaan vain reshape, keskiarvo ja summattu cross-entropy'.
Vahvistettu pienestä 10 miljardiin
Tulokset on testattu neljällä kokoluokalla: 270 miljoonan, 600 miljoonan ja 3 miljardin parametrin tiheillä malleilla sekä 10B-A1B-kokoluokan MoE-mallilla. 10 miljardin mallia ajettiin kahteen biljoonaan tokeniin asti. TST-versio päätyi pienempään loppukoulutustappioon kuin laskentabudjetiltaan vastaava verrokki, ja päihitti sen myös HellaSwag-, ARC- ja MMLU-vertailuissa.
Vahvistus useassa kokoluokassa on harvinaista. Monet aiemmat esiopetustemput ovat näyttäneet hyvältä alle miljardin parametrin koeasetelmissa mutta menettäneet voimansa isommissa malleissa. Nipun koko muuttuu mallin koon mukana: 270 miljoonan mallilla optimi on 3–8 tokenin nippu, 10 miljardin mallilla 16. Tämä viittaa siihen, että menetelmä kestää myös tuotantomittakaavan, ei vain akateemista koejärjestelyä.
Halpa nopeutus, kalliimpi data
TST kuluttaa enemmän dataa kuin perinteinen menetelmä. Hyöty syntyy, kun laskenta on pullonkaula. Jos koulutusdataa on niukasti, temppu ei ratkaise mitään.
Mitä tämä tarkoittaa suomalaiselle tekoälytutkimukselle
Esiopetus on tekoälyn rakentamisen kallein vaihe. GPU-tunnit, sähkö ja datakeskustila menevät pääosin tähän. Jos Nous Researchin menetelmä toistuu muiden ryhmien käsissä, FCAI:n ja Aalto-yliopiston perustutkimuksen budjetit yltäisivät kerralla suurempiin malleihin, tai sama malli saataisiin koulutettua sähkösopimuksen halvempina tunteina.
Silo AI:n suomalaisesta Poro-mallista vastannut tiimi on sanonut aiemmin, että pohjoismaisten kielten esiopetus on rajoittunut nimenomaan laskentakapasiteetin saatavuuteen, ei datan puutteeseen. Pyysin perjantaina kommenttia FCAI:n johtoryhmään kuuluvalta professori Sasu Tarkomalta sekä Aalto-yliopiston tekoälytutkijoilta. Vastauksia ei ehtinyt tulla ennen julkaisua, ja juttu päivittyy, kun kommentit saadaan.
Tavallisen lukijan kannalta hyöty näkyy myöhemmin. Halvempi esiopetus tarkoittaa, että pohjoismaisilla kielillä koulutettuja malleja syntyy enemmän, ja sen myötä esimerkiksi suomenkielisten asiakaspalvelubottien ja viranomaispalvelujen tekstinkäsittely paranee. Yritysten kassasta ero näkyy laskuissa: jos koulutus maksaa 2,5 kertaa vähemmän, samaan budjettiin mahtuu joko isompi malli tai useampi rinnakkainen koe.



