Kielimallien koulutuksen hiljainen vitsaus
Suurten kielimallien kouluttaminen on kallista ja riskialtista työtä. Signaalit, jotka kulkevat mallin kerrosten läpi, kerrostuvat ja vahvistuvat hallitsemattomasti, kunnes gradientit räjähtävät ja koko koulutusprosessi täytyy aloittaa alusta. DeepSeekin tutkijat mittasivat, että 27 miljardin parametrin mallissa signaali vahvistui jopa 3 000-kertaiseksi alkuperäiseen verrattuna.
Jokainen epäonnistunut koulutusajo maksaa tuhansia euroja laskenta-ajassa. Suurimpien mallien kohdalla puhutaan miljoonista. Jos ajo kaatuu puolivälissä, investointi valuu hukkaan.
DeepSeekin tutkimusryhmä julkaisi vuodenvaihteessa tutkimuksen nimeltä mHC eli manifold-rajoitetut ylikytkennät (Manifold-Constrained Hyper-Connections). Yhtiön toimitusjohtaja Liang Wenfeng on yksi paperin kirjoittajista, mikä kertoo siitä, ettei kyseessä ole sivuprojekti.
Vanha algoritmi, uusi käyttötarkoitus
Ratkaisu on yllättävän elegantti. DeepSeekin tutkijat hyödynsivät Sinkhorn–Knopp-algoritmia, joka kehitettiin alun perin vuonna 1967 aivan toisenlaisia matemaattisia ongelmia varten. Algoritmia käytetään nyt pakottamaan mallin kerrosten väliset yhteydet pysymään matemaattisesti hallitussa tilassa, niin kutsutulla Birkhoffin polytoopin alueella.
Käytännössä tämä tarkoittaa, että kerrosten väliset painomatriisit normalisoidaan niin, että niiden rivien ja sarakkeiden summat ovat aina yksi. Tällainen matriisi toimii pehmeänä permutaationa: se voi sekoittaa signaaleja kerrosten välillä, mutta ei voi vahvistaa niitä hallitsemattomasti. Normalisointi tehdään 20 iteraatiolla vuorotellen riveittäin ja sarakkeittain.
Analogia auttaa hahmottamaan ongelman mittakaavaa. Jos jokainen kerros vahvistaa signaalia vain viisi prosenttia, sadan kerroksen jälkeen signaali on jo yli 130-kertainen. Hyper-Connections-arkkitehtuurissa vahvistus voi olla paljon suurempi, ja juuri siksi suuret mallit kaatuvat koulutuksen aikana.
mHC:n ansiosta signaalivahvistus putosi 27 miljardin parametrin mallissa 3 000-kertaisesta 1,6-kertaiseen. Koulutus pysyi vakaana kaikissa testatuissa kokoluokissa: 3, 9 ja 27 miljardia parametria.
Päättelytulokset paranevat merkittävästi
mHC:n vaikutus näkyy erityisen selvästi päättelytehtävissä. BIG-Bench Hard -testissä, joka mittaa monimutkaista päättelyä, tulos parani 43,8 prosentista 51,0 prosenttiin – parannus on 7,2 prosenttiyksikköä. DROP-luetun ymmärtämisen testissä ja GSM8K-matemaattisissa tehtävissä parannukset olivat samaa luokkaa. MMLU-yleistietotestissä ero oli maltillisempi, noin pari prosenttiyksikköä.
Suurimmat hyödyt osuvat juuri niihin tehtäviin, joissa kielimallien kehitys on tällä hetkellä kiivainta: päättelyyn, matemaattiseen ongelmanratkaisuun ja monivaiheiseen ajatteluun.
Koulutus pysyi täysin vakaana koko prosessin ajan, ilman yhtäkään häiriöpiikkiä tai gradienttiräjähdystä. Aiemmassa Hyper-Connections-arkkitehtuurissa vakavat häiriöt ilmenivät tyypillisesti noin 12 000 koulutusaskeleen kohdalla.
Kustannus kaikesta tästä: 6,7 prosenttia lisää koulutusaikaa. Käyttöönottovaiheessa mHC ei vaadi ylimääräisiä resursseja lainkaan, sillä rajoitteet vaikuttavat ainoastaan koulutusvaiheeseen.
Halvempaa ja nopeampaa mallinkehitystä
Koulutuksen vakaus ei kuulosta arkielämän aiheelta, mutta se vaikuttaa suoraan siihen, kuinka nopeasti parempia tekoälymalleja saadaan käyttöön ja mitä ne maksavat. Vakaa koulutus tarkoittaa vähemmän hukattuja ajoja, pienempiä kustannuksia ja nopeampaa kehityssykliä. Pienemmille toimijoille, joilla ei ole varaa toistaa kalliita koulutusajoja, tämä on erityisen merkittävää.
Tavalliselle käyttäjälle hyöty näkyy viiveellä mutta konkreettisesti: parempia tekoälypalveluita nopeammalla aikataululla. Kilpailu mallintoimittajien välillä kiihtyy, mikä painaa hintoja alas.
DeepSeekin johdon osallistuminen tutkimukseen viittaa vahvasti siihen, että mHC integroituu yhtiön seuraavaan lippulaivamalliin. Toimitusjohtaja Liang Wenfeng latasi paperin itse arXiviin, kuten hän on tehnyt yhtiön aiempienkin merkittävien julkaisujen kohdalla.



