Tutkimus

Vuoden 1967 algoritmi pelasti kielimallit

DeepSeekin ratkaisu taltuttaa koulutuksen epävakauden.

Hanna HuulivuoHanna Huulivuo
Jaa:
Vuoden 1967 algoritmi pelasti kielimallit

Kielimallien koulutuksen hiljainen vitsaus

Suurten kielimallien kouluttaminen on kallista ja riskialtista työtä. Signaalit, jotka kulkevat mallin kerrosten läpi, kerrostuvat ja vahvistuvat hallitsemattomasti, kunnes gradientit räjähtävät ja koko koulutusprosessi täytyy aloittaa alusta. DeepSeekin tutkijat mittasivat, että 27 miljardin parametrin mallissa signaali vahvistui jopa 3 000-kertaiseksi alkuperäiseen verrattuna.

Jokainen epäonnistunut koulutusajo maksaa tuhansia euroja laskenta-ajassa. Suurimpien mallien kohdalla puhutaan miljoonista. Jos ajo kaatuu puolivälissä, investointi valuu hukkaan.

DeepSeekin tutkimusryhmä julkaisi vuodenvaihteessa tutkimuksen nimeltä mHC eli manifold-rajoitetut ylikytkennät (Manifold-Constrained Hyper-Connections). Yhtiön toimitusjohtaja Liang Wenfeng on yksi paperin kirjoittajista, mikä kertoo siitä, ettei kyseessä ole sivuprojekti.

Vanha algoritmi, uusi käyttötarkoitus

Ratkaisu on yllättävän elegantti. DeepSeekin tutkijat hyödynsivät Sinkhorn–Knopp-algoritmia, joka kehitettiin alun perin vuonna 1967 aivan toisenlaisia matemaattisia ongelmia varten. Algoritmia käytetään nyt pakottamaan mallin kerrosten väliset yhteydet pysymään matemaattisesti hallitussa tilassa, niin kutsutulla Birkhoffin polytoopin alueella.

Käytännössä tämä tarkoittaa, että kerrosten väliset painomatriisit normalisoidaan niin, että niiden rivien ja sarakkeiden summat ovat aina yksi. Tällainen matriisi toimii pehmeänä permutaationa: se voi sekoittaa signaaleja kerrosten välillä, mutta ei voi vahvistaa niitä hallitsemattomasti. Normalisointi tehdään 20 iteraatiolla vuorotellen riveittäin ja sarakkeittain.

Analogia auttaa hahmottamaan ongelman mittakaavaa. Jos jokainen kerros vahvistaa signaalia vain viisi prosenttia, sadan kerroksen jälkeen signaali on jo yli 130-kertainen. Hyper-Connections-arkkitehtuurissa vahvistus voi olla paljon suurempi, ja juuri siksi suuret mallit kaatuvat koulutuksen aikana.

mHC:n ansiosta signaalivahvistus putosi 27 miljardin parametrin mallissa 3 000-kertaisesta 1,6-kertaiseen. Koulutus pysyi vakaana kaikissa testatuissa kokoluokissa: 3, 9 ja 27 miljardia parametria.

Päättelytulokset paranevat merkittävästi

mHC:n vaikutus näkyy erityisen selvästi päättelytehtävissä. BIG-Bench Hard -testissä, joka mittaa monimutkaista päättelyä, tulos parani 43,8 prosentista 51,0 prosenttiin – parannus on 7,2 prosenttiyksikköä. DROP-luetun ymmärtämisen testissä ja GSM8K-matemaattisissa tehtävissä parannukset olivat samaa luokkaa. MMLU-yleistietotestissä ero oli maltillisempi, noin pari prosenttiyksikköä.

Suurimmat hyödyt osuvat juuri niihin tehtäviin, joissa kielimallien kehitys on tällä hetkellä kiivainta: päättelyyn, matemaattiseen ongelmanratkaisuun ja monivaiheiseen ajatteluun.

Koulutus pysyi täysin vakaana koko prosessin ajan, ilman yhtäkään häiriöpiikkiä tai gradienttiräjähdystä. Aiemmassa Hyper-Connections-arkkitehtuurissa vakavat häiriöt ilmenivät tyypillisesti noin 12 000 koulutusaskeleen kohdalla.

Kustannus kaikesta tästä: 6,7 prosenttia lisää koulutusaikaa. Käyttöönottovaiheessa mHC ei vaadi ylimääräisiä resursseja lainkaan, sillä rajoitteet vaikuttavat ainoastaan koulutusvaiheeseen.

Halvempaa ja nopeampaa mallinkehitystä

Koulutuksen vakaus ei kuulosta arkielämän aiheelta, mutta se vaikuttaa suoraan siihen, kuinka nopeasti parempia tekoälymalleja saadaan käyttöön ja mitä ne maksavat. Vakaa koulutus tarkoittaa vähemmän hukattuja ajoja, pienempiä kustannuksia ja nopeampaa kehityssykliä. Pienemmille toimijoille, joilla ei ole varaa toistaa kalliita koulutusajoja, tämä on erityisen merkittävää.

Tavalliselle käyttäjälle hyöty näkyy viiveellä mutta konkreettisesti: parempia tekoälypalveluita nopeammalla aikataululla. Kilpailu mallintoimittajien välillä kiihtyy, mikä painaa hintoja alas.

DeepSeekin johdon osallistuminen tutkimukseen viittaa vahvasti siihen, että mHC integroituu yhtiön seuraavaan lippulaivamalliin. Toimitusjohtaja Liang Wenfeng latasi paperin itse arXiviin, kuten hän on tehnyt yhtiön aiempienkin merkittävien julkaisujen kohdalla.

Kokeile itse

mHC:n koodi on vapaasti saatavilla GitHubissa. Yhteisö on tuottanut useita toteutuksia, mukaan lukien PyTorch-pohjaisen referenssitoteutuksen ja CUDA-optimoidun version. Alkuperäinen tutkimuspaperi on luettavissa arXivissa (arxiv.org/abs/2512.24880).

Suomalaisille tutkijoille ja kehittäjille mHC tarjoaa mahdollisuuden kokeilla vakaampaa koulutusta omissa projekteissa ilman merkittävää lisälaskentaa.

3 000× → 1,6×

Signaalivahvistuksen pudotus

+7,2 pp↑

BIG-Bench Hard -parannus

6,7 %

Lisäkustannus koulutusajassa

0

Gradienttiräjähdystä

arXiv: 2512.24880

Sanasto

Gradientti
Kielimallin koulutuksessa käytettävä matemaattinen suure, joka ohjaa mallin sisäisten arvojen muuttamista oikeaan suuntaan. Jos gradientit kasvavat hallitsemattomiksi ("räjähtävät"), koko koulutusprosessi epäonnistuu.

Tehokkuutta arkkitehtuurista, ei raa'asta laskennasta

DeepSeek on viimeisen vuoden aikana noussut yhdeksi tekoälytutkimuksen näkyvimmistä toimijoista. Kiinalaisen yhtiön DeepSeek-V3-malli ja R1-päättelymalli haastoivat länsimaiset kilpailijat nimenomaan tehokkuusratkaisuilla – ei suuremmalla laskentateholla, vaan älykkäämmillä arkkitehtuurivalinnoilla. mHC jatkaa samaa strategiaa.

Vuoden 1967 algoritmin soveltaminen vuoden 2026 tekoälyongelmaan on samalla muistutus siitä, että matematiikassa ei ole parasta ennen -päivämäärää. Joskus ratkaisu on jo olemassa – se pitää vain löytää oikeasta hyllystä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.