Empiirinen pohja MoE-arkkitehtuurille
Viime vuoden aikana markkinoille on tullut kymmeniä Mixture-of-Experts -malleja, mutta arkkitehtuurivalinnat ovat perustuneet pitkälti yksittäisten ryhmien intuitioon. DeepSeek lisäsi jaetut asiantuntijat, Mistral suosii suurempia asiantuntijoita harvempana, Qwen ajaa 128 asiantuntijaa joista kahdeksan aktivoituu kerrallaan. Mikä näistä valinnoista on oikeassa?
Useat tutkimusryhmät ovat viime kuukausina yrittäneet vastata kysymykseen empiirisesti. Suurin systemaattinen tutkimus on kouluttanut yli 2000 mallia eri konfiguraatiolla, jotta jokainen suunnitteluvipu on saatu eristettyä omaksi muuttujakseen. Tulos haastaa aiempia oletuksia melko suoraan.
Kolme käytännön sääntöä
Ensimmäinen löydös on yksinkertainen mutta voimakas: asiantuntijoiden määrää kannattaa kasvattaa rajusti suhteessa aktiivisesti käytettäviin. Käytännössä jopa 128-kertainen ero passiivisten ja aktiivisten asiantuntijoiden välillä parantaa mallin laatua, kunhan laskennallinen budjetti antaa myöden. Toisin sanoen: päätä ensin kuinka monta aktiivista parametria budjetti sallii, kiinnitä siitä yhden asiantuntijan koko, ja lisää sitten määrää niin paljon kuin muistia riittää.
Toinen löydös haastaa DeepSeek-tyylisen suunnittelun. Jaetut asiantuntijat, jotka aktivoituvat aina riippumatta reitityksestä, eivät tuo systemaattista etua skaalauslakien valossa. Niiden suosio perustuu enemmän implementaation helppouteen kuin todistettuun hyötyyn. Tämä on huomionarvoista, koska useat tuoreet kiinalaismallit ovat rakentaneet identiteettinsä juuri jaetun ekspertin varaan.
Kolmas löydös koskee token-pudotusta. Reititysruuhkien tasapainottamiseksi monet järjestelmät hylkäävät yksittäisiä syötteen tokeneita kun yksittäinen asiantuntija ylikuormittuu. Tutkimusten mukaan tämä optimointi syö enemmän laatua kuin antaa nopeutta. Dropless-toteutukset ovat selvä voittaja, vaikka ne lisäävät jonkin verran toteutuksen monimutkaisuutta.
Suomi-kulma: Silo AI ja FCAI
Suomalaiselle tekoälykentälle tulokset eivät jää akateemiseksi pohdinnaksi. Silo AI:n Poro-malliperhe ja Aalto-yliopiston FCAI-tutkimuskeskus ovat työstäneet omia MoE-arkkitehtuureitaan suomenkielistä koulutusdataa hyödyntäen. Tähän asti suunnittelupäätökset on jouduttu tekemään pitkälti DeepSeek- ja Mixtral-papereiden varassa. Uusi empiirinen pohja antaa konkreettiset numerot siihen, miten harva asiantuntijaverkko kannattaa rakentaa pienessä laskentabudjetissa, kuten LUMI-supertietokoneella ajettavissa koulutusjuoksuissa.
Kysymys ei ole pelkästään teoreettinen. Jos suomalainen tutkimusryhmä rakentaa seitsemän miljardin aktiivisen parametrin Poro-jatkajan ja valitsee väärän asiantuntija-arkkitehtuurin, hukkaan menee miljoonien eurojen GPU-aikaa. Tarkat skaalauslait pienentävät tätä riskiä, ja antavat aiempaa puolueettomamman vertailupohjan myös rahoittajille.
Mitä tämä tarkoittaa käytännössä
Tavalliselle käyttäjälle muutos näkyy hiljalleen halvempana ja nopeampana päättelynä. Mitä paremmin MoE-arkkitehtuuri on viritetty, sitä pienemmällä laskennalla samat vastaukset syntyvät. Yritykset voivat siis tarjota maksullisia tekoälypalveluita pienemmillä marginaaleilla, tai vastaavasti puristaa ilmaiselle käyttäjälle laadukkaampaa kokemusta. Pilvilaskennan palveluntarjoajille tämä tarkoittaa, että 128-kertaista asiantuntijaylimäärää suosivat mallit vaativat enemmän VRAM-kapasiteettia mutta vähemmän laskentatehoa per token.
Tutkimusryhmät korostavat, että löydökset koskevat nimenomaan harvojen asiantuntijoiden esikoulutusta. Hienosäätö, agenttipohjaiset järjestelmät ja päättelymallit saattavat noudattaa eri logiikkaa. Tämä avaa luonnollisen jatkotutkimuksen aiheen FCAI:n suuntaan, ja antaa Aallon väitöskirjantekijöille konkreettisia kysymyksiä joihin ei vielä ole vastausta.
Sanasto
- Mixture-of-Experts (MoE)
- Mallirakenne, jossa yhden ison verkon sijaan koulutetaan useita pienempiä 'asiantuntijoita'. Kullekin syötteelle valitaan vain muutama asiantuntija aktiiviseksi, mikä säästää laskentaa.
- Esikoulutus
- Vaihe, jossa tekoälymalli opetetaan valtavalla, yleisellä tekstiaineistolla. Tämän jälkeen mallia voidaan vielä hienosäätää tiettyä tehtävää varten.
- Skaalauslaki
- Sääntö, joka kertoo miten mallin laatu paranee kun sen kokoa, dataa tai laskentaa kasvatetaan. Auttaa ennustamaan, kannattaako kalliimpaa koulutusta käynnistää.
MoE-arkkitehdin muistilista
1) Lukitse ensin aktiivisten parametrien budjetti, johda siitä yhden asiantuntijan koko. 2) Lisää asiantuntijoiden määrää aggressiivisesti, jopa 128-kertaiseksi suhteessa aktiivisiin. 3) Älä rakenna jaettuja asiantuntijoita. 4) Käytä dropless-reititystä, älä hyväksy token-pudotusta.



