Tutkimus

2000 MoE-mallia koulutettu – kolme sääntöä paljastui

Empiirinen tutkimus haastaa DeepSeekin jaetut asiantuntijat

Hanna HuulivuoHanna Huulivuo
Jaa:
2000 MoE-mallia koulutettu – kolme sääntöä paljastui

Empiirinen pohja MoE-arkkitehtuurille

Viime vuoden aikana markkinoille on tullut kymmeniä Mixture-of-Experts -malleja, mutta arkkitehtuurivalinnat ovat perustuneet pitkälti yksittäisten ryhmien intuitioon. DeepSeek lisäsi jaetut asiantuntijat, Mistral suosii suurempia asiantuntijoita harvempana, Qwen ajaa 128 asiantuntijaa joista kahdeksan aktivoituu kerrallaan. Mikä näistä valinnoista on oikeassa?

Useat tutkimusryhmät ovat viime kuukausina yrittäneet vastata kysymykseen empiirisesti. Suurin systemaattinen tutkimus on kouluttanut yli 2000 mallia eri konfiguraatiolla, jotta jokainen suunnitteluvipu on saatu eristettyä omaksi muuttujakseen. Tulos haastaa aiempia oletuksia melko suoraan.

Kolme käytännön sääntöä

Ensimmäinen löydös on yksinkertainen mutta voimakas: asiantuntijoiden määrää kannattaa kasvattaa rajusti suhteessa aktiivisesti käytettäviin. Käytännössä jopa 128-kertainen ero passiivisten ja aktiivisten asiantuntijoiden välillä parantaa mallin laatua, kunhan laskennallinen budjetti antaa myöden. Toisin sanoen: päätä ensin kuinka monta aktiivista parametria budjetti sallii, kiinnitä siitä yhden asiantuntijan koko, ja lisää sitten määrää niin paljon kuin muistia riittää.

Toinen löydös haastaa DeepSeek-tyylisen suunnittelun. Jaetut asiantuntijat, jotka aktivoituvat aina riippumatta reitityksestä, eivät tuo systemaattista etua skaalauslakien valossa. Niiden suosio perustuu enemmän implementaation helppouteen kuin todistettuun hyötyyn. Tämä on huomionarvoista, koska useat tuoreet kiinalaismallit ovat rakentaneet identiteettinsä juuri jaetun ekspertin varaan.

Kolmas löydös koskee token-pudotusta. Reititysruuhkien tasapainottamiseksi monet järjestelmät hylkäävät yksittäisiä syötteen tokeneita kun yksittäinen asiantuntija ylikuormittuu. Tutkimusten mukaan tämä optimointi syö enemmän laatua kuin antaa nopeutta. Dropless-toteutukset ovat selvä voittaja, vaikka ne lisäävät jonkin verran toteutuksen monimutkaisuutta.

Suomi-kulma: Silo AI ja FCAI

Suomalaiselle tekoälykentälle tulokset eivät jää akateemiseksi pohdinnaksi. Silo AI:n Poro-malliperhe ja Aalto-yliopiston FCAI-tutkimuskeskus ovat työstäneet omia MoE-arkkitehtuureitaan suomenkielistä koulutusdataa hyödyntäen. Tähän asti suunnittelupäätökset on jouduttu tekemään pitkälti DeepSeek- ja Mixtral-papereiden varassa. Uusi empiirinen pohja antaa konkreettiset numerot siihen, miten harva asiantuntijaverkko kannattaa rakentaa pienessä laskentabudjetissa, kuten LUMI-supertietokoneella ajettavissa koulutusjuoksuissa.

Kysymys ei ole pelkästään teoreettinen. Jos suomalainen tutkimusryhmä rakentaa seitsemän miljardin aktiivisen parametrin Poro-jatkajan ja valitsee väärän asiantuntija-arkkitehtuurin, hukkaan menee miljoonien eurojen GPU-aikaa. Tarkat skaalauslait pienentävät tätä riskiä, ja antavat aiempaa puolueettomamman vertailupohjan myös rahoittajille.

Mitä tämä tarkoittaa käytännössä

Tavalliselle käyttäjälle muutos näkyy hiljalleen halvempana ja nopeampana päättelynä. Mitä paremmin MoE-arkkitehtuuri on viritetty, sitä pienemmällä laskennalla samat vastaukset syntyvät. Yritykset voivat siis tarjota maksullisia tekoälypalveluita pienemmillä marginaaleilla, tai vastaavasti puristaa ilmaiselle käyttäjälle laadukkaampaa kokemusta. Pilvilaskennan palveluntarjoajille tämä tarkoittaa, että 128-kertaista asiantuntijaylimäärää suosivat mallit vaativat enemmän VRAM-kapasiteettia mutta vähemmän laskentatehoa per token.

Tutkimusryhmät korostavat, että löydökset koskevat nimenomaan harvojen asiantuntijoiden esikoulutusta. Hienosäätö, agenttipohjaiset järjestelmät ja päättelymallit saattavat noudattaa eri logiikkaa. Tämä avaa luonnollisen jatkotutkimuksen aiheen FCAI:n suuntaan, ja antaa Aallon väitöskirjantekijöille konkreettisia kysymyksiä joihin ei vielä ole vastausta.

Sanasto

Mixture-of-Experts (MoE)
Mallirakenne, jossa yhden ison verkon sijaan koulutetaan useita pienempiä 'asiantuntijoita'. Kullekin syötteelle valitaan vain muutama asiantuntija aktiiviseksi, mikä säästää laskentaa.
Esikoulutus
Vaihe, jossa tekoälymalli opetetaan valtavalla, yleisellä tekstiaineistolla. Tämän jälkeen mallia voidaan vielä hienosäätää tiettyä tehtävää varten.
Skaalauslaki
Sääntö, joka kertoo miten mallin laatu paranee kun sen kokoa, dataa tai laskentaa kasvatetaan. Auttaa ennustamaan, kannattaako kalliimpaa koulutusta käynnistää.

MoE-arkkitehdin muistilista

1) Lukitse ensin aktiivisten parametrien budjetti, johda siitä yhden asiantuntijan koko. 2) Lisää asiantuntijoiden määrää aggressiivisesti, jopa 128-kertaiseksi suhteessa aktiivisiin. 3) Älä rakenna jaettuja asiantuntijoita. 4) Käytä dropless-reititystä, älä hyväksy token-pudotusta.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Datakeskukset Suomessa – hankkeet, sähkö ja vero
  3. 3Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat
  4. 4Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  5. 5Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.