Baidu julkaisi ERNIE 5.1 -mallinsa 9. toukokuuta ja teki rahanjakelun kannalta epämukavan väitteen: koulutus maksoi vain noin kuusi prosenttia siitä, mitä saman kokoluokan mallit alalla yleensä kuluttavat. Aktiiviset parametrit on puolitettu, kokonaisparametrit pakattu kolmannekseen ja AIME26-pisteissä malli päihittää kaikki paitsi Gemini 3.1 Pron. Tämä on Kiinan toinen tehokkuusisku DeepSeekin jälkeen, ja se asettaa OpenAI:n ja Anthropicin selittämään, miksi heidän miljardiluokan investointinsa ovat välttämättömiä.
Mitä '6 prosenttia' tarkoittaa konkreettisesti
Baidu kertoi 8. toukokuuta julkaisemassaan teknisessä blogissa, että ERNIE 5.1:n esikoulutus maksoi noin kuusi prosenttia siitä, mitä saman mittakaavan vertailumallit kuluttavat. Luku koskee pelkkää esikoulutusvaihetta, ei päättelyä tai jatkokoulutusta. Yhtiö ei paljasta absoluuttisia dollarimääriä eikä laitteiston yksityiskohtia, mutta antaa kaksi kovaa lukua: kokonaisparametrit on pakattu noin kolmannekseen ERNIE 5.0:n koosta, ja per kysely aktivoituvat parametrit on puolitettu. MoE-arkkitehtuurissa pieni aktiivinen osuus tarkoittaa, että vain murto-osa mallista käynnistyy yksittäisellä kyselyllä, mikä tiputtaa myös palvelinkustannuksia.
ERNIE 5.1:n esikoulutuskustannus vertailumalleista
Säästö Baidun ilmoituksen mukaan
AIME26-pisteet
Aktiiviset parametrit puolitettu
Once-For-All -kehys teki tempun
Tehokkuus syntyy menetelmästä nimeltä multi-dimensional elastic pre-training. Sen sijaan että Baidu olisi treenannut erikseen pienen, keskikokoisen ja ison mallin, yhtiö koulutti yhden joustavan MoE-mallin, jossa syvyys (Transformer-kerrosten määrä), leveys (asiantuntijoiden kapasiteetti) ja aktiivisten asiantuntijoiden top-k-reititys vaihtelevat dynaamisesti. ERNIE 5.1 louhittiin tästä perheestä alimalliksi. Käytännössä yksi kallis koulutusajo tuottaa monta tuotetta, ja päällekkäisiltä laskutoimituksilta vältytään.
Toinen palanen on vahvistusoppimisputken hajauttaminen. Baidu kertoo purkaneensa aiemmin tiukasti yhteen kytketyn RL-pinon itsenäisiksi ja vaakasuunnassa skaalautuviksi osiksi. Hidas komponentti ei pysäytä koko ajoa. Asynkroninen RL on viime kuukausien iso tehokkuustrendi myös länsimaisissa laboratorioissa, mutta Baidu on nyt ensimmäisten joukossa esittelemässä konkreettisia tuotantotuloksia.



