DeepSeek kouluttaa seuraavan sukupolven V4-kielimallinsa kokonaan kotimaisilla siruilla. Kiinalainen tekoäly-yhtiö on tehnyt kuukausien kehitystyötä yhdessä Huawein ja siruvalmistaja Cambriconin kanssa muokatakseen biljoonan parametrin mallin arkkitehtuurin yhteensopivaksi Huawein Ascend-sirujen kanssa. V4:stä tulee ensimmäinen tämän kokoluokan malli, joka koulutetaan alusta loppuun ilman yhtäkään Nvidian prosessoria.
Nvidia jätettiin tietoisesti sivuun jo testausvaiheessa. DeepSeek antoi V4:n varhaisen pääsyn ainoastaan kotimaisille siruvalmistajille. Viesti on selvä: malli rakennettiin kiinalaiselle laitteistolle ja optimoidaan sille ensimmäisenä.
Epäonnistumisesta opiksi
DeepSeekin edellinen päättelymalli R2 piti alun perin kouluttaa Huawein Ascend 910C -siruilla, mutta yritys epäonnistui. Syynä oli Huawein CANN-ohjelmistopinon kypsyysvaje verrattuna Nvidian vakiintuneeseen CUDA-ekosysteemiin. Koulutuksen loppuun saattaminen vaati paluun Nvidian näytönohjaimille.
V4:n kohdalla tilanne on toinen. Huawei julkaisi uuden CANN Next -ohjelmistopinon, joka jäljittelee CUDA:n keskeisiä ohjelmointimalleja: säietehtäviä, warp-ryhmiä ja kernel-kutsuja. Tavoitteena oli, että CUDA-ympäristöön tottuneet kehittäjät voivat siirtää työkuormansa uudelle alustalle ilman koko koodipohjan uudelleenkirjoittamista. ByteDancen ja Alibaban kehitystiimit ovat vahvistaneet, että siirto onnistui kohtuullisella työmäärällä.
Arkkitehtuuriltaan V4 on harva sekoitus asiantuntijoita -malli (mixture of experts), jossa kokonaisparametrimäärä kipuaa biljoonaan mutta yksittäisessä päättelykierroksessa aktivoituu vain noin 32–37 miljardia parametria. Ratkaisu pitää laskentatehon ja viiveen kurissa, vaikka mallin tietopohja on valtava.
Ascend 950PR numeroina
V4:n alla pyörii Huawein uusin Ascend 950PR -siru. Sen laskentateho FP8-tarkkuudella on yksi petaflops, ja Huawein oman vertailun mukaan se tarjoaa 2,8-kertaisen tehon Nvidian H20-siruun nähden. Vertailu ei kuitenkaan kerro koko totuutta, sillä H20 on Nvidian vaatimattomin tekoälysiru – se oli viimeinen malli, jota Kiinaan sai vielä viedä ennen kuin maa kielsi ostot syyskuussa 2025.
Sirun muistikapasiteetti on 112 gigatavua, mutta muistikaistanleveys jää 1,4 teratavuun sekunnissa. Nvidian H20 tarjoaa samassa mittarissa 4 teratavua. Ero on merkittävä erityisesti pitkien konteksti-ikkunoiden käsittelyssä, jossa avain-arvo-välimuisti hallitsee viivettä. Ascend 950PR kompensoi tätä nopealla sirujen välisellä yhteydellä: LingQu-väylän 2 teratavun sekuntikapasiteetti on yli kaksinkertainen Nvidian NVLink-tekniikkaan verrattuna.
Huawei valmistaa sirun SMIC:n 7 nanometrin prosessilla, kun Nvidia käyttää TSMC:n 4 nanometrin tekniikkaa. Vanhempi valmistusprosessi näkyy virrankulutuksessa: 950PR tarvitsee 600 wattia, kun H20 pärjää 400 watilla.
Suuryritykset vaihtavat sirutoimittajaa
DeepSeekin päätös on laukaissut mittavan tilausaallon. The Information -lehden mukaan Alibaba, ByteDance ja Tencent ovat tilanneet kukin satoja tuhansia Ascend 950PR -siruja. Kysynnän kasvu on nostanut sirujen hintoja 20 prosenttia.
Tilausten taustalla on pakotteiden luoma todellisuus. Yhdysvaltain vientirajoitukset ovat estäneet tehokkaimpien tekoälysirujen viennin Kiinaan vuodesta 2022. Kiina itse kielsi viime syksynä suuria teknologiayhtiöitään hankkimasta edes niitä Nvidia-siruja, joita vielä teoriassa sai ostaa. Kotimaiset sirut eivät ole enää vaihtoehto vaan ainoa reitti suureen laskentakapasiteettiin.



