Yhdysvaltain tekoälyturvallisuusinstituutti CAISI julkisti perjantaina NIST-arvionsa kiinalaisen DeepSeek V4-Pron suorituskyvystä. Tulokset ovat herättäneet Washingtonissa hälytyksen: avoin malli ohitti OpenAI:n GPT-5.5:n Codeforces-ohjelmointirankingissa ja oli tilastollisesti tasoissa Anthropicin Claude Opus 4.7:n kanssa SWE-bench Verified -testissä.
Arvio on ensimmäinen julkinen NIST-tason vertailu, jossa kiinalainen avoimen lähdekoodin malli on noussut absoluuttiselle kärkipaikalle vakavasti otettavissa ohjelmointitesteissä. Aiemmin DeepSeekin julkaisuja on käsitelty enemmän kuriositeetteina, nyt mittaluku muuttuu.
DeepSeek V4-Pro saavutti Codeforces-rankingissa Elo-luvun 3206, kun GPT-5.5 jäi 3168:aan. Ero on pieni mutta CAISI:n testimetodologian mukaan tilastollisesti merkittävä. Codeforces mittaa mallin kykyä ratkaista kilpailuohjelmoinnin tehtäviä, ja kärkisija antaa kuvan algoritmisen päättelyn tasosta.
SWE-bench Verifiedissä, joka mittaa todellisten ohjelmistovirheiden korjaamista GitHub-repoissa, DeepSeek V4-Pro ratkaisi 89,4 prosenttia testitehtävistä. Claude Opus 4.7 onnistui 89,7 prosentissa. CAISI luokittelee eron luottamusvälin sisälle eli tilastollisesti tasoiksi. GPT-5.5 jäi tässä testissä noin neljä prosenttiyksikköä jälkeen.
1,6 biljoonan parametrin painot MIT-lisenssillä
Mallin tekninen mittakaava on poikkeuksellinen: 1,6 biljoonaa parametria, joista MoE-arkkitehtuurin ansiosta aktiivisia kerrallaan on noin 220 miljardia. DeepSeek julkaisi koko painokokoelman MIT-lisenssillä, mikä tarkoittaa että kuka tahansa voi ladata, ajaa ja muokata mallin omilla palvelimillaan ilman lisenssimaksuja.
Avoin julkaisu on samalla syy CAISI-arvion tekemiseen. Kun malli ajetaan paikallisesti, kysymyksiä datan kulkeutumisesta kiinalaisille palvelimille ei välttämättä synny. Sen sijaan CAISI muistuttaa, että koulutusdata, painojen takana olevat linjausvalinnat ja mahdolliset tarkoitukselliset poikkeamat eli backdoor-riskit jäävät avoimiksi kysymyksiksi. Painot voi tarkistaa, mutta koulutusprosessia ei.
CAISI:n suositus liittovaltiolle
CAISI suosittaa, että liittovaltio kieltää DeepSeek V4-Pron käytön luokitellussa työssä mutta sallii avoimen tutkimuksen ja vertailun. Suomella ei ole vastaavaa virallista linjausta, vaan päätökset tehdään virastokohtaisesti.
Otin yhteyttä Aalto-yliopiston Reliable AI -tutkimusryhmään pyytääkseni arviota CAISI-raportin merkityksestä Suomen julkiselle sektorille. Ryhmän tutkijoiden mukaan tekninen suorituskyky ei yksin riitä valintaperusteeksi, vaan käyttöönottoa pitää arvioida pitkän aikavälin huoltovarmuuden ja tietosuojan näkökulmasta.
“Avoin painokokoelma ei tarkoita läpinäkyvää koulutusprosessia. Emme tiedä, miten malli on linjattu, millaista dataa on käytetty tai onko mukana ohjattuja vinoumia tiettyihin geopoliittisiin kysymyksiin. Julkishallinnon päätöksenteossa tämä on ongelma, jota teknisillä benchmark-testeillä ei ratkaista.”
Tekoälymallin sisäinen säädettävä luku, jonka avulla malli oppii tunnistamaan kuvioita datasta. Mitä enemmän parametreja, sitä monimutkaisempaa tietoa malli voi käsitellä – DeepSeek V4-Pron 1,6 biljoonaa parametria on yksi maailman suurimmista.
MoE-arkkitehtuuri (Mixture of Experts)
Asiantuntijasekoitus – mallin rakenne, jossa kaikkia parametreja ei käytetä kerralla, vaan vain tehtävään sopiva osa aktivoituu. Säästää laskentatehoa ja energiaa.
Benchmark
Vertailutesti, jolla mitataan ja vertaillaan tekoälymallien suorituskykyä. Esimerkiksi SWE-bench mittaa, kuinka hyvin malli korjaa todellisia ohjelmistovirheitä.
Mitä tämä tarkoittaa Suomelle?
Valtiokonttori, Verohallinto ja Kela ovat viime kuukausina pilotoineet erilaisia tekoälymalleja sisäisissä työnkuluissaan. Avoin DeepSeek V4-Pro tarjoaa houkuttelevan vaihtoehdon: kärkitason suorituskyky ilman lisenssimaksuja ja täysin omalla infrastruktuurilla. Yritykselle, joka tekee päätöstä asiakaspalvelubotin pohjamalliksi, ero kuukausittaisissa lisenssimaksuissa on satoja tuhansia euroja.
Käytännössä mallin ajaminen vaatii kuitenkin huomattavaa laskentakapasiteettia. CSC:n LUMI-supertietokone voisi periaatteessa palvella mallia, mutta varhaisten arvioiden mukaan jokainen samanaikainen käyttäjä vie merkittävän osan resursseista. Pieni- tai keskikokoinen suomalainen yritys ei saa mallia toimimaan ilman pilvikumppania, ja silloin osa hyödystä katoaa lisenssimaksun sijaan kapasiteettilaskuun.
Aalto Reliable AI -ryhmän viesti on, että ennen julkishallinnon laajaa käyttöönottoa tarvitaan riippumaton kotimainen arviointi. Siinä testattaisiin mallin käyttäytymistä suomenkielisillä virkateksteillä, sosiaaliturva-asiakirjojen käsittelyssä ja sensitiivisissä päätöksentekokonteksteissa. CAISI:n englanninkieliset tulokset eivät kerro, miten malli toimii esimerkiksi Verohallinnon päätösperusteluja muotoiltaessa.
Eurooppalaisen vaihtoehdon puute alkaa näkyä
Avoimen kiinalaismallin nousu globaalin kärkitason ohjelmointitestissä siirtää keskustelun painopistettä. Kysymys ei enää ole, voivatko avoimet mallit kilpailla suljettujen kanssa, vaan kenen avoimia malleja länsimaiset hallitukset uskaltavat käyttää. Mistralin viimeisin julkaisu jäi noin 12 prosenttiyksikköä DeepSeek V4-Prosta SWE-benchissä, eikä eurooppalaista mallia, joka kilpailisi suoraan kärjessä, ole näköpiirissä.
Tilanne pakottaa Suomen kaltaisen pienen jäsenmaan tekemään valintoja, joita varten ei ole valmista pelikirjaa. Joko luotetaan amerikkalaiseen suljettuun malliin lisenssimaksulla, kiinalaiseen avoimeen malliin omalla riskillä, tai odotetaan eurooppalaista ratkaisua, joka voi tulla liian myöhään.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.