Koneoppiminen

DeepSeek V4 ohitti GPT-5.5:n – Aalto huolissaan

CAISI-arvio nosti kiinalaisen avoimen mallin kärkeen – riski julkishallinnolle?

Hanna HuulivuoHanna Huulivuo
Jaa:
DeepSeek V4 ohitti GPT-5.5:n – Aalto huolissaan
Kuva: Aatu Dorochenko / CC BY-SA 4.0

Yhdysvaltain tekoälyturvallisuusinstituutti CAISI julkisti perjantaina NIST-arvionsa kiinalaisen DeepSeek V4-Pron suorituskyvystä. Tulokset ovat herättäneet Washingtonissa hälytyksen: avoin malli ohitti OpenAI:n GPT-5.5:n Codeforces-ohjelmointirankingissa ja oli tilastollisesti tasoissa Anthropicin Claude Opus 4.7:n kanssa SWE-bench Verified -testissä.

Arvio on ensimmäinen julkinen NIST-tason vertailu, jossa kiinalainen avoimen lähdekoodin malli on noussut absoluuttiselle kärkipaikalle vakavasti otettavissa ohjelmointitesteissä. Aiemmin DeepSeekin julkaisuja on käsitelty enemmän kuriositeetteina, nyt mittaluku muuttuu.

Codeforces-rankingissa kärki, SWE-benchissä tasapeli

DeepSeek V4-Pro saavutti Codeforces-rankingissa Elo-luvun 3206, kun GPT-5.5 jäi 3168:aan. Ero on pieni mutta CAISI:n testimetodologian mukaan tilastollisesti merkittävä. Codeforces mittaa mallin kykyä ratkaista kilpailuohjelmoinnin tehtäviä, ja kärkisija antaa kuvan algoritmisen päättelyn tasosta.

SWE-bench Verifiedissä, joka mittaa todellisten ohjelmistovirheiden korjaamista GitHub-repoissa, DeepSeek V4-Pro ratkaisi 89,4 prosenttia testitehtävistä. Claude Opus 4.7 onnistui 89,7 prosentissa. CAISI luokittelee eron luottamusvälin sisälle eli tilastollisesti tasoiksi. GPT-5.5 jäi tässä testissä noin neljä prosenttiyksikköä jälkeen.

1,6 biljoonan parametrin painot MIT-lisenssillä

Mallin tekninen mittakaava on poikkeuksellinen: 1,6 biljoonaa parametria, joista MoE-arkkitehtuurin ansiosta aktiivisia kerrallaan on noin 220 miljardia. DeepSeek julkaisi koko painokokoelman MIT-lisenssillä, mikä tarkoittaa että kuka tahansa voi ladata, ajaa ja muokata mallin omilla palvelimillaan ilman lisenssimaksuja.

Avoin julkaisu on samalla syy CAISI-arvion tekemiseen. Kun malli ajetaan paikallisesti, kysymyksiä datan kulkeutumisesta kiinalaisille palvelimille ei välttämättä synny. Sen sijaan CAISI muistuttaa, että koulutusdata, painojen takana olevat linjausvalinnat ja mahdolliset tarkoitukselliset poikkeamat eli backdoor-riskit jäävät avoimiksi kysymyksiksi. Painot voi tarkistaa, mutta koulutusprosessia ei.

CAISI:n suositus liittovaltiolle

CAISI suosittaa, että liittovaltio kieltää DeepSeek V4-Pron käytön luokitellussa työssä mutta sallii avoimen tutkimuksen ja vertailun. Suomella ei ole vastaavaa virallista linjausta, vaan päätökset tehdään virastokohtaisesti.

Aalto Reliable AI: julkishallinnon riski tunnistettava

Otin yhteyttä Aalto-yliopiston Reliable AI -tutkimusryhmään pyytääkseni arviota CAISI-raportin merkityksestä Suomen julkiselle sektorille. Ryhmän tutkijoiden mukaan tekninen suorituskyky ei yksin riitä valintaperusteeksi, vaan käyttöönottoa pitää arvioida pitkän aikavälin huoltovarmuuden ja tietosuojan näkökulmasta.

Avoin painokokoelma ei tarkoita läpinäkyvää koulutusprosessia. Emme tiedä, miten malli on linjattu, millaista dataa on käytetty tai onko mukana ohjattuja vinoumia tiettyihin geopoliittisiin kysymyksiin. Julkishallinnon päätöksenteossa tämä on ongelma, jota teknisillä benchmark-testeillä ei ratkaista.

Aalto Reliable AI -tutkimusryhmä, kommentti AI Suomelle
3 206

DeepSeek V4-Pro Codeforces Elo

3 168

GPT-5.5 Codeforces Elo

89,4 %

DeepSeek SWE-bench Verified

1,6 bilj.

Parametria, MIT-lisenssi

CAISI / NIST, toukokuu 2026

DeepSeek V4-Pro vs. kärkikilpailijat

DeepSeek V4-Pro

Avoin (MIT), 1,6 bilj. parametria

Codeforces Elo
3 206
SWE-bench Verified
89,4 %
Lisenssi
MIT, painot avoimet

Claude Opus 4.7

Anthropicin lippulaiva

Codeforces Elo
ei julkaistu
SWE-bench Verified
89,7 %
Lisenssi
Suljettu API

GPT-5.5

OpenAI:n uusin

Codeforces Elo
3 168
SWE-bench Verified
noin 85 % (arvio)
Lisenssi
Suljettu API

CAISI / NIST, toukokuu 2026

Sanasto

Parametri
Tekoälymallin sisäinen säädettävä luku, jonka avulla malli oppii tunnistamaan kuvioita datasta. Mitä enemmän parametreja, sitä monimutkaisempaa tietoa malli voi käsitellä – DeepSeek V4-Pron 1,6 biljoonaa parametria on yksi maailman suurimmista.
MoE-arkkitehtuuri (Mixture of Experts)
Asiantuntijasekoitus – mallin rakenne, jossa kaikkia parametreja ei käytetä kerralla, vaan vain tehtävään sopiva osa aktivoituu. Säästää laskentatehoa ja energiaa.
Benchmark
Vertailutesti, jolla mitataan ja vertaillaan tekoälymallien suorituskykyä. Esimerkiksi SWE-bench mittaa, kuinka hyvin malli korjaa todellisia ohjelmistovirheitä.

Mitä tämä tarkoittaa Suomelle?

Valtiokonttori, Verohallinto ja Kela ovat viime kuukausina pilotoineet erilaisia tekoälymalleja sisäisissä työnkuluissaan. Avoin DeepSeek V4-Pro tarjoaa houkuttelevan vaihtoehdon: kärkitason suorituskyky ilman lisenssimaksuja ja täysin omalla infrastruktuurilla. Yritykselle, joka tekee päätöstä asiakaspalvelubotin pohjamalliksi, ero kuukausittaisissa lisenssimaksuissa on satoja tuhansia euroja.

Käytännössä mallin ajaminen vaatii kuitenkin huomattavaa laskentakapasiteettia. CSC:n LUMI-supertietokone voisi periaatteessa palvella mallia, mutta varhaisten arvioiden mukaan jokainen samanaikainen käyttäjä vie merkittävän osan resursseista. Pieni- tai keskikokoinen suomalainen yritys ei saa mallia toimimaan ilman pilvikumppania, ja silloin osa hyödystä katoaa lisenssimaksun sijaan kapasiteettilaskuun.

Aalto Reliable AI -ryhmän viesti on, että ennen julkishallinnon laajaa käyttöönottoa tarvitaan riippumaton kotimainen arviointi. Siinä testattaisiin mallin käyttäytymistä suomenkielisillä virkateksteillä, sosiaaliturva-asiakirjojen käsittelyssä ja sensitiivisissä päätöksentekokonteksteissa. CAISI:n englanninkieliset tulokset eivät kerro, miten malli toimii esimerkiksi Verohallinnon päätösperusteluja muotoiltaessa.

Eurooppalaisen vaihtoehdon puute alkaa näkyä

Avoimen kiinalaismallin nousu globaalin kärkitason ohjelmointitestissä siirtää keskustelun painopistettä. Kysymys ei enää ole, voivatko avoimet mallit kilpailla suljettujen kanssa, vaan kenen avoimia malleja länsimaiset hallitukset uskaltavat käyttää. Mistralin viimeisin julkaisu jäi noin 12 prosenttiyksikköä DeepSeek V4-Prosta SWE-benchissä, eikä eurooppalaista mallia, joka kilpailisi suoraan kärjessä, ole näköpiirissä.

Tilanne pakottaa Suomen kaltaisen pienen jäsenmaan tekemään valintoja, joita varten ei ole valmista pelikirjaa. Joko luotetaan amerikkalaiseen suljettuun malliin lisenssimaksulla, kiinalaiseen avoimeen malliin omalla riskillä, tai odotetaan eurooppalaista ratkaisua, joka voi tulla liian myöhään.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.