DeepSeek työnsi keskiviikkona jakeluun uuden lippulaivamallinsa DeepSeek-V4-Pro-0813. Julkaisusta ei kirjoitettu blogitekstiä, ei muutoslokia eikä tiedotetta. Yhtiön sivuille ilmestyi lyhyt maininta parannetuista agenttikyvyistä, ja South China Morning Postin mukaan sekin oli ehditty poistaa seuraavana iltapäivänä.
Malli on ladattavissa Hugging Facesta MIT-lisenssillä ja käytettävissä rajapinnan kautta nimellä deepseek-v4-pro. Mallikortissa on taulukollinen mittaustuloksia, joissa osa luvuista on moninkertaistunut edellisestä versiosta. Jokainen niistä on DeepSeekin itsensä ilmoittama, eikä yksikään ole tätä kirjoitettaessa riippumattomasti varmennettu.
Se ei tarkoita, että luvut olisivat vääriä. Se tarkoittaa, ettei niitä voi vielä käyttää perusteluna yhdellekään päätökselle.
Luvut ovat mallin tekijän omia
Kaikki tässä jutussa mainitut mittaustulokset ovat peräisin DeepSeekin omasta mallikortista. Riippumattomat arvioijat, kuten Artificial Analysis ja Vals, ovat julkaisseet omia mittauksiaan, ja ne kertovat osin eri tarinaa. Yhtiön ilmoittamia testiajoja ei ole toistettu ulkopuolisin voimin.
Kolme lukua ja yksi ristiriita
Isoin harppaus on DeepSWE-testissä, joka mittaa ohjelmistovirheiden korjaamista oikeista koodivarastoista poimituissa tehtävissä. Esiversio sai 12,8, uusi versio 62,7. Ero on 49,9 prosenttiyksikköä. Niin iso hyppy kertoo yleensä enemmän esiversion rikkinäisyydestä kuin uuden version nerokkuudesta.
Toinen luku on Terminal Bench 2.1, jossa malli ohjaa komentoriviä eristetyssä ympäristössä. DeepSeekin oma tulos on 87,9 aiemman 72,1 sijaan. Tästä alkaa ristiriita: riippumattomien arvioijien mukaan malli nimenomaan kompuroi hiekkalaatikkoympäristön komentorivitehtävissä ja monimutkaisissa taulukkolaskentamalleissa.
Artificial Analysis antoi mallille 53 pistettä älykkyysindeksissään, saman kuin Zhipun GLM-5.2:lle. Vals-indeksissä sija oli kahdestoista. Molemmissa jäädään selvästi OpenAI:n GPT-5.6:n ja Anthropicin Claude Opus 5:n taakse. Kärkimallin sijaan kyseessä on vahva kakkosketju.
“Merkittävästi parannetut agenttikyvyt ja suorituskykyparannukset, jotka korostuvat erityisesti tuotantoympäristöissä.”
Hinta on tässä se oikea uutinen
Rajapintahinta on 0,435 dollaria miljoonalta syötetokenilta ja 0,87 dollaria miljoonalta tuotetokenilta. Välimuistiosumat maksavat murto-osan siitä. Artificial Analysisin sekoitettu hinta-arvio tavanomaisella käyttöprofiililla on noin 0,18 dollaria miljoonalta tokenilta.
Kärkimallien vastaavat hinnat liikkuvat kymmenissä dollareissa. Karkeasti laskien agenttikoodaus maksaa DeepSeekillä noin kuudeskymmenesosan siitä, mitä kalleimmilla malleilla, ja tulokset ovat samassa haarukassa, jos mallikortin lukuihin uskoo. Ehto on iso, mutta suuruusluokka ei muutu vaikka luvut olisivat parikymmentä prosenttia optimistisia.
Ero näkyy suoraan ohjelmistoyritysten kuluissa. Koodausagentti, joka jauhaa taustalla koko työpäivän, kuluttaa helposti kymmeniä miljoonia tokeneita viikossa. Siinä kokoluokassa hinta ratkaisee, onko agentti työkalu vai budjettirivi, jota katsotaan kuukausittain hampaat irvessä.
Suomalaiselle ohjelmistotalolle avoin MIT-lisenssi tarkoittaa myös, että painot voi ajaa omalla raudalla tai eurooppalaisessa konesalissa, jolloin asiakkaan koodi ei lähde minkään rajapinnan taakse. Hintapaine valuu ennen pitkää myös suljettujen mallien hinnastoihin, ja se näkyy lopulta jokaisen kehittäjätyökalun kuukausimaksussa.
CyberGym on se luku, josta pitäisi puhua
CyberGym on Kalifornian Berkeleyn yliopistossa rakennettu testistö, jossa mallille annetaan haavoittuvuuskuvaus ja paikkaamaton koodivarasto. Tehtävä on kirjoittaa todiste siitä, että vika oikeasti laukeaa. Tapauksia on 1 507 kappaletta 188 oikeasta ohjelmistoprojektista, eli kyse ei ole keksityistä harjoitustehtävistä.
DeepSeekin ilmoittama tulos nousi esiversion 52,7:stä lukemaan 83,3. Jos luku pitää paikkansa, malli osaa neljä kertaa viidestä muuttaa sanallisen haavoittuvuuskuvauksen toimivaksi todisteeksi oikeassa koodissa.
Kyky on kaksipiippuinen juttu. Sama työkalu, joka auttaa tietoturvatiimiä löytämään vian ennen kuin joku muu löytää sen, auttaa yhtä hyvin sitä jotakuta muuta. Ero puolustajan ja hyökkääjän välillä ei ole tekninen vaan se, kumman koodivarastoa tutkitaan.
MIT-lisenssi poistaa tästä viimeisenkin portin. Suljetun rajapinnan takana olevalta mallilta voi evätä pääsyn, käyttöehdot voi panna täytäntöön ja kyselyt voi lokittaa. Paikallisesti ajettavalta biljoonaluokan avoimelta mallilta ei voi. Kun painot ovat kerran levinneet, niitä ei kutsuta takaisin.



