Tekoäly

DeepSeek julkaisi uuden mallin salaa – kukaan ei ole tarkistanut lukuja

Mallikortti lupaa jopa 50 prosenttiyksikön harppauksia, kaikki yhtiön itse mittaamia.

Hanna HuulivuoHanna Huulivuo
Jaa:
DeepSeek julkaisi uuden mallin salaa – kukaan ei ole tarkistanut lukuja
Kuva: Unknown authorUnknown author / Public domain

DeepSeek työnsi keskiviikkona jakeluun uuden lippulaivamallinsa DeepSeek-V4-Pro-0813. Julkaisusta ei kirjoitettu blogitekstiä, ei muutoslokia eikä tiedotetta. Yhtiön sivuille ilmestyi lyhyt maininta parannetuista agenttikyvyistä, ja South China Morning Postin mukaan sekin oli ehditty poistaa seuraavana iltapäivänä.

Malli on ladattavissa Hugging Facesta MIT-lisenssillä ja käytettävissä rajapinnan kautta nimellä deepseek-v4-pro. Mallikortissa on taulukollinen mittaustuloksia, joissa osa luvuista on moninkertaistunut edellisestä versiosta. Jokainen niistä on DeepSeekin itsensä ilmoittama, eikä yksikään ole tätä kirjoitettaessa riippumattomasti varmennettu.

Se ei tarkoita, että luvut olisivat vääriä. Se tarkoittaa, ettei niitä voi vielä käyttää perusteluna yhdellekään päätökselle.

Luvut ovat mallin tekijän omia

Kaikki tässä jutussa mainitut mittaustulokset ovat peräisin DeepSeekin omasta mallikortista. Riippumattomat arvioijat, kuten Artificial Analysis ja Vals, ovat julkaisseet omia mittauksiaan, ja ne kertovat osin eri tarinaa. Yhtiön ilmoittamia testiajoja ei ole toistettu ulkopuolisin voimin.

Kolme lukua ja yksi ristiriita

Isoin harppaus on DeepSWE-testissä, joka mittaa ohjelmistovirheiden korjaamista oikeista koodivarastoista poimituissa tehtävissä. Esiversio sai 12,8, uusi versio 62,7. Ero on 49,9 prosenttiyksikköä. Niin iso hyppy kertoo yleensä enemmän esiversion rikkinäisyydestä kuin uuden version nerokkuudesta.

Toinen luku on Terminal Bench 2.1, jossa malli ohjaa komentoriviä eristetyssä ympäristössä. DeepSeekin oma tulos on 87,9 aiemman 72,1 sijaan. Tästä alkaa ristiriita: riippumattomien arvioijien mukaan malli nimenomaan kompuroi hiekkalaatikkoympäristön komentorivitehtävissä ja monimutkaisissa taulukkolaskentamalleissa.

Artificial Analysis antoi mallille 53 pistettä älykkyysindeksissään, saman kuin Zhipun GLM-5.2:lle. Vals-indeksissä sija oli kahdestoista. Molemmissa jäädään selvästi OpenAI:n GPT-5.6:n ja Anthropicin Claude Opus 5:n taakse. Kärkimallin sijaan kyseessä on vahva kakkosketju.

“Merkittävästi parannetut agenttikyvyt ja suorituskykyparannukset, jotka korostuvat erityisesti tuotantoympäristöissä.”

— DeepSeekin mallikortti, Ainoa julkaisun yhteydessä annettu kuvaus mallista

Hinta on tässä se oikea uutinen

Rajapintahinta on 0,435 dollaria miljoonalta syötetokenilta ja 0,87 dollaria miljoonalta tuotetokenilta. Välimuistiosumat maksavat murto-osan siitä. Artificial Analysisin sekoitettu hinta-arvio tavanomaisella käyttöprofiililla on noin 0,18 dollaria miljoonalta tokenilta.

Kärkimallien vastaavat hinnat liikkuvat kymmenissä dollareissa. Karkeasti laskien agenttikoodaus maksaa DeepSeekillä noin kuudeskymmenesosan siitä, mitä kalleimmilla malleilla, ja tulokset ovat samassa haarukassa, jos mallikortin lukuihin uskoo. Ehto on iso, mutta suuruusluokka ei muutu vaikka luvut olisivat parikymmentä prosenttia optimistisia.

Ero näkyy suoraan ohjelmistoyritysten kuluissa. Koodausagentti, joka jauhaa taustalla koko työpäivän, kuluttaa helposti kymmeniä miljoonia tokeneita viikossa. Siinä kokoluokassa hinta ratkaisee, onko agentti työkalu vai budjettirivi, jota katsotaan kuukausittain hampaat irvessä.

Suomalaiselle ohjelmistotalolle avoin MIT-lisenssi tarkoittaa myös, että painot voi ajaa omalla raudalla tai eurooppalaisessa konesalissa, jolloin asiakkaan koodi ei lähde minkään rajapinnan taakse. Hintapaine valuu ennen pitkää myös suljettujen mallien hinnastoihin, ja se näkyy lopulta jokaisen kehittäjätyökalun kuukausimaksussa.

CyberGym on se luku, josta pitäisi puhua

CyberGym on Kalifornian Berkeleyn yliopistossa rakennettu testistö, jossa mallille annetaan haavoittuvuuskuvaus ja paikkaamaton koodivarasto. Tehtävä on kirjoittaa todiste siitä, että vika oikeasti laukeaa. Tapauksia on 1 507 kappaletta 188 oikeasta ohjelmistoprojektista, eli kyse ei ole keksityistä harjoitustehtävistä.

DeepSeekin ilmoittama tulos nousi esiversion 52,7:stä lukemaan 83,3. Jos luku pitää paikkansa, malli osaa neljä kertaa viidestä muuttaa sanallisen haavoittuvuuskuvauksen toimivaksi todisteeksi oikeassa koodissa.

Kyky on kaksipiippuinen juttu. Sama työkalu, joka auttaa tietoturvatiimiä löytämään vian ennen kuin joku muu löytää sen, auttaa yhtä hyvin sitä jotakuta muuta. Ero puolustajan ja hyökkääjän välillä ei ole tekninen vaan se, kumman koodivarastoa tutkitaan.

MIT-lisenssi poistaa tästä viimeisenkin portin. Suljetun rajapinnan takana olevalta mallilta voi evätä pääsyn, käyttöehdot voi panna täytäntöön ja kyselyt voi lokittaa. Paikallisesti ajettavalta biljoonaluokan avoimelta mallilta ei voi. Kun painot ovat kerran levinneet, niitä ei kutsuta takaisin.

0,18 $↓

Sekoitettu hinta miljoonalta tokenilta

53

Älykkyysindeksi, sija 12 Artificial Analysis -listalla

1 507

CyberGym-tapausta 188 projektista

Artificial Analysis, DeepSeekin hinnasto ja CyberGym

Sanasto

Mallikortti
Mallin mukana julkaistava tekninen tietolomake, jossa kerrotaan mitä malli osaa, miten sitä on testattu ja millaisia rajoituksia siinä on. Tiedot ovat mallin tekijän itsensä ilmoittamia.
Painot
Mallin oppimisen tulos eli valtava joukko lukuja, jotka määräävät miten malli vastaa. Kun painot julkaistaan avoimesti, kuka tahansa voi ladata ne ja ajaa mallin omalla koneellaan ilman yhteyttä tekijän palvelimiin.
Token
Tekstin perusyksikkö, jonka kielimalli käsittelee. Yksi token on noin puoli suomen kielen sanaa, ja mallin käytön hinta lasketaan yleensä miljoonaa tokenia kohden.

Hiljaisuus on itsessään valinta

Tiedotteettomassa julkaisussa on oma logiikkansa. Kun uusi malli ei ole tapahtuma vaan versionumeron nosto, se ei kerää samaa huomiota eikä kutsu samaa vertailua. Se siirtää arviointivastuun kokonaan ulkopuolisille, ja heiltä menee viikkoja.

Sillä välin mallia ehditään ajaa tuotannossa. Tietoturva-arviot tehdään julkaisun jälkeen, ei ennen sitä, ja avoimin painoin julkaistun mallin kohdalla jälkikäteen tarkoittaa lopullista. Jos CyberGym-tulos osoittautuu ulkopuolisessa toistossa oikeaksi, keskustelu avointen mallien kyberturvakyvyistä käydään mallilla, joka on jo kaikkien ladattavissa.

Seuraava kiinnostava luku ei siis tule DeepSeekiltä. Se tulee Berkeleyn ryhmältä tai joltakin muulta, joka ajaa testin itse ja kertoo mitä sai.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Datakeskus söisi Lapinlahdella kokonaisen kaupungin sähköt
  4. 4Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  5. 5Google kaatoi 300 hehtaaria metsää – virasto selvittää

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.