Anthropic julkaisi 7. lokakuuta Claude Haiku 5.5:n. Alle 100 000 tokenin kehotteissa sen hinta on kymmenesosa edeltäjän hinnasta, mutta yhtiö arvioi keskimääräiseksi säästöksi vain 75 prosenttia. Selvitimme, mistä ero syntyy ja mihin halpa malli kelpaa.
DeepSeek julkaisi V4.1 Flashin avoimin painoin MIT-lisenssillä. Välimuistiosuma maksaa 0,003 dollaria miljoonalta tokenilta, kun Claude Opus 5 veloittaa 0,50. Yhtiö kertoo mallin ohittavan Opus 5:n ja GPT-5.6:n, mutta mittaustuloksia ei ole vahvistettu yhtiön ulkopuolella.
Motionalin robottitaksi pysähtyi suljetulla radalla joka kerta pyöräilijän kohdalla. MIT:n ja Motionalin Nature-tutkimus paljasti, ettei auto ollut tunnistanut pyöräilijää lainkaan, ja sen valitsemat ajolinjat olisivat johtaneet törmäykseen. Jarrutuksen teki erillinen varajärjestelmä.
GitHub julkisti HydraFusionin, joka päättää jokaisen koodauspyynnön kohdalla, ratkaistaanko se halvalla mallilla, kaskadina vai kahden mallin kritiikkinä. Kulut laskivat kaikissa kolmessa vertailussa, mutta laatu säilyi vain yhdessä. Luvut ovat GitHub:n omia.
Z.ai jätti GLM-5.3:n painot lukkoon noin kahdeksi viikoksi turvallisuusarvioinnin ajaksi. Malli sai CyberGym-testissä 84,5 prosenttia ja löysi 2 436 haavoittuvuutta 269 avoimen lähdekoodin projektista. Mikään sääntely ei pakottanut pidättelemään.
Kevyt koodaus eli vibe coding on levinnyt lähes kaikkialle, mutta vain kolmannes kehittäjistä luottaa tekoälyn tuottamaan koodiin. Veracoden testeissä 45 prosentissa tekoälykoodista oli haavoittuvuus, ja nyt niitä löytyy myös itse koodaustyökaluista.
Moonshot AI julkaisee Kimi K3:n painokertoimet 27. heinäkuuta ilmaiseksi kenen tahansa käyttöön. Paketti on kvantisoituna noin 1,4 teratavua, ja pelkkien painokertoimien muistissa pitämiseen arvioidaan tarvittavan 18 H100-korttia. Laskimme, mitä se maksaisi suomalaiselle yritykselle.
Moonshot AI keskeytti uusien tilausten myynnin vain päiviä Kimi K3:n julkaisun jälkeen, kun kysyntä ylitti palvelinkapasiteetin. Avoimet painot aukeavat vasta 27.7., ja kilpaileva DeepSeek V4 ehtii markkinoille 24.7. Buumi paljastaa, ettei kiinalaisjättienkään laskenta riitä.
Metan päivitetty agenttimalli Muse Spark 1.1 nousi JobBench- ja Finance Agent V2 -vertailujen kärkeen. Malli ottaa miljoonan tokenin kontekstin, käyttää tietokonetta kolmella alustalla ja delegoi tehtäviä rinnakkaisille aliagenteille. Meta haastaa OpenAI:n ja Anthropicin.
Alibaba esitteli Qwen3.8 Max -mallin, jossa on 2,4 biljoonaa parametria. Yhtiö asettaa sen heti Anthropicin Fable 5:n taakse maailman kärkeen. Erona länsimaisiin lippulaivoihin malli julkaistaan avoimin painoin, eli kuka tahansa voi ladata ja muokata sitä.
Google Research julkaisi teoreettisen työn, jonka mukaan kuvantuottomallien luovuus on matemaattinen seuraus neuroverkkojen oppimistavasta, ei satunnaisuutta. Tulos haastaa käsityksen siitä, että mallit vain kopioivat opetusdataansa.
DeepSeekin V4-mallin vakaa versio saapuu 24. heinäkuuta noin 0,44 dollarin ulostulohinnalla miljoonaa tokenia kohti. Hinta asettaa alalle uuden lattian ja kiristää painetta OpenAI:n, Anthropicin ja Googlen suljettuja huippumalleja kohtaan.