Tekoäly

Anthropicin Sonnet 4.6 haastaa oman lippulaivamallinsa – viidenneksen hinnalla

Uusi Sonnet 4.6 pärjää koodauksessa ja agenttitehtävissä lähes Opus-tasoisesti, mutta maksaa murto-osan. Kehittäjäyhteisö reagoi ristiriitaisesti.

Aino AikajärviAino Aikajärvi
Jaa:
Anthropicin Sonnet 4.6 haastaa oman lippulaivamallinsa – viidenneksen hinnalla

Anthropic julkaisi tiistaina 17. helmikuuta Claude Sonnet 4.6 -mallin – vain kaksi viikkoa Opus 4.6:n jälkeen. Uutuus on nyt oletusmallinaan sekä ilmais- että Pro-käyttäjille claude.ai-palvelussa. Hintaa ei nostettu: 3 dollaria per miljoona syötetokenia ja 15 dollaria per miljoona tuotostokenia. Se on viidennes Opuksen hinnasta.

Luvut ovat huomattavia. SWE-bench Verified -koodaustestissä Sonnet 4.6 sai 79,6 prosenttia – vain 1,2 prosenttiyksikköä Opus 4.6:n alapuolella. OSWorld-tietokoneen käyttötestissä tulos oli 72,5 prosenttia, kun Opus pääsi 72,7:ään. Kehittäjät suosivat Claude Code -testauksessa Sonnet 4.6:ta Sonnet 4.5:n sijaan 70 prosentissa tapauksista ja jopa edellisen lippulaivan Opus 4.5:n sijaan 59 prosentissa tapauksista.

Miljoona tokenia ja kontekstin tiivistys

Sonnet 4.6 tuo mukanaan beetassa miljoonan tokenin konteksti-ikkunan – tarpeeksi kokonaisen koodipohjan, pitkien sopimusten tai kymmenien tutkimuspapereiden syöttämiseen yhdellä kertaa. Anthropic esitteli samalla context compaction -ominaisuuden, joka tiivistää vanhaa keskusteluhistoriaa automaattisesti. Käytännössä agentti-istunnot voivat jatkua rajattomasti ilman, että konteksti loppuu kesken.

TechCrunchin mukaan Sonnet 4.6 on ensimmäinen Sonnet-tason malli, joka tukee koko koodipohjan analysointia yhdessä kehotteessa. ARC-AGI-2-testissä malli sai 60,4 prosenttia – enemmän kuin useimmat kilpailijat, vaikka Opus 4.6 ja Googlen Gemini 3 Deep Think pärjäsivät vielä paremmin.

Kehittäjät reagoivat – innostusta ja skeptisyyttä

Hacker Newsin keskustelussa Handy-Man nosti esiin hinta-laatusuhteen: malli on "2–3 kertaa halvempi" kuin Opus, mutta pärjää lähes yhtä hyvin. cube2222 kuvaili Sonnet 4.6:ta "voitoksi kaikille, jotka rakentavat agenttipohjaisia tekoälyavustajia" parannetun työkalunkäytön ansiosta.

X:ssä käyttäjä underwood kertoi yllättyneensä mallin tasosta: hän oli tottunut säätämään Geminin ja ChatGPT:n tuottamia kehotteita käsin, mutta Sonnet 4.6:n tuotokset olivat "heti käyttökelpoisia". Visual Studio Code -tiimi ilmoitti mallin olevan saatavilla suoraan editorissa GitHub Copilotin kautta.

Kaikki eivät kuitenkaan olleet varauksetta innoissaan. Hacker Newsin deanc kritisoi Anthropicin vertailujen valikoivuutta ja kysyi, miksi uutta mallia ei verrattu suoraan OpenAI:n tuoreimpaan 5.3-codex-malliin. Käyttäjä rvz puolestaan epäili, pystyykö Anthropic pitämään etumatkansa avoimen lähdekoodin malleihin nähden pitkällä aikavälillä.

Andon Labs: lähes yhtä vaikuttava – ja lähes yhtä huolestuttava

Tekoälyn turvallisuutta ja kyvykkyyttä arvioiva Andon Labs testasi Sonnet 4.6:ta Vending-Bench 2 -testissään, jossa tekoäly pyörittää automaattista myyntiliiketoimintaa vuoden ajan. Sonnet 4.6 saavutti toiseksi parhaan tuloksen 7 204 dollarin loppusaldolla – heti Opus 4.6:n (8 018 dollaria) jälkeen.

Andon Labsin viesti X:ssä oli kaksijakoinen: "Lähes yhtä vaikuttava ja lähes yhtä huolestuttava kuin Opus, kolmanneksen hinnalla." Huoli liittyy siihen, että parhaiten pärjäävät mallit käyttävät testissä taktiikoita, joita voi pitää eettisesti kyseenalaisina – tehokkuus ja aggressiivisuus kulkevat käsi kädessä.

Simon Willison: vakuuttava vastine rahalle

Tunnettu kehittäjä ja bloggaaja Simon Willison testasi Sonnet 4.6:ta omissa työkaluissaan. Hän totesi mallin suoriutuvan "samalla tasolla kuin marraskuun Opus 4.5", mutta Sonnet-hinnoittelulla. Willison kiinnitti huomiota siihen, että Sonnet 4.6:n tietorajaus ulottuu elokuuhun 2025 – tuoreempi kuin Opus 4.5:n toukokuun 2025 rajaus.

Luovissa testeissä Willison havaitsi mallin omaperäisyyden: SVG-pelikaaneja piirtäessä Sonnet 4.6 lisäsi lintujen päähän silinterihatun. "Opus tuottaa anatomisesti tarkempia kuvia, mutta Sonnetin silinteri on hauska yksityiskohta", Willison kirjoitti.

Sonnet 4.6:n julkaisu tiivistää trendiä, jossa tekoäly-yhtiöiden keskiluokan mallit lähestyvät lippulaivojen tasoa. Kehittäjille tämä tarkoittaa, että Opus-tasoinen suorituskyky on nyt saatavilla budjetilla, joka tekee agenttipohjaisten sovellusten pyörittämisestä taloudellisesti järkevää. Anthropicin mukaan päivitetty Haiku-malli seuraa viikkojen sisällä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.