Anthropic on julkaissut Opus-luokan mallistaan uuden version, Claude Opus 4.8:n. Yhtiö lupaa selvästi vahvempaa suoritusta kolmella kehittäjille tärkeällä alueella: koodauksessa, agenttitehtävissä ja pitkäkestoisessa työssä.
Ajoitus osuu samoihin aikoihin OpenAI:n GPT-5.6:n kanssa, joten kaksi suurinta toimijaa ottavat jälleen mittaa toisistaan. Kehittäjän kannalta kiinnostavaa ei ole se, kumpi voittaa hypekisan, vaan se mitä parannukset tarkoittavat käytännön työssä.
Koodauksessa parempi harkinta, ei vain enemmän rivejä
Anthropicin mukaan Opus 4.8:n suurin muutos koodauksessa on harkinta. Malli kysyy oikeita kysymyksiä ennen kuin se ryntää kirjoittamaan, ja se huomaa omat virheensä kesken työn. Käytännössä tämä vähentää niitä tilanteita, joissa avustaja tuottaa itsevarmasti väärää koodia.
Yhtiö nostaa esiin myös monimutkaiset, useaa palvelua koskevat selvitykset, joissa malli rakentaa ymmärrystä vaiheittain. Vertailuissa Opus 4.8 paranee muun muassa Terminal-Bench 2.1- ja OSWorld-Verified-testeissä, jotka mittaavat työskentelyä oikeassa kehitysympäristössä eivätkä pelkkien tehtäväpätkien ratkaisua.
“Se kysyy oikeat kysymykset, huomaa omat virheensä ja kasvattaa varmuutta monimutkaisissa, useaa palvelua koskevissa selvityksissä.”
Agentti kulkee tehtävän loppuun asti
Agenttitehtävissä Anthropic korostaa tehokkuutta. Yksi yhtiön siteeraama kehittäjä kuvaa, että malli käyttää saman älyn vähemmillä askelilla ja vie tehtävät päästä päähän. Vähemmän askelia tarkoittaa vähemmän kohtia, joissa ketju voi katketa, ja pienempää laskua per ajo.
Selaimessa toimivan agentin Online-Mind2Web-testissä Opus 4.8 ylsi 84 prosenttiin, mikä on Anthropicin mukaan edellistä Opus 4.7:ää ja GPT-5.5:tä parempi tulos. Malli oli yhtiön mukaan myös ensimmäinen, joka ylitti kymmenen prosentin rajan eräässä juridiikan agenttitestissä kaikkien osatehtävien läpäisyssä.
Pitkäkestoinen työ ja täysi teho oletuksena
Kolmas painopiste on johdonmukaisuus pitkissä, monivaiheisissa töissä. Tällä tarkoitetaan tehtäviä, jotka kestävät kymmeniä minuutteja tai tunteja ja vaativat mallilta saman linjan pitämistä alusta loppuun. Juuri tässä aiemmat mallit ovat tyypillisesti alkaneet harhailla.
Opus 4.8 käyttää oletuksena niin sanottua korkean tehon tilaa. Anthropicin mukaan se kuluttaa suunnilleen saman verran tokeneita kuin Opus 4.7, mutta tuottaa paremman tuloksen. Kehittäjän ei siis tarvitse erikseen säätää asetuksia saadakseen mallista parhaan irti.
Mitä se maksaa ja kuka hyötyy
Hinnoittelu pysyy ennallaan: syöte maksaa viisi dollaria miljoonalta tokenilta ja tuotos 25 dollaria. Uutena on nopea tila, joka toimii noin kaksi ja puoli kertaa tavallista nopeammin. API:ssa malli löytyy tunnisteella claude-opus-4-8, mikä helpottaa version lukitsemista tuotantokäytössä.
Suomalaiselle ohjelmistotalolle hyöty on suoraviivainen. Jos agentti hoitaa saman tehtävän vähemmillä askelilla, sekä laskutettava token-määrä että odotusaika pienenevät. Cursorin, Claude Coden tai oman integraation kautta mallia käyttävät tiimit saavat parannukset käyttöönsä ilman omaa koulutusinvestointia, ja sama koskee yksittäistä harrastajakoodaria.
Tavalliselle käyttäjälle muutos näkyy epäsuorasti. Yhä useampi sovellus ja asiakaspalvelubotti nojaa tämän tason malleihin, joten luotettavampi ja halvempi agentti tarkoittaa sujuvampia palveluita ja matalampaa kynnystä rakentaa niitä myös pienissä yrityksissä.
Tekstin perusyksikkö, jonka kielimalli käsittelee. Yksi token on noin puoli suomenkielistä sanaa, ja mallien hinnoittelu lasketaan yleensä tokenien määrästä.
Agenttitehtävä
Tehtävä, jonka tekoäly hoitaa itsenäisesti monessa vaiheessa alusta loppuun, esimerkiksi etsii tietoa, kirjoittaa koodia ja korjaa virheensä ilman, että ihminen ohjaa jokaista askelta.
Kilpailu siirtyy älystä luotettavuuteen
GPT-5.6:n ja Opus 4.8:n rinnakkaiselo kertoo, mihin suuntaan kisa on kääntymässä. Kun mallit ovat jo lähellä toisiaan raa'assa päättelykyvyssä, ratkaisevaksi nousevat luotettavuus pitkissä ajoissa, askelten määrä ja hinta per valmis tehtävä. Nämä ovat juuri niitä mittareita, jotka näkyvät kehittäjän kuukausilaskussa.
OpenAI:n viime viikkojen otsikot ovat pyörineet GPT-5.6:n käyttöönoton rajoitusten ympärillä, kun taas Anthropic myy nyt vakautta ja ennustettavuutta. Se on kehittäjille hyvä ongelma: valittavana on kaksi mallia, jotka molemmat lupaavat tehdä työn loppuun, ja kilpailu painaa hintaa alas.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.