Tekoäly

Opus 4.8 vie agenttitehtävät maaliin vähemmillä askelilla

Anthropicin päivitys haastaa GPT-5.6:n kehittäjien arjessa.

Aino AikajärviAino Aikajärvi
Jaa:
Opus 4.8 vie agenttitehtävät maaliin vähemmillä askelilla
Kuva: TechCrunch / CC BY 2.0

Anthropic on julkaissut Opus-luokan mallistaan uuden version, Claude Opus 4.8:n. Yhtiö lupaa selvästi vahvempaa suoritusta kolmella kehittäjille tärkeällä alueella: koodauksessa, agenttitehtävissä ja pitkäkestoisessa työssä.

Ajoitus osuu samoihin aikoihin OpenAI:n GPT-5.6:n kanssa, joten kaksi suurinta toimijaa ottavat jälleen mittaa toisistaan. Kehittäjän kannalta kiinnostavaa ei ole se, kumpi voittaa hypekisan, vaan se mitä parannukset tarkoittavat käytännön työssä.

Koodauksessa parempi harkinta, ei vain enemmän rivejä

Anthropicin mukaan Opus 4.8:n suurin muutos koodauksessa on harkinta. Malli kysyy oikeita kysymyksiä ennen kuin se ryntää kirjoittamaan, ja se huomaa omat virheensä kesken työn. Käytännössä tämä vähentää niitä tilanteita, joissa avustaja tuottaa itsevarmasti väärää koodia.

Yhtiö nostaa esiin myös monimutkaiset, useaa palvelua koskevat selvitykset, joissa malli rakentaa ymmärrystä vaiheittain. Vertailuissa Opus 4.8 paranee muun muassa Terminal-Bench 2.1- ja OSWorld-Verified-testeissä, jotka mittaavat työskentelyä oikeassa kehitysympäristössä eivätkä pelkkien tehtäväpätkien ratkaisua.

“Se kysyy oikeat kysymykset, huomaa omat virheensä ja kasvattaa varmuutta monimutkaisissa, useaa palvelua koskevissa selvityksissä.”

— Anthropicin julkaisussa siteerattu kehittäjä, Opus 4.8:n testaaja

Agentti kulkee tehtävän loppuun asti

Agenttitehtävissä Anthropic korostaa tehokkuutta. Yksi yhtiön siteeraama kehittäjä kuvaa, että malli käyttää saman älyn vähemmillä askelilla ja vie tehtävät päästä päähän. Vähemmän askelia tarkoittaa vähemmän kohtia, joissa ketju voi katketa, ja pienempää laskua per ajo.

Selaimessa toimivan agentin Online-Mind2Web-testissä Opus 4.8 ylsi 84 prosenttiin, mikä on Anthropicin mukaan edellistä Opus 4.7:ää ja GPT-5.5:tä parempi tulos. Malli oli yhtiön mukaan myös ensimmäinen, joka ylitti kymmenen prosentin rajan eräässä juridiikan agenttitestissä kaikkien osatehtävien läpäisyssä.

Pitkäkestoinen työ ja täysi teho oletuksena

Kolmas painopiste on johdonmukaisuus pitkissä, monivaiheisissa töissä. Tällä tarkoitetaan tehtäviä, jotka kestävät kymmeniä minuutteja tai tunteja ja vaativat mallilta saman linjan pitämistä alusta loppuun. Juuri tässä aiemmat mallit ovat tyypillisesti alkaneet harhailla.

Opus 4.8 käyttää oletuksena niin sanottua korkean tehon tilaa. Anthropicin mukaan se kuluttaa suunnilleen saman verran tokeneita kuin Opus 4.7, mutta tuottaa paremman tuloksen. Kehittäjän ei siis tarvitse erikseen säätää asetuksia saadakseen mallista parhaan irti.

Mitä se maksaa ja kuka hyötyy

Hinnoittelu pysyy ennallaan: syöte maksaa viisi dollaria miljoonalta tokenilta ja tuotos 25 dollaria. Uutena on nopea tila, joka toimii noin kaksi ja puoli kertaa tavallista nopeammin. API:ssa malli löytyy tunnisteella claude-opus-4-8, mikä helpottaa version lukitsemista tuotantokäytössä.

Suomalaiselle ohjelmistotalolle hyöty on suoraviivainen. Jos agentti hoitaa saman tehtävän vähemmillä askelilla, sekä laskutettava token-määrä että odotusaika pienenevät. Cursorin, Claude Coden tai oman integraation kautta mallia käyttävät tiimit saavat parannukset käyttöönsä ilman omaa koulutusinvestointia, ja sama koskee yksittäistä harrastajakoodaria.

Tavalliselle käyttäjälle muutos näkyy epäsuorasti. Yhä useampi sovellus ja asiakaspalvelubotti nojaa tämän tason malleihin, joten luotettavampi ja halvempi agentti tarkoittaa sujuvampia palveluita ja matalampaa kynnystä rakentaa niitä myös pienissä yrityksissä.

84 %↑

Online-Mind2Web, selainagentti

5 $ / 25 $

Hinta per milj. tokenia (syöte / tuotos)

2,5×↑

Nopea tila vs. tavallinen

Anthropic, Claude Opus 4.8

Sanasto

Token
Tekstin perusyksikkö, jonka kielimalli käsittelee. Yksi token on noin puoli suomenkielistä sanaa, ja mallien hinnoittelu lasketaan yleensä tokenien määrästä.
Agenttitehtävä
Tehtävä, jonka tekoäly hoitaa itsenäisesti monessa vaiheessa alusta loppuun, esimerkiksi etsii tietoa, kirjoittaa koodia ja korjaa virheensä ilman, että ihminen ohjaa jokaista askelta.

Kilpailu siirtyy älystä luotettavuuteen

GPT-5.6:n ja Opus 4.8:n rinnakkaiselo kertoo, mihin suuntaan kisa on kääntymässä. Kun mallit ovat jo lähellä toisiaan raa'assa päättelykyvyssä, ratkaisevaksi nousevat luotettavuus pitkissä ajoissa, askelten määrä ja hinta per valmis tehtävä. Nämä ovat juuri niitä mittareita, jotka näkyvät kehittäjän kuukausilaskussa.

OpenAI:n viime viikkojen otsikot ovat pyörineet GPT-5.6:n käyttöönoton rajoitusten ympärillä, kun taas Anthropic myy nyt vakautta ja ennustettavuutta. Se on kehittäjille hyvä ongelma: valittavana on kaksi mallia, jotka molemmat lupaavat tehdä työn loppuun, ja kilpailu painaa hintaa alas.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Datakeskus söisi Lapinlahdella kokonaisen kaupungin sähköt
  4. 4Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  5. 5Google kaatoi 300 hehtaaria metsää – virasto selvittää

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.