Yashodha Bhavnani vastaa pilvitallennusyhtiö Boxin tekoälytuotteista. Hän on testannut Anthropicin uutta pientä kielimallia jo ennen julkaisua. Boxin testeissä malli päihitti edeltäjänsä selvästi ja vastasi noin kaksi kertaa nopeammin, ja yhtiö harkitsee sitä analyyttiseen työhön suuressa mittakaavassa.
“Varhaisissa testeissä Claude Haiku 5.5 sai 11 pistettä enemmän kuin Haiku 4.5, noin puolella viiveestä.”
Anthropic julkaisi Claude Haiku 5.5:n 7. lokakuuta. Haiku on yhtiön pienin ja halvin mallisarja. Isompi Sonnet ja suurin Opus päättelevät paremmin, mutta ne maksavat moninkertaisesti. Uutuuden tärkein myyntivaltti on hinta. Malli on saatavilla Clauden API:n kautta sekä AWS:n, Google Cloudin ja Microsoft Azuren palveluissa.
Kymmenesosa vai neljännes?
Kun kehote on alle 100 000 tokenia, syöte maksaa 0,10 dollaria ja mallin tuottama teksti 0,50 dollaria miljoonalta tokenilta. Haiku 4.5:llä vastaavat hinnat ovat 1 ja 5 dollaria, joten tokenihinta putoaa 90 prosenttia. Token on tekstin pala, jonka malli käsittelee kerralla. Englanninkielisessä tekstissä sanaa kohti kuluu keskimäärin vähän yli yksi token.
Anthropic itse lupaa silti vain noin 75 prosentin säästön. Eroon on kaksi syytä. Uusi malli käyttää päivitettyä tokenisaattoria, joka pilkkoo saman tekstin hieman useampaan tokeniin kuin Haiku 4.5. Yli 100 000 tokenin kehotteista veloitetaan lisäksi 0,50 ja 2,50 dollaria, mikä on vain puolet edeltäjän hinnasta. Yhtiö kertoo 75 prosentin olevan keskiarvio, jossa molemmat tekijät on otettu huomioon.
Halvempaan hintaluokkaan osuu paljon liikennettä. Anthropicin mukaan noin 90 prosenttia edelliselle Haikulle lähetetyistä pyynnöistä jäi 100 000 tokenin rajan alle.
Mitä 100 000 tokenin raja tarkoittaa?
Raja koskee yksittäisen pyynnön koko syötettä, myös välimuistista luettua osaa. Jos kehote ylittää rajan, koko pyyntö laskutetaan kalliimman hintaluokan mukaan. Englanniksi 100 000 tokenia on karkeasti 75 000 sanaa. Tavallinen asiakaspalvelukysymys tai sähköpostin luokittelu jää reilusti rajan alle, mutta pitkät sopimukset, kokonaiset koodikannat ja pitkään jatkuneet agenttiajot voivat ylittää sen.



