Kuvitellaan kymmenen hengen tilitoimisto, jonka toimitusjohtaja kehottaa kaikkia käyttämään tekoälyä rohkeasti. Ensimmäisen kuukauden lasku on muutama sata euroa. Sitten joku ottaa käyttöön agentin, joka käy itsenäisesti läpi asiakkaiden kuitteja, ja seuraava lasku on moninkertainen. Kukaan ei tehnyt mitään väärin. Kukaan ei vain laskenut etukäteen.
Tivi varoittaa juuri tästä ansasta. Lehden mukaan suomalaisyritykset voivat ajautua kalliiseen tilanteeseen, jos ne kannustavat runsaaseen tekoälyn käyttöön mutta eivät ennakoi, kuinka paljon tokeneita se kuluttaa. Tivin esittämän kansainvälisen datan mukaan tekoälyagentit kuluttavat noin viisi kertaa enemmän tokeneita kuin ihmiskäyttäjä, ja tekoälyn osuus yritysten IT-budjeteista on noin neljä prosenttia.
Neljä prosenttia kuulostaa pieneltä. Agenttien yleistyessä osuus voi kuitenkin kasvaa nopeasti, koska kulu ei riipu siitä, montako ihmistä palkkalistoilla on, vaan siitä, kuinka paljon koneet tekevät työtä.
Mikä token on?
Kielimalli ei lue tekstiä sanoina vaan pieninä paloina, joita kutsutaan tokeneiksi. Token voi olla kokonainen lyhyt sana, sanan alku tai pelkkä välimerkki. Englannissa nyrkkisääntö on, että sata sanaa vastaa noin 130:tä tokenia. Suomessa tokeneita kuluu yleensä enemmän, koska pitkät taivutetut sanat pilkkoutuvat useampaan osaan.
Tekoälypalvelut laskuttavat rajapinnan kautta tokeneiden mukaan. Hinta ilmoitetaan tyypillisesti miljoonaa tokenia kohden, ja malliin syötetty teksti on halvempaa kuin mallin itse tuottama. Kiinteähintaisessa kuukausitilauksessa kulu ei näy suoraan, mutta yrityskäytössä ja agenteissa se tulee lähes aina vastaan.
Esimerkkilaskelma euroina
Oletetaan havainnollistuksen vuoksi, että malli maksaa 3 euroa miljoonalta syötetokenilta ja 15 euroa miljoonalta tuotetulta tokenilta. Hinnat vaihtelevat palveluittain ja malleittain, joten tarkista oman palvelusi hinnasto.
Työntekijän tavallinen kysymys, noin 500 tokenia sisään ja 700 ulos, maksaa runsaan sentin. Neljäkymmentä kysymystä päivässä tekee noin 10 euroa kuukaudessa. Jos sama työntekijä siirtyy agenttiin ja kulutus viisinkertaistuu, summa on noin 50 euroa. Kahdenkymmenen hengen yrityksessä ero on noin 200 euron ja 1 000 euron kuukausilaskun välillä.
Miksi agentti syö niin paljon?
Ihminen kysyy, malli vastaa, ja siihen se usein jää. Agentti toimii toisin. Se saa tehtävän, suunnittelee, tekee välivaiheen, tarkistaa tuloksen ja jatkaa, kunnes työ on valmis tai se luovuttaa. Jokainen kierros on oma kutsunsa kielimalliin.
Matkan varrella agentti kutsuu työkaluja: hakee verkkosivun, avaa tiedoston tai kysyy tietokannasta. Työkalujen palauttama tieto, esimerkiksi kokonainen verkkosivu tai pitkä taulukko, syötetään takaisin malliin. Se on kaikki maksullista syötettä.
Suurin kulu syntyy kuitenkin muistista. Jotta agentti muistaisi, mitä se on jo tehnyt, koko siihenastinen keskustelu lähetetään mallille joka kierroksella uudelleen. Kymmenennellä kierroksella malli lukee siis yhdeksän edellisen kierroksen tekstit vielä kerran. Konteksti-ikkuna paisuu, ja lasku kasvaa sen mukana.
Viisinkertaisuus on keskiarvo. Yksittäinen pitkä agenttitehtävä voi maksaa kymmeniä kertoja enemmän kuin yksi chat-kysymys, kun taas yksinkertainen tehtävä hoituu muutamalla kierroksella.
Kenen ongelma tämä on?
Suuryrityksellä on hankintaosasto ja FinOps-tiimi, joka seuraa pilvikuluja. Pienyrityksessä tekoälyn kulut päätyvät usein jonkun henkilökohtaiselle luottokortille tai yleiseen ohjelmistotiliin, jossa kukaan ei katso niitä ennen tilinpäätöstä.
Tavalliselle työntekijälle asia näkyy toista kautta. Jos kulut karkaavat, johto voi reagoida rajaamalla tekoälyn käyttöä kaikilta, myös niiltä, joille siitä on aidosti hyötyä. Ennakointi suojaa siis myös työkaluja, joihin on jo totuttu.
Näin kulua seurataan ja rajataan
Keinot ovat arkisia, ja suurin osa löytyy suoraan tekoälypalveluiden hallintapaneeleista.
- Käyttökatot: aseta kuukausittainen euroraja koko organisaatiolle ja erikseen jokaiselle agentille tai API-avaimelle. Katon lähestyessä palvelu varoittaa tai pysähtyy.
- Mallin valinta: kaikkeen ei tarvita kalleinta mallia. Kevyt malli riittää usein luokitteluun, tiivistämiseen ja rutiinitehtäviin, ja sen tokenhinta voi olla murto-osa raskaimmasta.
- Kierrosten rajaus: määritä agentille enimmäismäärä kierroksia tai työkalukutsuja, jotta jumiin jäänyt tehtävä ei pyöri tuntikausia.
- Kulujen seuranta: katso kulutusraportti viikoittain ja kohdista kulut käyttötapauksille. Silloin näet, mikä agentti tuottaa hyötyä ja mikä vain kuluttaa.
Monet palvelut tarjoavat myös välimuistia, jolloin toistuvasti lähetetty sama tausta, kuten ohjeistus tai asiakirja, laskutetaan alennetulla hinnalla. Agenteille, jotka kantavat samaa kontekstia kierroksesta toiseen, säästö voi olla merkittävä.
Oikea mittari on hinta per tehty työ
Tokenien tuijottaminen voi johtaa harhaan. Jos agentti käsittelee kuukauden kuitit sadalla eurolla ja säästää työntekijältä kaksi työpäivää, viisinkertainen kulutus on halpa. Jos se taas tuottaa raportin, jota kukaan ei lue, jokainen token on hukkaa.
Siksi pienyrityksen kannattaa kysyä ennen agentin käyttöönottoa yksi asia: mitä yksi valmis tehtävä maksaa nyt ihmisen tekemänä, ja mitä se maksaa agentin tekemänä? Kun vertailu tehdään tehtävä kerrallaan, tekoälyn osuus IT-budjetista lakkaa olemasta yllätys ja muuttuu tavalliseksi hankintapäätökseksi.



