Kysymyksiä on kolmea lajia. Valinta (choice): mihin luokkaan tämä kuuluu? Asteikko (score): matala, keskitaso vai korkea? Kyllä tai ei (noul): onko tämä kiireellinen? Yksi kysymys voi sisältää enintään 255 vaihtoehtoa, ja isommat valinnat pitää pilkkoa kahteen vaiheeseen.
Jokaisen vastauksen mukana tulee todennäköisyys, eli malli kertoo, kuinka varma se on. Vastaus on aina ennalta sovitussa muodossa: luokka, asteikon taso tai kyllä/ei. Vapaata tekstiä Jev ei tuota koskaan.
Miksi varmuusprosentti on koko jutun ydin
Koska Jev kertoo jokaisen päätöksen mukana, kuinka varma se on, ohjelmisto voi asettaa rajan. Yli 95 prosentin varmuudella ohjelma toimii itse. Sen alle jäävät tapaukset menevät ihmiselle tai isommalle mallille. TypeSafe väittää, että rajan avulla hallusinaatiot voidaan painaa nollaan.
Väite pitää paikkansa vain, jos mallin varmuus on kalibroitu eli rehellinen: 80 prosentin varmuus osuu oikeaan noin neljä kertaa viidestä. Juuri siihen yhtiön uusi opetusmenetelmä RLCD, Reinforcement Learning for Calibrated Decisions, on sen mukaan tehty. Ulkopuolisia mittauksia kalibroinnista ei vielä ole.
Hinnoittelu on osa viestiä. Malliin syötetty teksti maksaa 0,042 dollaria miljoonalta tokenilta, ja vastaukset ovat ilmaisia. Omissa testeissään yhtiö mittasi Jevin 40–200 kertaa nopeammaksi ja 40–400 kertaa halvemmaksi kuin verrokit. Luvut ovat yhtiön omia, minkä Almeida itse muistuttaa: ”Poikkeukselliset väitteet vaativat poikkeuksellisia todisteita.”
Mihin sitä käytetään
Almeidan väite on, että suurin osa ohjelmistojen sisällä tarvittavasta älykkyydestä ei ole kirjoittamista. Se on pieniä päätöksiä: kuuluuko tämä viesti reklamaatioihin vai laskutukseen, onko käyttäjän syöte turvallinen, saako tämän laskun hyväksyä ilman ihmistä. Käyttökohteita ovat viestien luokittelu ja ohjaus oikeaan paikkaan, tiedon poiminta, pisteytys ja toisen mallin vastausten tarkistus.
Kehittäjätyökaluja tekevä LangChain kuvasi 17. syyskuuta, miten Jev sopii tekoälyagentin sisälle. Iso malli, vaikkapa Claude, päättelee ja kirjoittaa. Jev tekee välissä nopeat päätökset: onko pyyntö helppo vai vaikea, ja saako tämän komennon ajaa ilman lupaa? Sama kuvio on tuttu koodausagenteista, joiden automaattitila päättää, mikä komento saa mennä läpi ja mikä kysytään käyttäjältä.
Neljä päivää julkaisun jälkeen Jevillä oli tehty jo yli sata avointa projektia. Lennokki lentää esteradan simulaattorissa ja kysyy Jeviltä noin 0,4 sekunnin välein, väistääkö vai jarruttaako. Postgres-laajennus hakee tietokannasta sanallisella ehdolla, esimerkiksi ”nimi on eurooppalainen”, ja kaksituhatta riviä maksoi noin sentin. Suomalainen Bitmagic antoi Jevin ohjata kaupunkipelin liikennevaloja. Luvut ovat tekijöiden omia.
Missä sitä voi kokeilla
Jeviä voi kokeilla heti. OpenRouterissa se on nimellä typesafe/jev-1.13 ja Vercelin AI Gatewayssa nimellä typesafe-ai/jev. Hinta on molemmissa sama kuin TypeSafella, jonka omaan rajapintaan pääsee vielä jonotuslistalta. LangChainille on oma kirjasto, langchain-typesafe, ja omaan Claude-agenttiin Jevin voi kytkeä työkaluksi.
Suomalaiselle käyttäjälle on yksi varaus. TypeSafen ohjeiden mukaan malli on viritetty englanniksi, joten suomenkielinen aineisto kannattaa testata kunnolla ennen tuotantokäyttöä.
Mitä Jev ei tee
Rajoitteet ovat yhtä selviä kuin lupaukset. Jev ei kirjoita sähköpostia, ei tiivistä raporttia eikä perustele valintojaan. Se ei korvaa kielimallia vaan täydentää sitä: kielimalli hoitaa tekstin, Jev päätökset. Ulkopuolisia vertailuja ei vielä ole, ja vasta muiden kehittäjien omat mittaukset kertovat, pitääkö lupaus sata kertaa halvemmasta tekoälystä.