Californialainen tekoälylaboratorio PrismML astui eilen julkisuuteen ja julkaisi Bonsai 8B:n, ensimmäisen kaupallisesti käyttökelpoisen 1-bittisen suuren kielimallin. Mallissa on 8,2 miljardia parametria, mutta se vie muistia vain 1,15 gigatavua – noin 14 kertaa vähemmän kuin vastaava 16-bittinen malli. Caltechin tutkijoista koostuva tiimi sanoo ratkaisseensa ongelman, jonka parissa Microsoft ja muut ovat painiskelleet vuosia: miten kielimallin kokoa voi kutistaa rajusti ilman, että päättelykyky kärsii.
Yksi bitti riittää
Perinteisessä kielimallissa jokainen parametri tallennetaan 16-bittisellä liukuluvulla. Kahdeksan miljardin parametrin malli vie silloin noin 16 gigatavua muistia pelkästään painoarvojen tallentamiseen. PrismML:n lähestymistapa on periaatteeltaan yksinkertainen mutta käytännössä vaikea toteuttaa: jokaiselle parametrille varataan yksi ainoa bitti, jolloin painoarvo on joko +1 tai –1.
Laskennallisesti ero näkyy heti. Tavallisessa mallissa prosessori suorittaa miljoonia liukulukujen kertolaskuja, jotka vaativat energiaa ja tehokasta laitteistoa. Kun painoarvo on +1 tai –1, kertolaskut korvautuvat yhteen- ja vähennyslaskuilla. Siksi Bonsai 8B on PrismML:n mukaan 4–5 kertaa energiatehokkaampi kuin vastaavan kokoinen 16-bittinen malli.
Olennaista on, ettei Bonsai 8B:tä ole pakattu jälkikäteen valmiista mallista. Se on koulutettu alusta asti 1-bittisenä Googlen v4 TPU -piireillä. Natiivisti 1-bittinen verkko oppii kompensoimaan rajoitetun tarkkuuden jo koulutusvaiheessa, toisin kuin malli, josta leikataan bittejä pois vasta koulutuksen jälkeen.
Puhelin korvaa palvelinkeskuksen
PrismML demonstroi mallin toimintaa useilla laitteilla. iPhone 17 Pro Max:lla Bonsai 8B tuottaa 44 tokenia sekunnissa, Applen M4 Pro -Macilla 131 ja NVIDIA:n RTX 4090 -näytönohjaimella 368 tokenia sekunnissa. Puhelin pyörittää siis sujuvasti kielimallia ilman verkkoyhteyttä.
Käytännössä 44 tokenia sekunnissa tarkoittaa noin 30–35 sanaa sekunnissa, mikä riittää sujuvaan keskusteluun tai tekstin tuottamiseen reaaliajassa. Useimmat pilvipohjaiset tekoälypalvelut tuottavat tekstiä suunnilleen samalla nopeudella.
ChatGPT:n, Clauden ja muiden suosittujen tekoälypalveluiden käyttö edellyttää tällä hetkellä pilviyhteyttä, koska mallit ovat liian suuria paikallisesti ajettaviksi. Bonsai 8B:n kaltainen malli voisi kääntää asetelman päälaelleen. Yritykset voisivat pyörittää tekoälyä omilla laitteillaan ilman, että arkaluonteinen data kulkee ulkopuolisten palvelimien kautta. Terveydenhuollossa, lakialalla ja finanssisektorilla tietosuojavaatimukset ovat usein este pilvipalveluiden käytölle, ja paikallisesti toimiva malli ratkaisisi tämän ongelman. Myös maissa, joissa nopea internet ei ole itsestäänselvyys, paikallinen tekoälymalli olisi merkittävä harppaus.
Bonsai 8B ei ole ainoa merkki reunalaskennan murroksesta. Liquid AI julkaisi samalla viikolla LFM2.5-350M-mallin, jossa on vain 350 miljoonaa parametria mutta joka suoriutuu useissa tehtävissä paremmin kuin kaksi kertaa suuremmat kilpailijansa. Liquid AI on kouluttanut mallinsa peräti 28 biljoonalla tokenilla, mikä tuottaa poikkeuksellisen korkean osaamisen suhteessa mallin kokoon. PrismML:n ja Liquid AI:n lähestymistavat eroavat: Liquid AI optimoi arkkitehtuuria ja koulutusdataa pienten mallien tehon maksimointiin, PrismML puolestaan pakkaa ison mallin pieneen tilaan kvantisoinnilla. Molemmat osoittavat, ettei tekoäly välttämättä vaadi valtavia palvelinkeskuksia.
“Kehitimme vuosia matemaattista teoriaa, jolla neuroverkko voidaan pakata ilman päättelykyvyn menettämistä. Näemme 1-bittisen rakenteen lähtöpisteenä, emme päätepisteenä.”
Avoin koodi, avoin kilpailu
PrismML julkaisi Bonsai-mallisarjan – 8B:n, 4B:n ja 1.7B:n – Apache 2.0 -lisenssillä. Kuka tahansa voi ladata, muokata ja käyttää malleja kaupallisesti ilman rajoituksia. Painot löytyvät HuggingFace-palvelusta, ja malleja voi ajaa Applen MLX-kirjastolla sekä NVIDIA-näytönohjaimilla llama.cpp:n kautta.
Apache 2.0 on yksi vapaimmista avoimen lähdekoodin lisensseistä. Toisin kuin esimerkiksi Metan Llama-mallien yhteisölisenssi, se ei aseta rajoituksia käyttäjämäärille eikä vaadi erillistä ilmoitusta kaupallisesta käytöstä. Kynnys kokeilla 1-bittistä lähestymistapaa on siten poikkeuksellisen matala niin pienille yrityksille kuin tutkijoillekin.



