Koneoppiminen

Tämä tekoälymalli vie vähemmän tilaa kuin elokuva

8,2 miljardia parametria mahtuu gigatavuun – malli pyörii iPhonella

Hanna HuulivuoHanna Huulivuo
Jaa:
Tämä tekoälymalli vie vähemmän tilaa kuin elokuva

Californialainen tekoälylaboratorio PrismML astui eilen julkisuuteen ja julkaisi Bonsai 8B:n, ensimmäisen kaupallisesti käyttökelpoisen 1-bittisen suuren kielimallin. Mallissa on 8,2 miljardia parametria, mutta se vie muistia vain 1,15 gigatavua – noin 14 kertaa vähemmän kuin vastaava 16-bittinen malli. Caltechin tutkijoista koostuva tiimi sanoo ratkaisseensa ongelman, jonka parissa Microsoft ja muut ovat painiskelleet vuosia: miten kielimallin kokoa voi kutistaa rajusti ilman, että päättelykyky kärsii.

Yksi bitti riittää

Perinteisessä kielimallissa jokainen parametri tallennetaan 16-bittisellä liukuluvulla. Kahdeksan miljardin parametrin malli vie silloin noin 16 gigatavua muistia pelkästään painoarvojen tallentamiseen. PrismML:n lähestymistapa on periaatteeltaan yksinkertainen mutta käytännössä vaikea toteuttaa: jokaiselle parametrille varataan yksi ainoa bitti, jolloin painoarvo on joko +1 tai –1.

Laskennallisesti ero näkyy heti. Tavallisessa mallissa prosessori suorittaa miljoonia liukulukujen kertolaskuja, jotka vaativat energiaa ja tehokasta laitteistoa. Kun painoarvo on +1 tai –1, kertolaskut korvautuvat yhteen- ja vähennyslaskuilla. Siksi Bonsai 8B on PrismML:n mukaan 4–5 kertaa energiatehokkaampi kuin vastaavan kokoinen 16-bittinen malli.

Olennaista on, ettei Bonsai 8B:tä ole pakattu jälkikäteen valmiista mallista. Se on koulutettu alusta asti 1-bittisenä Googlen v4 TPU -piireillä. Natiivisti 1-bittinen verkko oppii kompensoimaan rajoitetun tarkkuuden jo koulutusvaiheessa, toisin kuin malli, josta leikataan bittejä pois vasta koulutuksen jälkeen.

Puhelin korvaa palvelinkeskuksen

PrismML demonstroi mallin toimintaa useilla laitteilla. iPhone 17 Pro Max:lla Bonsai 8B tuottaa 44 tokenia sekunnissa, Applen M4 Pro -Macilla 131 ja NVIDIA:n RTX 4090 -näytönohjaimella 368 tokenia sekunnissa. Puhelin pyörittää siis sujuvasti kielimallia ilman verkkoyhteyttä.

Käytännössä 44 tokenia sekunnissa tarkoittaa noin 30–35 sanaa sekunnissa, mikä riittää sujuvaan keskusteluun tai tekstin tuottamiseen reaaliajassa. Useimmat pilvipohjaiset tekoälypalvelut tuottavat tekstiä suunnilleen samalla nopeudella.

ChatGPT:n, Clauden ja muiden suosittujen tekoälypalveluiden käyttö edellyttää tällä hetkellä pilviyhteyttä, koska mallit ovat liian suuria paikallisesti ajettaviksi. Bonsai 8B:n kaltainen malli voisi kääntää asetelman päälaelleen. Yritykset voisivat pyörittää tekoälyä omilla laitteillaan ilman, että arkaluonteinen data kulkee ulkopuolisten palvelimien kautta. Terveydenhuollossa, lakialalla ja finanssisektorilla tietosuojavaatimukset ovat usein este pilvipalveluiden käytölle, ja paikallisesti toimiva malli ratkaisisi tämän ongelman. Myös maissa, joissa nopea internet ei ole itsestäänselvyys, paikallinen tekoälymalli olisi merkittävä harppaus.

Bonsai 8B ei ole ainoa merkki reunalaskennan murroksesta. Liquid AI julkaisi samalla viikolla LFM2.5-350M-mallin, jossa on vain 350 miljoonaa parametria mutta joka suoriutuu useissa tehtävissä paremmin kuin kaksi kertaa suuremmat kilpailijansa. Liquid AI on kouluttanut mallinsa peräti 28 biljoonalla tokenilla, mikä tuottaa poikkeuksellisen korkean osaamisen suhteessa mallin kokoon. PrismML:n ja Liquid AI:n lähestymistavat eroavat: Liquid AI optimoi arkkitehtuuria ja koulutusdataa pienten mallien tehon maksimointiin, PrismML puolestaan pakkaa ison mallin pieneen tilaan kvantisoinnilla. Molemmat osoittavat, ettei tekoäly välttämättä vaadi valtavia palvelinkeskuksia.

“Kehitimme vuosia matemaattista teoriaa, jolla neuroverkko voidaan pakata ilman päättelykyvyn menettämistä. Näemme 1-bittisen rakenteen lähtöpisteenä, emme päätepisteenä.”

— Babak Hassibi, PrismML:n toimitusjohtaja ja perustaja

Avoin koodi, avoin kilpailu

PrismML julkaisi Bonsai-mallisarjan – 8B:n, 4B:n ja 1.7B:n – Apache 2.0 -lisenssillä. Kuka tahansa voi ladata, muokata ja käyttää malleja kaupallisesti ilman rajoituksia. Painot löytyvät HuggingFace-palvelusta, ja malleja voi ajaa Applen MLX-kirjastolla sekä NVIDIA-näytönohjaimilla llama.cpp:n kautta.

Apache 2.0 on yksi vapaimmista avoimen lähdekoodin lisensseistä. Toisin kuin esimerkiksi Metan Llama-mallien yhteisölisenssi, se ei aseta rajoituksia käyttäjämäärille eikä vaadi erillistä ilmoitusta kaupallisesta käytöstä. Kynnys kokeilla 1-bittistä lähestymistapaa on siten poikkeuksellisen matala niin pienille yrityksille kuin tutkijoillekin.

1,15 Gt↓

Mallin koko muistissa

14×↓

Pienempi kuin 16-bittinen

4–5×↑

Energiatehokkaampi

PrismML, 2026

Sanasto

Kvantisointi
Tekniikka jossa kielimallin laskenta-arvojen tarkkuutta pienennetään, jolloin malli vie vähemmän muistia ja toimii nopeammin. Bonsai 8B vie tämän äärimmilleen käyttämällä vain yhtä bittiä painoarvoa kohti.
Reunalaskenta
Laskennan siirtämistä pilvestä lähemmäs käyttäjää – esimerkiksi puhelimeen tai paikalliselle laitteelle – ilman verkkoyhteyttä palvelinkeskukseen.

Mitä seurata

Microsoftin vastaus kiinnostaa seuraavaksi. Yhtiö julkaisi vuonna 2025 BitNet b1.58 -mallinsa, joka käyttää hieman eri lähestymistapaa: kolmea arvoa (+1, 0, –1) yhden sijaan. PrismML:n ja Microsoftin kilpailu ratkaisee pitkälti, kumpi lähestymistapa vakiintuu teollisuusstandardiksi.

Laitevalmistajat seuraavat tilannetta tarkasti. Viime vuosina NVIDIA:n arvonnousu on perustunut pitkälti siihen, että suuret kielimallit vaativat kalliita GPU-piirejä. Jos 1-bittiset mallit yleistyvät, painopiste siirtyy tehokkaista palvelinpiireistä edullisempiin reunalaitteisiin. Apple, Qualcomm ja muut mobiilipiirien valmistajat alkavat todennäköisesti optimoida tuotteitaan näitä malleja varten. PrismML on julkaissut Bonsai-mallit ja teknisen raportin avoimesti, joten kuka tahansa voi arvioida väitteet itse.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.