Tutkimus

Tekoälyn muisti mahtuu nyt kolmeen bittiin

Googlen algoritmi puristaa kielimallin välimuistin kuudesosaan.

Hanna HuulivuoHanna Huulivuo
Jaa:
Tekoälyn muisti mahtuu nyt kolmeen bittiin

Muistikirja, joka kasvaa käsiin

Googlen tutkijat ovat kehittäneet menetelmän, joka puristaa kielimallien muistin murto-osaan ilman tarkkuushäviötä. TurboQuant-niminen algoritmi pakkaa tekoälymallin niin sanotun KV-välimuistin kolmeen bittiin perinteisen 32 bitin sijaan. ICLR 2026 -konferenssiin hyväksytty tutkimus lupaa jopa kahdeksankertaista nopeutusta nykyisillä huippusiruilla.

KV-välimuisti on kielimallin lyhytkestoinen muisti. Kun tekoäly lukee ja tuottaa tekstiä, se tallentaa jokaisesta sanasta avain-arvo-parin, jotta aiempi keskustelu pysyy kontekstissa. Ajattele sitä kirjana, josta teet lukiessa muistiinpanoja: mitä pidempi kirja, sitä paksumpi muistivihko tarvitaan. Kahdeksan miljardin parametrin kielimalli nielee 32 000 sanan kontekstissa pelkästään välimuistiin noin 4,6 gigatavua.

TurboQuant tiivistää muistiinpanot niin, ettei yksikään juonenkäänne katoa, mutta muistivihkon paksuus putoaa kuudesosaan. Toisin kuin aiemmat pakkausmenetelmät, se ei vaadi mallin uudelleenkoulutusta tai mallikohtaista hienosäätöä.

Kaksi vaihetta, nolla hienosäätöä

Menetelmä toimii kahdessa vaiheessa. Ensin PolarQuant-vaihe pyörittää datavektorit satunnaisella rotaatiolla, jolloin informaatio jakautuu tasaisesti kaikkien koordinaattien kesken. Tämä muistuttaa korttipakan sekoittamista: kun jokainen kortti on yhtä todennäköisellä paikalla, pakan voi kuvata paljon tiiviimmin kuin järjestetyn. Tasaisen jakauman ansiosta optimaaliset pakkausrajat voi laskea etukäteen ilman kalibrointia.

Toisessa vaiheessa käytetään Johnson–Lindenstrauss-muunnokseen perustuvaa QJL-menetelmää, joka korjaa jäljelle jääneen kvantisointivirheen. Se tiivistää virheen yksittäisiksi etumerkkibiteiksi – jokainen bitti kertoo vain suunnan, plus tai miinus. Tämä riittää tekemään laskennasta matemaattisesti harhatonta, ja lisämuistin tarve on käytännössä nolla.

Lopputuloksena jokainen välimuistin elementti vie kolme bittiä alkuperäisen 32 bitin sijaan. Yksikään aiempi kvantisointimenetelmä ei ole saavuttanut vastaavaa pakkaussuhdetta ilman mallin uudelleenkoulutusta.

Kuudesosa muistista, kahdeksankertainen nopeus

Googlen tutkijat testasivat TurboQuantia Gemma- ja Mistral-kielimalleilla useilla vaativilla vertailukokeilla. LongBench-, RULER- ja Needle In A Haystack -testeissä kolmen bitin pakkauksella mallit suoriutuivat yhtä hyvin kuin alkuperäiset 32-bittiset versiot. Tarkkuus säilyi kaikissa testeissä.

Nvidian H100-siruilla neljän bitin TurboQuant tuotti jopa kahdeksankertaisen nopeutuksen attention-laskennassa verrattuna pakkaamattomiin 32-bittisiin avaimiin. Muistinkulutus laski vähintään kuudesosaan. Konkreettinen esimerkki: Metan Llama 3 -mallin 70 miljardin parametrin version KV-välimuisti kutistuu 32 000 sanan kontekstissa noin 17 gigatavusta reiluun 2,7 gigatavuun.

GPU-muisti on tekoälypalveluiden tuotannossa kalleinta resurssia. Kun sen tarve vähenee kuudesosaan, päättelykustannukset voivat pudota jopa puoleen. Yrityksille, jotka pyörittävät tekoälypalveluita tuhansille käyttäjille, säästöt ovat miljoonia euroja vuodessa.

Tekoäly taskuun

Kun välimuistin tarve putoaa kuudesosaan, suuret kielimallit mahtuvat pyörimään laitteissa, joihin ne eivät aiemmin olisi sopineet. Kannettavat tietokoneet ja jopa älypuhelimet voivat ajaa malleja, jotka aiemmin vaativat palvelinkeskuksen resursseja. Samalla isommat konteksti-ikkunat tulevat mahdollisiksi ilman kalliita laitepäivityksiä. Käytännössä tämä tarkoittaa, että tekoälyavustaja voi muistaa koko päivän keskusteluhistorian sen sijaan, että se unohtaisi kaiken muutaman viestin jälkeen.

Avoin kehittäjäyhteisö on jo tarttunut toimeen. GitHubissa on useita TurboQuant-toteutuksia PyTorch-, Triton- ja llama.cpp-ympäristöille, vaikka Googlen virallista toteutusta odotetaan vasta vuoden 2026 toisella neljänneksellä. Erityisesti llama.cpp-integraatio voi tuoda kolmen bitin pakkauksen tavallisten käyttäjien ulottuville nopeammin kuin Googlen oma julkaisu.

3 bittiä↓

KV-välimuistin tarkkuus

8×↑

Nopeutus H100-siruilla

17 → 2,7 Gt↓

Llama 3 70B:n KV-välimuisti

0

Uudelleenkoulutusta tarvitaan

Google Research, ICLR 2026

Sanasto

Kvantisointi
Tekniikka, jossa tekoälymallin numeeriset arvot pyöristetään karkeammiksi muistin säästämiseksi. Periaate on sama kuin kuvan pakkaamisessa: tiedosto pienenee, mutta lopputulos säilyy lähes samana.
Attention-laskenta
Kielimallien muistinkäytön kannalta raskain laskentavaihe, jossa malli punnitsee jokaisen sanan suhdetta kaikkiin muihin sanoihin tekstissä.

Mitä seurata

ICLR 2026 -konferenssi järjestetään tänä keväänä, ja siellä Googlen tutkijat esittelevät TurboQuantin vertaisarvioidussa muodossa. Virallista avoimen lähdekoodin toteutusta odotetaan vuoden toisella neljänneksellä. Kilpailevat tutkimusryhmät Microsoftissa ja Metassa työstävät omia kvantisointimenetelmiään, ja vastauksia TurboQuantin asettamaan tasoon on odotettavissa vielä tämän vuoden aikana. Seuraamme erityisesti sitä, onnistuuko kolmen bitin pakkaus siirtymään tutkimuksesta tuotantokäyttöön jo kesään mennessä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Datakeskukset Suomessa – hankkeet, sähkö ja vero
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat
  5. 5Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.