Muistikirja, joka kasvaa käsiin
Googlen tutkijat ovat kehittäneet menetelmän, joka puristaa kielimallien muistin murto-osaan ilman tarkkuushäviötä. TurboQuant-niminen algoritmi pakkaa tekoälymallin niin sanotun KV-välimuistin kolmeen bittiin perinteisen 32 bitin sijaan. ICLR 2026 -konferenssiin hyväksytty tutkimus lupaa jopa kahdeksankertaista nopeutusta nykyisillä huippusiruilla.
KV-välimuisti on kielimallin lyhytkestoinen muisti. Kun tekoäly lukee ja tuottaa tekstiä, se tallentaa jokaisesta sanasta avain-arvo-parin, jotta aiempi keskustelu pysyy kontekstissa. Ajattele sitä kirjana, josta teet lukiessa muistiinpanoja: mitä pidempi kirja, sitä paksumpi muistivihko tarvitaan. Kahdeksan miljardin parametrin kielimalli nielee 32 000 sanan kontekstissa pelkästään välimuistiin noin 4,6 gigatavua.
TurboQuant tiivistää muistiinpanot niin, ettei yksikään juonenkäänne katoa, mutta muistivihkon paksuus putoaa kuudesosaan. Toisin kuin aiemmat pakkausmenetelmät, se ei vaadi mallin uudelleenkoulutusta tai mallikohtaista hienosäätöä.
Kaksi vaihetta, nolla hienosäätöä
Menetelmä toimii kahdessa vaiheessa. Ensin PolarQuant-vaihe pyörittää datavektorit satunnaisella rotaatiolla, jolloin informaatio jakautuu tasaisesti kaikkien koordinaattien kesken. Tämä muistuttaa korttipakan sekoittamista: kun jokainen kortti on yhtä todennäköisellä paikalla, pakan voi kuvata paljon tiiviimmin kuin järjestetyn. Tasaisen jakauman ansiosta optimaaliset pakkausrajat voi laskea etukäteen ilman kalibrointia.
Toisessa vaiheessa käytetään Johnson–Lindenstrauss-muunnokseen perustuvaa QJL-menetelmää, joka korjaa jäljelle jääneen kvantisointivirheen. Se tiivistää virheen yksittäisiksi etumerkkibiteiksi – jokainen bitti kertoo vain suunnan, plus tai miinus. Tämä riittää tekemään laskennasta matemaattisesti harhatonta, ja lisämuistin tarve on käytännössä nolla.
Lopputuloksena jokainen välimuistin elementti vie kolme bittiä alkuperäisen 32 bitin sijaan. Yksikään aiempi kvantisointimenetelmä ei ole saavuttanut vastaavaa pakkaussuhdetta ilman mallin uudelleenkoulutusta.
Kuudesosa muistista, kahdeksankertainen nopeus
Googlen tutkijat testasivat TurboQuantia Gemma- ja Mistral-kielimalleilla useilla vaativilla vertailukokeilla. LongBench-, RULER- ja Needle In A Haystack -testeissä kolmen bitin pakkauksella mallit suoriutuivat yhtä hyvin kuin alkuperäiset 32-bittiset versiot. Tarkkuus säilyi kaikissa testeissä.
Nvidian H100-siruilla neljän bitin TurboQuant tuotti jopa kahdeksankertaisen nopeutuksen attention-laskennassa verrattuna pakkaamattomiin 32-bittisiin avaimiin. Muistinkulutus laski vähintään kuudesosaan. Konkreettinen esimerkki: Metan Llama 3 -mallin 70 miljardin parametrin version KV-välimuisti kutistuu 32 000 sanan kontekstissa noin 17 gigatavusta reiluun 2,7 gigatavuun.
GPU-muisti on tekoälypalveluiden tuotannossa kalleinta resurssia. Kun sen tarve vähenee kuudesosaan, päättelykustannukset voivat pudota jopa puoleen. Yrityksille, jotka pyörittävät tekoälypalveluita tuhansille käyttäjille, säästöt ovat miljoonia euroja vuodessa.
Tekoäly taskuun
Kun välimuistin tarve putoaa kuudesosaan, suuret kielimallit mahtuvat pyörimään laitteissa, joihin ne eivät aiemmin olisi sopineet. Kannettavat tietokoneet ja jopa älypuhelimet voivat ajaa malleja, jotka aiemmin vaativat palvelinkeskuksen resursseja. Samalla isommat konteksti-ikkunat tulevat mahdollisiksi ilman kalliita laitepäivityksiä. Käytännössä tämä tarkoittaa, että tekoälyavustaja voi muistaa koko päivän keskusteluhistorian sen sijaan, että se unohtaisi kaiken muutaman viestin jälkeen.
Avoin kehittäjäyhteisö on jo tarttunut toimeen. GitHubissa on useita TurboQuant-toteutuksia PyTorch-, Triton- ja llama.cpp-ympäristöille, vaikka Googlen virallista toteutusta odotetaan vasta vuoden 2026 toisella neljänneksellä. Erityisesti llama.cpp-integraatio voi tuoda kolmen bitin pakkauksen tavallisten käyttäjien ulottuville nopeammin kuin Googlen oma julkaisu.



