Transformer-arkkitehtuuri on hallinnut tekoälyn kielimalleja viisi vuotta. Nyt Carnegie Mellonin ja Princetonin tutkijat esittelevät haastajan: Mamba-3 on avoimen lähdekoodin sekvenssimalli, joka päihittää transformerin lähes neljällä prosentilla tarkkuudessa ja on pitkissä sekvensseissä jopa seitsemän kertaa nopeampi päättelyssä.
Malli perustuu tilaavaruusteoriaan (state space model, SSM), joka käsittelee tekstiä lineaarisessa ajassa transformerin neliöllisen ajan sijaan. Tutkimus esiteltiin ICLR 2026 -konferenssissa, ja koodi on julkaistu avoimella Apache 2.0 -lisenssillä. Kehitystyötä johtivat opiskelijatutkijat Aakash Lahoti ja Kevin Y. Li alkuperäisten Mamba-arkkitehtien Albert Gun ja Tri Daon ohjauksessa.
Kylmän GPU:n ongelma
Transformerin vahvuus on sen kyky tallentaa kontekstia kasvavaan avain-arvo-välimuistiin. Jokainen uusi sana vaatii vertailua kaikkiin edellisiin, mikä tekee pitkien tekstien käsittelystä raskasta. Kun sekvenssin pituus kasvaa, laskentakustannukset kasvavat neliöllisesti.
Mamba-3:n kehittäjät kutsuvat tätä pullonkaulaa kylmän GPU:n ongelmaksi. Päättelyvaiheessa, kun malli tuottaa tekstiä sana kerrallaan, näytönohjain odottaa muistisiirtoja sen sijaan, että se laskisi. Nvidian H100-piireillä suurin osa laskentakapasiteetista jää käyttämättä, koska yksittäisen sanan tuottaminen vaatii hyvin vähän laskentaa suhteessa muistin liikutteluun.
Tilaavaruusmallit kiertävät ongelman pitämällä kiinteän kokoista tilaa, joka tiivistää aiemman kontekstin yhteen vektoriin. Aiemmat SSM-mallit ovat kuitenkin häviäneet tarkkuudessa transformerille. Mamba-3 pyrkii ratkaisemaan tämän kolmella teknisellä uudistuksella.
Kolme ratkaisua yhdessä mallissa
Ensimmäinen uudistus on eksponentiaalis-trapetsoidinen diskretisaatio, eli tapa muuntaa jatkuva signaali erillisiksi laskenta-askeleiksi. Mamba-2 käytti yksinkertaista kaavaa, joka rajoitti mallin kykyä painottaa eri ajanhetkiä. Uusi menetelmä antaa mallille ilmaisuvoimaisemman tavan päivittää tilaansa, mikä parantaa erityisesti pitkien riippuvuuksien tunnistamista tekstissä.
Toinen uudistus siirtää tilaavaruuden reaaliarvoisista luvuista kompleksiarvoisiin. Kompleksiluvut mahdollistavat tilan kuvaamisen kiertoliikkeinä, mikä on matemaattisesti tehokas tapa mallintaa jaksollisia rakenteita kielessä. Mamba-3 hyödyntää RoPE-sijaintikoodausta (rotary position embeddings) näiden siirtymien toteuttamiseen ilman raskasta erillisytimen kirjoittamista.
Kolmas muutos on siirtymä MIMO-rakenteeseen (multi-input, multi-output). Perinteinen SSM käsittelee yhtä signaalia kerrallaan, mutta MIMO ajaa useita rinnakkaisia tilaavaruusmalleja. Dekoodausviive ei kasva, koska päättelyvaiheessa pullonkaula on muistinsiirto eikä laskenta – rinnakkaismallit mahtuvat näytönohjaimen vapaaseen laskentakapasiteettiin.



