Tutkimus

Mamba-3 haastaa transformerin – 7 kertaa nopeampi

Avoin tilaavaruusmalli päihittää transformerin tarkkuudessa ja nopeudessa.

Hanna HuulivuoHanna Huulivuo
Jaa:
Mamba-3 haastaa transformerin – 7 kertaa nopeampi

Transformer-arkkitehtuuri on hallinnut tekoälyn kielimalleja viisi vuotta. Nyt Carnegie Mellonin ja Princetonin tutkijat esittelevät haastajan: Mamba-3 on avoimen lähdekoodin sekvenssimalli, joka päihittää transformerin lähes neljällä prosentilla tarkkuudessa ja on pitkissä sekvensseissä jopa seitsemän kertaa nopeampi päättelyssä.

Malli perustuu tilaavaruusteoriaan (state space model, SSM), joka käsittelee tekstiä lineaarisessa ajassa transformerin neliöllisen ajan sijaan. Tutkimus esiteltiin ICLR 2026 -konferenssissa, ja koodi on julkaistu avoimella Apache 2.0 -lisenssillä. Kehitystyötä johtivat opiskelijatutkijat Aakash Lahoti ja Kevin Y. Li alkuperäisten Mamba-arkkitehtien Albert Gun ja Tri Daon ohjauksessa.

Kylmän GPU:n ongelma

Transformerin vahvuus on sen kyky tallentaa kontekstia kasvavaan avain-arvo-välimuistiin. Jokainen uusi sana vaatii vertailua kaikkiin edellisiin, mikä tekee pitkien tekstien käsittelystä raskasta. Kun sekvenssin pituus kasvaa, laskentakustannukset kasvavat neliöllisesti.

Mamba-3:n kehittäjät kutsuvat tätä pullonkaulaa kylmän GPU:n ongelmaksi. Päättelyvaiheessa, kun malli tuottaa tekstiä sana kerrallaan, näytönohjain odottaa muistisiirtoja sen sijaan, että se laskisi. Nvidian H100-piireillä suurin osa laskentakapasiteetista jää käyttämättä, koska yksittäisen sanan tuottaminen vaatii hyvin vähän laskentaa suhteessa muistin liikutteluun.

Tilaavaruusmallit kiertävät ongelman pitämällä kiinteän kokoista tilaa, joka tiivistää aiemman kontekstin yhteen vektoriin. Aiemmat SSM-mallit ovat kuitenkin häviäneet tarkkuudessa transformerille. Mamba-3 pyrkii ratkaisemaan tämän kolmella teknisellä uudistuksella.

Kolme ratkaisua yhdessä mallissa

Ensimmäinen uudistus on eksponentiaalis-trapetsoidinen diskretisaatio, eli tapa muuntaa jatkuva signaali erillisiksi laskenta-askeleiksi. Mamba-2 käytti yksinkertaista kaavaa, joka rajoitti mallin kykyä painottaa eri ajanhetkiä. Uusi menetelmä antaa mallille ilmaisuvoimaisemman tavan päivittää tilaansa, mikä parantaa erityisesti pitkien riippuvuuksien tunnistamista tekstissä.

Toinen uudistus siirtää tilaavaruuden reaaliarvoisista luvuista kompleksiarvoisiin. Kompleksiluvut mahdollistavat tilan kuvaamisen kiertoliikkeinä, mikä on matemaattisesti tehokas tapa mallintaa jaksollisia rakenteita kielessä. Mamba-3 hyödyntää RoPE-sijaintikoodausta (rotary position embeddings) näiden siirtymien toteuttamiseen ilman raskasta erillisytimen kirjoittamista.

Kolmas muutos on siirtymä MIMO-rakenteeseen (multi-input, multi-output). Perinteinen SSM käsittelee yhtä signaalia kerrallaan, mutta MIMO ajaa useita rinnakkaisia tilaavaruusmalleja. Dekoodausviive ei kasva, koska päättelyvaiheessa pullonkaula on muistinsiirto eikä laskenta – rinnakkaismallit mahtuvat näytönohjaimen vapaaseen laskentakapasiteettiin.

Avoin koodi madaltaa kynnystä

Mamba-3:n julkaisu Apache 2.0 -lisenssillä erottaa sen monista suurista kielimalleista, joiden painot ovat saatavilla mutta lisenssi rajoittaa kaupallista käyttöä. Mamba-3:n arkkitehtuuri ja koodi ovat vapaasti hyödynnettävissä myös kaupallisiin sovelluksiin, ja kehittäjät voivat integroida mallin suoraan omiin järjestelmiinsä.

1,5 miljardin parametrin koossa MIMO-versio saavutti 57,6 prosentin keskimääräisen tarkkuuden vertailukokeissa, mikä on 2,2 prosenttiyksikköä enemmän kuin vastaavan kokoinen transformer-malli. Samalla Mamba-3 käyttää vain puolet edeltäjänsä Mamba-2:n tilavaatimuksesta. Gated DeltaNet -malliin verrattuna ero on 1,8 prosenttiyksikköä, kun MIMO-variantti lasketaan mukaan.

Yrityksille tämä tarkoittaa mahdollisuutta ajaa pidempiä konteksteja pienemmällä laitteistolla. Kun tekoälysovellukset siirtyvät yhä enemmän päättelyä vaativiin tehtäviin, kuten agenttijärjestelmiin ja reaaliaikaiseen tekstinkäsittelyyn, päättelytehokkuudesta tulee keskeinen kilpailuetu. Pienemmille yrityksille hyöty on konkreettinen: samat tehtävät hoituvat murto-osalla GPU-kustannuksista.

7×↑

Nopeampi päättely pitkissä sekvensseissä

+3,8 %↑

Tarkkuusero transformeriin

−50 %↑

Muistijalanjälki vs. Mamba-2

arXiv:2603.15569

Sanasto

Transformer
Tekoälymallien yleisin arkkitehtuuri, jota käyttävät muun muassa ChatGPT ja Claude. Se vertaa jokaista sanaa kaikkiin edellisiin sanoihin, mikä tekee siitä tarkan mutta pitkissä teksteissä hitaan.

Kilpailu arkkitehtuurien välillä kiihtyy

Suomessa tilaavaruusmallien kehitystä seuraa muun muassa Aalto-yliopiston professori Harri Lähdesmäki, jonka tutkimusryhmä on julkaissut ICLR-konferenssissa töitä jatkuva-aikaisista dynaamisista järjestelmistä ja spatiotemporaalisesta mallinnuksesta. Nämä tutkimusalueet jakavat matemaattisia perusteita Mamba-3:n tilaavaruusmenetelmien kanssa, ja Lähdesmäen ryhmän työ differentiaaliyhtälöpohjaisten mallien parissa sivuaa suoraan SSM-arkkitehtuurien teoreettista pohjaa.

Mamba-3 ei kuitenkaan merkitse transformerin loppua. Tutkijat itse toteavat, että tilaavaruusmallit jäävät jälkeen tiedonhakutehtävissä, joissa transformerin kasvava välimuisti on ylivoimainen. Todennäköisin kehityssuunta on hybridimalli, jossa tilaavaruuskerrokset hoitavat tehokkaan sekvenssinkäsittelyn ja attention-kerrokset vastaavat tarkasta tiedonhausta. Kun kaksi arkkitehtuuria kilpailee ja täydentää toisiaan, päättelykustannukset laskevat ja tekoälyn käyttöönotto helpottuu kaikenkokoisissa organisaatioissa.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.