Tekoälyn muistista puuttuu palanen
Tekoälymallit osaavat lukea ja kirjoittaa lähes ihmisen tasolla, mutta pitkien tekstien käsittely on ollut niiden akilleenkantapää. Kun nykyiselle kielimallille syöttää tarpeeksi pitkän dokumentin, oleellinen tieto alkaa hukkua. Mallit kyllä lukevat tekstin, mutta eivät muista, mitä sen alussa tapahtui.
Google Research esitteli joulukuussa 2025 ratkaisun nimeltä Titans. Arkkitehtuuri pystyy lukemaan kerralla yli kaksi miljoonaa tokenia, mikä vastaa noin kymmentä romaania. Se onnistuu yhdistämällä kaksi aiemmin kilpailevaa lähestymistapaa: transformerin tarkkuuden ja RNN:n nopeuden.
Yllätys tallentuu, arkinen unohtuu
Transformer, nykyisten kielimallien selkäranka, on tarkka mutta raskas. Sen huomiomekanismi vertaa jokaista tokenia kaikkiin muihin, joten laskentakustannus kasvaa neliöllisesti tekstin pituuden mukaan. Vanhat RNN-mallit taas lukevat tekstiä sana kerrallaan ja ovat siksi nopeita, mutta ne unohtavat helposti aiemmin lukemansa.
Titans ratkaisee ongelman lisäämällä transformer-pohjaiseen malliin erillisen pitkäkestomuistin. Se on toteutettu monikerroksisena neuroverkona, ei kiinteäkokoisena vektorina kuten perinteisissä RNN-malleissa. Pitkäkestomuisti oppii ja päivittyy reaaliajassa, kun malli lukee uutta dataa.
Mallin keskeisin oivallus on niin sanottu yllätysmetriikka: kun Titans kohtaa jotain odottamatonta, se tallentaa tiedon pitkäkestomuistiin tarkemmin. Ennustettavat osat unohtuvat nopeammin. Periaate muistuttaa ihmisaivoja, joissa yllätykset jäävät mieleen paremmin kuin rutiinit.
GPT-4 häviää murto-osan kokoiselle mallille
BABILong-testi mittaa mallin kykyä löytää olennaista tietoa erittäin pitkistä dokumenteista – kuin etsisi yhtä lausetta kymmenestä romaanista. Titans saavutti testissä 98,7 prosentin tarkkuuden ja päihitti GPT-4:n lähes kymmenellä prosenttiyksiköllä.
Mallikoko tekee tuloksesta vielä merkittävämmän. Titans-mallissa on 760 miljoonaa parametria, kun GPT-4:ssä niitä on arvioiden mukaan yli biljoona. Myös Metan Llama 3.1:n 70 miljardin parametrin versio jäi Titansin taakse. Pieni malli voitti lähes sataa kertaa suuremman, kun tehtävä vaati pitkää muistia.
Titansin konteksti-ikkuna yltää yli kahteen miljoonaan tokeniin. GPT-4o:n raja on 128 000 tokenia, eli ero on noin 16-kertainen. Yrityksille ja kehittäjille tämä tarkoittaa, että kokonaisia lakiasiakirjoja, tutkimusraportteja tai koodikantoja voisi analysoida yhdellä kertaa ilman, että mallin muisti pettää.
MIRAS-kehys ja kolme uutta mallia
Google julkaisi Titansin rinnalla MIRAS-kehyksen, teoreettisen viitekehyksen muistia hyödyntävien sekvenssimallien rakentamiseen. Se määrittelee neljä suunnitteluelementtiä: muistiarkkitehtuurin, huomiobiasin, unohtamismekanismin ja optimointimenetelmän. Kehys yhdistää aiemmin erillisinä pidetyt tutkimussuunnat yhden teoreettisen katon alle.
Kehyksen pohjalta syntyi kolme mallia. Yaad käyttää Huber-häviöfunktiota, joka kestää poikkeavia datapisteitä, kuten kirjoitusvirheitä pitkissä asiakirjoissa. Moneta hyödyntää tiukempia matemaattisia rajoitteita muistipäivityksissä. Memora pakottaa muistin toimimaan todennäköisyysjakaumana, mikä pitää päivitykset hallittuina ja tasapainossa.
Kaikki kolme suoriutuivat kielen mallinnustehtävissä vertailumalleja paremmin sekä C4- että WikiText-aineistoilla. Googlen tutkijat esittävät, että MIRAS voisi toimia yleisenä suunnitteluohjeena tuleville muistia hyödyntäville arkkitehtuureille.
Pitkä konteksti kiinnostaa myös Suomessa
Suomalainen tekoälytutkimus seuraa muistitehokkuuden kehitystä tarkasti. FCAI (Finnish Center for Artificial Intelligence), jonka taustalla ovat Aalto-yliopisto, Helsingin yliopisto ja VTT, tutkii datatehokkuutta yhtenä kolmesta päätutkimusteemastaan. Arkkitehtuurit, jotka saavuttavat huipputuloksia murto-osalla suurten mallien parametreista, sopivat suoraan tähän tavoitteeseen.
Aalto-yliopistossa professori Harri Lähdesmäen johtama todennäköisyysperustaisen koneoppimisen tutkimusryhmä kehittää tehokkaita generatiivisia malleja ja bayesilaista päättelyä. Ryhmän pääfokus on biolääketieteessä, mutta samat periaatteet – kuten muistitehokkaat sekvenssimallit – ovat sovellettavissa kielimalleihin.
Titans-kaltaiset pienemmät ja tehokkaammat mallit ovat erityisen kiinnostavia Suomen kokoiselle maalle, jossa laskentaresurssit ovat rajallisemmat kuin teknologiajäteillä. Jos sama suorituskyky saavutetaan sadasosalla parametreista, myös suomalaisilla tutkimusryhmillä ja yrityksillä on mahdollisuus pysyä mukana huipputason kehityksessä.



