Yllätys tallentuu, rutiini unohtuu
Muistatko, mitä söit lounaaksi viime tiistaina? Todennäköisesti et. Mutta muistat varmasti päivän, jolloin kuulit yllättävän uutisen tai näit jotain täysin odottamatonta. Ihmisen muisti tallentaa poikkeukselliset hetket ja antaa arkisten toistojen liukua ohi.
Googlen tutkijat Ali Behrouz, Meisam Razaviyayn ja Vahab Mirrokni sovelsivat tätä periaatetta koneoppimiseen. Heidän kehittämänsä Titans-arkkitehtuuri päivittää pitkäkestoista muistiaan ajon aikana yllätyssignaalin avulla. Kun malli kohtaa tietoa, joka poikkeaa sen odotuksista, gradienttipohjainen virhesignaali kasvaa ja tieto tallentuu. Ennustettava, rutiininomainen syöte taas ohitetaan.
Tutkimus esitellään ICLR 2026 -konferenssissa Rio de Janeirossa huhtikuussa.
Syvä muisti litteän tilalle
Nykyiset suuret kielimallit perustuvat transformer-arkkitehtuuriin, joka käsittelee tekstiä rajatun pituisena ikkunana. Pitkissä keskusteluissa aiemmin sanottu katoaa, kun konteksti-ikkuna täyttyy. Perinteiset rekurrenttiverkot puolestaan tiivistävät kaiken yhteen kiinteäkokoiseen vektoriin, joka väistämättä kadottaa yksityiskohtia.
Titans ratkaisee ongelman käyttämällä muistinaan syvää neuroverkkoa, monikerroksista perceptronia. Se tallentaa rikkaampia tietorakenteita kuin yksittäinen vektori. Muistia ohjaavat kaksi mekanismia: momentum huomioi sekä nykyisen että äskettäiset yllätyssignaalit, jolloin malli ei reagoi jokaiseen poikkeamaan. Adaptiivinen unohdus painottaa vanhaa tietoa vähemmän uuden tieltä, joten muisti ei tukkeudu.
Viitekehys paljastaa sukulaisuudet
Titans on osa laajempaa MIRAS-viitekehystä, joka kuvaa sekvenssimalleja neljän valinnan kautta: muistin rakenne, huomion painotus, säilymisportti ja päivitysalgoritmi. Viitekehyksen oivallus on, että monet nykyiset arkkitehtuurit ovat saman periaatteen eri toteutuksia. Transformer-mallit, Mamba, DeltaNet ja RWKV näyttävät pinnalta erilaisilta, mutta MIRAS paljastaa niiden jakavan yhteisen sisäisen hakumekanismin.
Viitekehyksen pohjalta tutkijat kehittivät kolme uutta mallia: YAAD, MONETA ja MEMORA. Kukin käyttää erilaista matemaattista tavoitefunktiota muistin päivittämiseen, ja joissakin pitkän kontekstin testeissä ne päihittivät sekä Mamba 2:n että perinteiset transformer-mallit.
Pienempi malli päihittää jättiläiset
BABILong-vertailussa, jossa mallin pitää yhdistää tietoja pitkän dokumentin eri osista, 760 miljoonan parametrin Titans päihitti suuremmat kilpailijansa: GPT-4:n ja Metan 70 miljardin parametrin Llama 3.1 -mallin. Konteksti-ikkuna skaalautuu yli kahteen miljoonaan tokeniin, kun GPT-4:n ikkuna on 128 000 tokenia.
Käytännössä pitkäkestoinen muisti voisi tarkoittaa chatbotteja, jotka muistavat viikkojen takaiset keskustelut, tai tekoälyjä, jotka lukevat kokonaisen kirjan ja osaavat viitata sen yksityiskohtiin. Se on myös edellytys itsenäisesti toimiville tekoälyagenteille, jotka tarvitsevat käsitystä omista aiemmista päätöksistään.



