Nykyiset suuret kielimallit kärsivät perustavanlaatuisesta ongelmasta: ne unohtavat. Transformer-arkkitehtuuri, joka on ChatGPT:n ja Clauden kaltaisten mallien perusta, käsittelee tekstiä rajallisen konteksti-ikkunan kautta. Mitä pidempi syöte, sitä kalliimmaksi laskenta käy, ja jossakin kohtaa ikkuna loppuu kesken.
Googlen tutkijat esittelivät ratkaisun nimeltä Titans. Arkkitehtuuri yhdistää kaksi aiemmin erillistä lähestymistapaa: RNN-mallien nopean, lineaarisen laskennan ja transformer-mallien tarkan tiedonhaun. Ytimessä on syväoppiva muistimoduuli, joka oppii itse päättämään, mikä tieto kannattaa säilyttää ja mikä unohtaa.
Tekoälyn muistia on yritetty parantaa monella tavalla. Transformer-malleissa konteksti-ikkunaa on kasvatettu satoihin tuhansiin tokeneihin, mutta laskentakustannukset kasvavat neliöllisesti syötteen pidentyessä. RNN-pohjaiset mallit kuten Mamba-2 skaalautuvat lineaarisesti, mutta ne pakkaavat kaiken kontekstin kiinteäkokoiseen vektoriin, jolloin osa tiedosta väistämättä häviää. Titansin ratkaisu on kolmas tie: sen muistimoduuli on syvä neuroverkko, joka oppii tiivistämään ja priorisoimaan tietoa dynaamisesti.
Yllätys kertoo, mikä on tärkeää
Titansin muistimoduuli toimii yksinkertaisen periaatteen varassa: yllätyksen. Kun malli kohtaa tietoa, joka poikkeaa merkittävästi sen odotuksista, se tuottaa suuren gradientin – matemaattisen signaalin, joka päivittää muistin painotuksia välittömästi.
Googlen tutkijat havainnollistavat mekanismia esimerkillä: jos malli käsittelee talousraporttia ja kohtaa tutun taloustermin, yllätys on pieni eikä muistia tarvitse päivittää. Jos raportin keskelle ilmestyy täysin odottamaton tieto, malli tunnistaa sen merkittäväksi ja tallentaa sen pitkäkestoiseen muistiinsa.
Perinteinen transformer käsittelee kaiken tekstin konteksti-ikkunassaan samanarvoisesti, kuin lukisi kirjaa ilman kykyä erottaa käännekohtia taustainformaatiosta. Titansin muistimoduuli sen sijaan toimii kuin kokenut lukija, joka alleviivaa vain olennaiset kohdat.
Muistimoduuliin on rakennettu kaksi lisämekanismia. Momentum huomioi paitsi yksittäisen yllätyksen myös ympäröivän kontekstin, jotta malli ei reagoi satunnaisiin poikkeamiin. Unohtamismekanismi puolestaan poistaa vanhentunutta tietoa ja estää muistia täyttymästä tarpeettomasta datasta pitkien sekvenssien käsittelyssä.
Käytännössä tämä tarkoittaa
Tekoäly voi lukea tuhansia sivuja ja poimia niistä olennaiset asiat ilman, että jokainen sana vie laskentatehoa – aivan kuten ihminen, joka selaa raporttia ja muistaa vain tärkeimmät kohdat.
MIRAS kokoaa teorian yhteen
Titansin rinnalla tutkijat Ali Behrouz, Peilin Zhong ja Vahab Mirrokni julkaisivat MIRAS-viitekehyksen, joka yleistää muistipohjaisen mallinnuksen teoriaksi. MIRAS jakaa sekvenssimallien suunnittelun neljään perusvalintaan: muistin rakenne, huomion kohdistaminen, tiedon säilyttäminen ja muistin päivitysalgoritmi.
Viitekehys paljastaa kiinnostavan yhteyden: lähes kaikki merkittävät edistysaskeleet sekvenssimallinnuksessa, transformereista RNN-variantteihin, ovat pohjimmiltaan monimutkaisia assosiatiivisen muistin moduuleja. MIRAS-viitekehyksen pohjalta tutkijat kehittivät myös kolme uutta mallia nimeltä Moneta, Yaad ja Memora, jotka eivät käytä perinteistä huomiomekanismia.
Pienempi malli päihittää jättiläiset
BABILong-vertailukokeessa, joka mittaa pitkän tekstin ymmärtämistä, Titans päihitti huomattavasti suurempia malleja – muun muassa GPT-4:n ja 70 miljardin parametrin Llama-mallin. Titans teki tämän 760 miljoonan parametrin mallilla, joka on murto-osa kilpailijoiden koosta.
Needle in a Haystack -testissä, jossa mallin pitää löytää yksittäinen fakta valtavasta tekstimassasta, Titans saavutti yli 95 prosentin tarkkuuden. Arkkitehtuuri skaalautuu yli kahden miljoonan tokenin konteksti-ikkunaan, mikä vastaa karkeasti 1 500 sivua tekstiä.
Tulokset eivät rajoitu tekstiin. Tutkijat testasivat arkkitehtuuria myös DNA-sekvenssien mallintamiseen ja aikasarjaennustamiseen, ja molemmissa Titans suoriutui vertailumallejaan paremmin.



