Tutkimus

Google opetti tekoälyn muistamaan – ja unohtamaan

Titans-arkkitehtuuri käsittelee yli 1 500 sivua ja päihittää GPT-4:n

Hanna HuulivuoHanna Huulivuo
Jaa:
Google opetti tekoälyn muistamaan – ja unohtamaan

Nykyiset suuret kielimallit kärsivät perustavanlaatuisesta ongelmasta: ne unohtavat. Transformer-arkkitehtuuri, joka on ChatGPT:n ja Clauden kaltaisten mallien perusta, käsittelee tekstiä rajallisen konteksti-ikkunan kautta. Mitä pidempi syöte, sitä kalliimmaksi laskenta käy, ja jossakin kohtaa ikkuna loppuu kesken.

Googlen tutkijat esittelivät ratkaisun nimeltä Titans. Arkkitehtuuri yhdistää kaksi aiemmin erillistä lähestymistapaa: RNN-mallien nopean, lineaarisen laskennan ja transformer-mallien tarkan tiedonhaun. Ytimessä on syväoppiva muistimoduuli, joka oppii itse päättämään, mikä tieto kannattaa säilyttää ja mikä unohtaa.

Tekoälyn muistia on yritetty parantaa monella tavalla. Transformer-malleissa konteksti-ikkunaa on kasvatettu satoihin tuhansiin tokeneihin, mutta laskentakustannukset kasvavat neliöllisesti syötteen pidentyessä. RNN-pohjaiset mallit kuten Mamba-2 skaalautuvat lineaarisesti, mutta ne pakkaavat kaiken kontekstin kiinteäkokoiseen vektoriin, jolloin osa tiedosta väistämättä häviää. Titansin ratkaisu on kolmas tie: sen muistimoduuli on syvä neuroverkko, joka oppii tiivistämään ja priorisoimaan tietoa dynaamisesti.

Yllätys kertoo, mikä on tärkeää

Titansin muistimoduuli toimii yksinkertaisen periaatteen varassa: yllätyksen. Kun malli kohtaa tietoa, joka poikkeaa merkittävästi sen odotuksista, se tuottaa suuren gradientin – matemaattisen signaalin, joka päivittää muistin painotuksia välittömästi.

Googlen tutkijat havainnollistavat mekanismia esimerkillä: jos malli käsittelee talousraporttia ja kohtaa tutun taloustermin, yllätys on pieni eikä muistia tarvitse päivittää. Jos raportin keskelle ilmestyy täysin odottamaton tieto, malli tunnistaa sen merkittäväksi ja tallentaa sen pitkäkestoiseen muistiinsa.

Perinteinen transformer käsittelee kaiken tekstin konteksti-ikkunassaan samanarvoisesti, kuin lukisi kirjaa ilman kykyä erottaa käännekohtia taustainformaatiosta. Titansin muistimoduuli sen sijaan toimii kuin kokenut lukija, joka alleviivaa vain olennaiset kohdat.

Muistimoduuliin on rakennettu kaksi lisämekanismia. Momentum huomioi paitsi yksittäisen yllätyksen myös ympäröivän kontekstin, jotta malli ei reagoi satunnaisiin poikkeamiin. Unohtamismekanismi puolestaan poistaa vanhentunutta tietoa ja estää muistia täyttymästä tarpeettomasta datasta pitkien sekvenssien käsittelyssä.

Käytännössä tämä tarkoittaa

Tekoäly voi lukea tuhansia sivuja ja poimia niistä olennaiset asiat ilman, että jokainen sana vie laskentatehoa – aivan kuten ihminen, joka selaa raporttia ja muistaa vain tärkeimmät kohdat.

MIRAS kokoaa teorian yhteen

Titansin rinnalla tutkijat Ali Behrouz, Peilin Zhong ja Vahab Mirrokni julkaisivat MIRAS-viitekehyksen, joka yleistää muistipohjaisen mallinnuksen teoriaksi. MIRAS jakaa sekvenssimallien suunnittelun neljään perusvalintaan: muistin rakenne, huomion kohdistaminen, tiedon säilyttäminen ja muistin päivitysalgoritmi.

Viitekehys paljastaa kiinnostavan yhteyden: lähes kaikki merkittävät edistysaskeleet sekvenssimallinnuksessa, transformereista RNN-variantteihin, ovat pohjimmiltaan monimutkaisia assosiatiivisen muistin moduuleja. MIRAS-viitekehyksen pohjalta tutkijat kehittivät myös kolme uutta mallia nimeltä Moneta, Yaad ja Memora, jotka eivät käytä perinteistä huomiomekanismia.

Pienempi malli päihittää jättiläiset

BABILong-vertailukokeessa, joka mittaa pitkän tekstin ymmärtämistä, Titans päihitti huomattavasti suurempia malleja – muun muassa GPT-4:n ja 70 miljardin parametrin Llama-mallin. Titans teki tämän 760 miljoonan parametrin mallilla, joka on murto-osa kilpailijoiden koosta.

Needle in a Haystack -testissä, jossa mallin pitää löytää yksittäinen fakta valtavasta tekstimassasta, Titans saavutti yli 95 prosentin tarkkuuden. Arkkitehtuuri skaalautuu yli kahden miljoonan tokenin konteksti-ikkunaan, mikä vastaa karkeasti 1 500 sivua tekstiä.

Tulokset eivät rajoitu tekstiin. Tutkijat testasivat arkkitehtuuria myös DNA-sekvenssien mallintamiseen ja aikasarjaennustamiseen, ja molemmissa Titans suoriutui vertailumallejaan paremmin.

Kolme lähestymistapaa tekoälyn muistiin

Transformer

GPT, Claude, Gemini

Kontekstin käsittely
Rajallinen ikkuna
Laskentakustannus
Neliöllinen (kallis)
Pitkä teksti
Heikkenee

RNN / Mamba

Lineaariset sekvensimallit

Kontekstin käsittely
Kiinteä vektori
Laskentakustannus
Lineaarinen (edullinen)
Pitkä teksti
Tietoa häviää

Titans

Googlen uusi arkkitehtuuri

Kontekstin käsittely
Dynaaminen muisti
Laskentakustannus
Lähes lineaarinen
Pitkä teksti
Oppii priorisoimaan

Google Research, 2026

760 M↑

Parametria – päihitti 70 mrd:n mallit

95 %+↑

Neula heinäsuovassa -tarkkuus

2 M+↑

Tokenin konteksti-ikkuna

Google Research, arXiv

Sanasto

Transformer
Neuroverkkoarkkitehtuuri, joka on nykyisten kielimallien kuten ChatGPT:n ja Clauden perusta. Se käsittelee tekstiä tarkastelemalla kaikkien sanojen suhteita toisiinsa samanaikaisesti.
Konteksti-ikkuna
Tekstin enimmäismäärä, jonka kielimalli pystyy käsittelemään kerralla – ikään kuin mallin työmuisti.
Tokeni
Tekstin perusyksikkö jonka kielimalli käsittelee. Yksi tokeni vastaa noin ¾ englanninkielistä sanaa eli suomeksi karkeasti puolta sanaa.

Mitä seurata

Titans on toistaiseksi tutkimusvaiheessa. Google ei ole kertonut aikataulua sen tuomisesta kaupallisiin tuotteisiin, joten huomio kohdistuu kahteen kysymykseen: näkyykö arkkitehtuurin vaikutus tulevissa Gemini-malleissa, ja ottavatko kilpailevat laboratoriot MIRAS-viitekehyksen käyttöön.

Titansin käytännön potentiaali piilee sen kyvyssä oppia käyttöaikana ilman erillistä uudelleenkoulutusta. Asianajotoimisto voisi syöttää mallille tuhansia sivuja oikeudenkäyntimateriaalia ja saada olennaiset ennakkotapaukset esiin automaattisesti. Lääketieteellisessä tutkimuksessa järjestelmä voisi käydä läpi laajat tietokannat ja nostaa esiin odottamattomia yhteyksiä eri tutkimusten välillä.

AI Suomi palaa aiheeseen, kun Titans-arkkitehtuurin ensimmäiset sovellukset etenevät tutkimuslaboratoriosta tuotantoon.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 420 vuotta koodaamatta, sitten 5,4 miljoonaa
  5. 5Datakeskukset Suomessa – hankkeet, sähkö ja vero

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.