Tutkimus

Googlen tekoäly oppi unohtamaan

Titans-malli tallentaa vain yllättävän tiedon – aivan kuten ihmisen muisti

Hanna HuulivuoHanna Huulivuo
Jaa:
Googlen tekoäly oppi unohtamaan

Yllätys tallentuu, rutiini unohtuu

Muistatko, mitä söit lounaaksi viime tiistaina? Todennäköisesti et. Mutta muistat varmasti päivän, jolloin kuulit yllättävän uutisen tai näit jotain täysin odottamatonta. Ihmisen muisti tallentaa poikkeukselliset hetket ja antaa arkisten toistojen liukua ohi.

Googlen tutkijat Ali Behrouz, Meisam Razaviyayn ja Vahab Mirrokni sovelsivat tätä periaatetta koneoppimiseen. Heidän kehittämänsä Titans-arkkitehtuuri päivittää pitkäkestoista muistiaan ajon aikana yllätyssignaalin avulla. Kun malli kohtaa tietoa, joka poikkeaa sen odotuksista, gradienttipohjainen virhesignaali kasvaa ja tieto tallentuu. Ennustettava, rutiininomainen syöte taas ohitetaan.

Tutkimus esitellään ICLR 2026 -konferenssissa Rio de Janeirossa huhtikuussa.

Syvä muisti litteän tilalle

Nykyiset suuret kielimallit perustuvat transformer-arkkitehtuuriin, joka käsittelee tekstiä rajatun pituisena ikkunana. Pitkissä keskusteluissa aiemmin sanottu katoaa, kun konteksti-ikkuna täyttyy. Perinteiset rekurrenttiverkot puolestaan tiivistävät kaiken yhteen kiinteäkokoiseen vektoriin, joka väistämättä kadottaa yksityiskohtia.

Titans ratkaisee ongelman käyttämällä muistinaan syvää neuroverkkoa, monikerroksista perceptronia. Se tallentaa rikkaampia tietorakenteita kuin yksittäinen vektori. Muistia ohjaavat kaksi mekanismia: momentum huomioi sekä nykyisen että äskettäiset yllätyssignaalit, jolloin malli ei reagoi jokaiseen poikkeamaan. Adaptiivinen unohdus painottaa vanhaa tietoa vähemmän uuden tieltä, joten muisti ei tukkeudu.

Viitekehys paljastaa sukulaisuudet

Titans on osa laajempaa MIRAS-viitekehystä, joka kuvaa sekvenssimalleja neljän valinnan kautta: muistin rakenne, huomion painotus, säilymisportti ja päivitysalgoritmi. Viitekehyksen oivallus on, että monet nykyiset arkkitehtuurit ovat saman periaatteen eri toteutuksia. Transformer-mallit, Mamba, DeltaNet ja RWKV näyttävät pinnalta erilaisilta, mutta MIRAS paljastaa niiden jakavan yhteisen sisäisen hakumekanismin.

Viitekehyksen pohjalta tutkijat kehittivät kolme uutta mallia: YAAD, MONETA ja MEMORA. Kukin käyttää erilaista matemaattista tavoitefunktiota muistin päivittämiseen, ja joissakin pitkän kontekstin testeissä ne päihittivät sekä Mamba 2:n että perinteiset transformer-mallit.

Pienempi malli päihittää jättiläiset

BABILong-vertailussa, jossa mallin pitää yhdistää tietoja pitkän dokumentin eri osista, 760 miljoonan parametrin Titans päihitti suuremmat kilpailijansa: GPT-4:n ja Metan 70 miljardin parametrin Llama 3.1 -mallin. Konteksti-ikkuna skaalautuu yli kahteen miljoonaan tokeniin, kun GPT-4:n ikkuna on 128 000 tokenia.

Käytännössä pitkäkestoinen muisti voisi tarkoittaa chatbotteja, jotka muistavat viikkojen takaiset keskustelut, tai tekoälyjä, jotka lukevat kokonaisen kirjan ja osaavat viitata sen yksityiskohtiin. Se on myös edellytys itsenäisesti toimiville tekoälyagenteille, jotka tarvitsevat käsitystä omista aiemmista päätöksistään.

Sanasto

Transformer-arkkitehtuuri
Vuonna 2017 esitelty tekoälyarkkitehtuuri, johon lähes kaikki nykyiset suuret kielimallit (kuten GPT ja Gemini) perustuvat. Sen ydinidea on käsitellä tekstiä kokonaisuutena yksittäisten sanojen sijaan, mikä mahdollistaa sanojen välisten yhteyksien tunnistamisen.
Token
Tekstin perusyksikkö, jonka kielimalli käsittelee. Yksi token on noin ¾ englanninkielistä sanaa eli suomeksi noin puoli sanaa. Kun artikkelissa puhutaan "kahdesta miljoonasta tokenista", se vastaa noin miljoonaa suomenkielistä sanaa.

Lupaus ja varaukset

OpenAI:n entinen tutkimusjohtaja Ilya Sutskever on puhunut samasta suunnanmuutoksesta. Hän on todennut, että pelkän datan ja laskentatehon skaalaaminen on saavuttamassa rajansa ja tulevaisuuden tekoälyn pitäisi oppia dynaamisesti.

Titans ei ole vielä kaupallisessa käytössä, eikä arkkitehtuuri ole kaikissa tehtävissä ylivoimainen. Joissakin erikoistuneissa hakutesteissä perinteiset mallit suoriutuvat yhä paremmin. Tutkijat ovat kuitenkin osoittaneet sovellettavuutta kielen ulkopuolelle: varhaiskokeet DNA-sekvenssien mallintamisessa ja aikasarjaennusteissa ovat lupaavia.

MIRAS-viitekehys antaa tutkijoille yhteisen kielen vertailla ja yhdistellä eri lähestymistapoja, mikä voi nopeuttaa muistiarkkitehtuurien kehitystä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.