Meta julkaisi tällä viikolla TRIBE v2 -mallin, joka tekee jotain odottamatonta: se ennustaa, miten aivojesi neuronit reagoivat videoihin, ääniin ja tekstiin. Ennusteet ovat tutkijoiden mukaan tarkempia kuin yksittäisen henkilön fMRI-aivoskannaus.
Mallin nimi tulee sanoista TRImodal Brain Encoder, ja sen on kehittänyt Metan FAIR-tutkimusryhmä. TRIBE v2 koulutettiin 451 tunnilla fMRI-aivokuvausdataa 25 koehenkilöltä, jotka katsoivat elokuvia, kuuntelivat podcasteja ja lukivat tekstejä. Malli oppi yhdistämään ärsykkeet aivojen vasteisiin niin tarkasti, että sen ennusteet vastasivat ryhmätason aivotoimintaa paremmin kuin yksittäisten koehenkilöiden oikeat skannaukset.
70 000 aivoaluetta yhden mallin sisällä
Ensimmäinen TRIBE-versio analysoi noin tuhat aivoaluetta neljän vapaaehtoisen datalla. Toinen versio on aivan eri luokkaa: se kattaa 70 000 aivoaluetta, ja sen ennusteita on testattu 720 koehenkilön ja yli tuhannen tunnin aivokuvausdatan avulla. Spatiaalinen tarkkuus kasvoi edeltäjään verrattuna 70-kertaiseksi.
Käytännössä malli toimii kuin aivojen digitaalinen kaksonen. Sille syötetään video, ääniklippi tai tekstikatkelma, ja se ennustaa, mitkä aivoalueet aktivoituvat ja miten voimakkaasti. Kenties merkittävin ominaisuus on mallin kyky yleistää: se pystyy ennustamaan täysin uusien henkilöiden ja jopa uusien kielten aivovasteet ilman lisäkoulutusta.
Vuosikymmenten tutkimus vahvistettu koneellisesti
TRIBE v2:n vakuuttavin saavutus ei liity pelkkiin lukuihin. Malli onnistui toistamaan tunnettuja neurotieteen löydöksiä ilman ainoatakaan uutta aivokuvausta. Se paikalisti itsenäisesti fusiformisen kasvoalueen, joka aktivoituu kasvojen tunnistamisessa, sekä Brocan alueen, joka liittyy puheen tuottamiseen. Molemmat ovat aivotutkimuksen peruskiviä, joiden kartoittamiseen on käytetty vuosikymmeniä kokeellista työtä.
Tulos viittaa siihen, että malli on oppinut jotain olennaista aivojen rakenteesta – ei pelkästään tilastollisia korrelaatioita. Se erottaa, miten aivot käsittelevät kuiskattua sanaa verrattuna kovaan ääneen tai nopeasti liikkuvaa kohdetta verrattuna paikallaan olevaan maisemaan.
Aivotutkimuksen AlphaFold-hetki?
Aivotutkimus on perinteisesti kallista ja hidasta. Yksi fMRI-skannausistunto maksaa satoja euroja, laitteiden saatavuus on rajallinen ja tulosten analysointi vie viikkoja. Jos TRIBE v2 pitää lupauksensa, tutkijat voivat testata hypoteesejaan ensin virtuaalisesti ja käyttää varsinaista skannausta vain tulosten vahvistamiseen. Se tarkoittaa tuhansia kokeita päivässä yhden sijaan.
Vertailua on haettu DeepMindin AlphaFold-mallista, joka vuonna 2020 ratkaisi proteiinien laskostumisongelman ja nopeutti rakennebiologista tutkimusta dramaattisesti. AlphaFold ei korvannut kokeellista tutkimusta, mutta teki siitä tehokkaampaa. Samaa roolia TRIBE v2 voi näytellä neurotieteen kentällä.
Käytännön sovelluksista kiinnostavimpia ovat aivo-tietokonerajapintojen kehittäminen ja neurologisten häiriöiden tutkiminen. Esimerkiksi afasian, kielellisen häiriön joka usein seuraa aivoinfarktia, mekanismeja voisi tutkia aivan uudella tavalla, kun virtuaalisia kokeita voi ajaa rajattomasti. Sama pätee sensorisen prosessoinnin häiriöihin, joissa aivojen tapa käsitellä näkö- ja kuulotietoa poikkeaa tyypillisestä.
TRIBE v2:lla on silti selkeä rajoitus. Kyseessä on koodausmalli: se ennustaa, miten aivot reagoivat ulkoisiin ärsykkeisiin, mutta se ei lue ajatuksia eikä tulkitse sisäistä puhetta. Ajatustenlukukone tämä ei ole.



