Kun tekoäly kirjoittaa itse tutkimuskoodin
Google Researchin tutkijat julkaisivat Nature-lehdessä järjestelmän nimeltä ERA, joka tekee jotain tähän asti väitöskirjatutkijoiden ja datatieteilijöiden työpöydälle kuulunutta: se kirjoittaa tietokoneohjelmia, joilla analysoidaan tieteellistä dataa. Erikoista on lopputulos. ERA:n keksimät menetelmät voittivat toistuvasti alan parhaat, ihmisten vuosien varrella hiomat ratkaisut.
Kahdessa koetapauksessa ero oli selvä. Yksisolubiologian datan käsittelyssä ERA tuotti 40 menetelmää, jotka ylittivät kaikki aiemmin julkaistut vertailukohdat. Epidemiologiassa se loi 14 ennustemallia, jotka päihittivät Yhdysvaltain tartuntatautiviraston CDC:n virallisen ennustekokonaisuuden covid-tapausten ennakoinnissa.
Mitä 'tekoäly kirjoittaa koodia' oikeasti tarkoittaa
Ajatus tekoälystä tutkijana kuulostaa isommalta kuin mitä ERA todellisuudessa tekee. Kyse ei ole siitä, että kielimalli keksisi uuden teorian tai ymmärtäisi biologiaa. ERA ratkoo tarkasti rajattua ongelmaa: annetaan tehtävä, jolla on mitattava laatupistemäärä, ja etsitään ohjelmakoodi, joka nostaa sen mahdollisimman korkealle.
Käytännössä järjestelmä toimii kahdessa kerroksessa. Kielimalli, tässä tapauksessa Googlen Gemini, kirjoittaa ehdotuksen ohjelmakoodiksi ja ajaa sen eristetyssä hiekkalaatikossa, joka antaa tulokselle pisteet. Tämän päälle on rakennettu hakualgoritmi, joka muistuttaa evoluutiota: parhaat koodiversiot säilyvät, niitä yhdistellään ja muokataan, ja heikot karsiutuvat.
Ratkaiseva ero perinteiseen automaattiseen koodinhakuun on se, että muokkaukset eivät ole satunnaisia. Kielimalli tekee harkittuja, sisällöllisiä muutoksia sen tutkimustiedon pohjalta, joka sille on syötetty. Tutkijat esimerkiksi antoivat ERA:lle yhdeksän julkaistun menetelmän artikkelit ja pyysivät sitä yhdistelemään niiden ideoita uusiksi ratkaisuiksi.
Miten 40 uutta menetelmää syntyi
Yksisolusekvensointi tuottaa dataa, jossa eri koe-erien väliset tekniset erot sotkevat todellista biologista signaalia. Tämän eräkorjauksen menetelmiä on kehitetty vuosia. ERA luki yhdeksän olemassa olevan menetelmän kuvaukset ja tuotti niistä 55 yhdistelmää. Näistä 44 prosenttia ylitti molemmat lähtömenetelmänsä.
Kun mukaan otettiin muiden tekoälyagenttien ideoita, testattavia lähestymistapoja kertyi 87. Niistä 40 voitti kaikki julkaistut menetelmät OpenProblems-vertailussa, ja paras versio paransi tulosta 14 prosenttia aiempaan kärkeen nähden. Löydöt eivät olleet mystisiä: usein kyse oli kahden tunnetun tekniikan oivaltavasta yhdistelmästä.
CDC:n ennustemallien päihittäminen
Toisessa kokeessa ERA tarttui covid-tapausten ennustamiseen. Se rakensi uudelleen kahdeksan tunnettua ennustemallia julkisten kuvausten perusteella ja loi niistä 26 hybridiä. Tuloksena syntyi 14 strategiaa, jotka voittivat CDC:n käyttämän CovidHub-ennustekokonaisuuden.
Ero mitattiin painotetulla intervallipisteellä, jossa pienempi luku on parempi. ERA:n malli ylsi keskimäärin lukemaan 26, kun CDC:n ennuste jäi 29:ään kaikkien 52 osavaltion ja alueen yli. Voittavat strategiat rakentuivat yksinkertaiselle perustalle, historiallisille keskiarvoille ja tuoreille trendeille, joita täydennettiin vasta sitten monimutkaisemmilla koneoppimismenetelmillä.
Sairaalat, lääketiede ja madaltuva kynnys
Jos tekoäly osaa hioa ennustemallin, joka lyö viranomaisen virallisen arvion tautitapausten kulusta, kyse ei ole vain akateemisesta kuriositeetista. Tartuntatautien ennusteet ohjaavat sitä, miten sairaalat varautuvat, milloin rokotteita tilataan ja miten resurssit jaetaan. Osuvampi ennuste voi tarkoittaa käytännössä paremmin ajoitettua varautumista seuraavaan aaltoon.
Sama koskee lääketiedettä laajemmin. Yksisoludatan analyysi on työkalu, jolla etsitään esimerkiksi syövän solutyyppejä ja lääkevasteita. Jos menetelmien kehittäminen nopeutuu ja halpenee, myös pienemmät tutkimusryhmät pääsevät lähemmäs kärkeä ilman suurta datatiimiä. Toinen puoli on, että sama kynnyksen madaltuminen koskee niitäkin, jotka käyttävät malleja huolimattomasti tai vääriin tarkoituksiin.
“Empiirisen ennustemallin optimointi ja aito tieteellinen keksiminen ovat eri asioita. Jälkimmäinen vaatii päättelyä taustalla olevista teorioista, syy-seuraussuhteista ja matemaattisista kehyksistä.”



