Tutkimus

DeepMind vesileimaa tekoälyn suunnittelemat proteiinit

Nature-julkaisun mukaan merkki tunnistetaan lähes aina, ja koodi avataan muille tutkijoille.

Hanna HuulivuoHanna Huulivuo
Jaa:
DeepMind vesileimaa tekoälyn suunnittelemat proteiinit
Kuva: John Sears / CC BY-SA 4.0

Kun Google DeepMindin tutkijat lähettivät tekoälyllä suunnittelemiaan proteiineja Adaptyv Bion laboratorioon testattavaksi, kysymys ei ollut vain siitä, toimivatko ne. Kysymys oli, näkyykö niissä edelleen merkki siitä, mistä ne ovat peräisin. Näkyi.

Yhtiö julkisti 30. syyskuuta SynthID Bion, menetelmäperheen, joka upottaa tunnistettavan vesileiman tekoälyn tuottamiin proteiinisekvensseihin ja kolmiulotteisiin rakenteisiin. Työ julkaistiin samana päivänä Naturessa otsikolla Function-preserving watermarking of AI-generated proteins. Kirjoittajalistalla ovat muun muassa pääkirjoittaja David Stutz sekä DeepMindin johtajat Demis Hassabis ja Pushmeet Kohli.

Miksi alkuperä pitää voida todentaa

Proteiinien suunnittelu on muutamassa vuodessa siirtynyt mallien tehtäväksi. AlphaFold 3 ennustaa rakenteita, ProteinMPNN ja AlphaProteo tuottavat sekvenssejä. Kun sekvenssi tilataan laboratoriosta fyysisenä DNA:na, tilauksen vastaanottava yritys yrittää arvioida, mitä se on tekemässä. Tämä seulonta nojaa pitkälti vertailuun tunnettuihin vaarallisiin sekvensseihin – ja tekoälyn suunnittelema molekyyli ei välttämättä muistuta mitään tietokannassa jo olevaa.

Vesileima ei ratkaise tuota ongelmaa, mutta se antaa seulojalle yhden lisätiedon: onko tilaus lähtöisin luotetusta mallista vai ei. Toinen käyttötarkoitus on arkisempi. Julkisiin tietokantoihin, kuten Protein Data Bankiin, UniProtiin ja GenBankiin, päätyy koneen tuottamaa aineistoa ilman merkintää siitä. Jos mallien opetusaineisto täyttyy huomaamatta mallien omasta tuotoksesta, tieteen pohja alkaa kiertää itseään.

“SynthID Bio on tärkeä palanen palapelissä, jolla jäljitetään biologisten suunnitelmien alkuperää.”

— Sarah Carter, bioturvallisuuspolitiikan asiantuntija, Science Policy Consulting (alkukielinen lainaus englanniksi DeepMindin tiedotteessa)

Mitä sata prosenttia tarkoittaa

Tunnistin on käytännössä mittari, joka antaa jokaiselle sekvenssille lukeman. Mitä korkeampi lukema, sitä todennäköisemmin merkki on paikalla. Raja, jonka yli mennessä tunnistin huutaa, pitää asettaa jonnekin. DeepMind asetti sen kohtaan, jossa merkitsemättömistä luonnollisista proteiineista enintään yksi tuhannesta saa virheellisen hälytyksen. Tätä tarkoittaa 0,1 prosentin väärien positiivisten taso.

Kun raja oli siinä, laboratoriossa toimiviksi todetut merkityt suunnitelmat tunnistettiin paperin mukaan kaikki. "0,1 prosentin väärien positiivisten tasolle kalibroidulla raja-arvolla saamme automaattisesti 100 prosentin tunnistusasteen näille suunnitelmille", tutkimuksessa todetaan. Rakennevesileimojen puolella luku oli hieman matalampi, yli 99,8 prosenttia kaikilla testatuilla malleilla.

Arkikielellä: tuhannesta tavallisesta proteiinista korkeintaan yksi leimautuisi vahingossa tekoälyn tekemäksi, ja testijoukon merkityistä proteiineista ei jäänyt yhtäkään huomaamatta. Testijoukko on kuitenkin testijoukko. Se ei ole sama asia kuin maailma, jossa joku yrittää tarkoituksella hangata merkkiä pois.

Toimiiko proteiini yhä merkin kanssa

Sekvenssipuolella menetelmä ohjaa hienovaraisesti sitä, mikä aminohappo valitaan mihinkin kohtaan. Rakenteissa vesileima syntyy pienistä muutoksista atomien koordinaatteihin, ja kyky tuottaa se on hiottu suoraan AlphaFold 3:n painoihin. Siksi merkki tulee mukaan riippumatta siitä, kuka mallia ajaa.

Olennainen kysymys on, maksaako merkitseminen toimivuudessa. DeepMindin mukaan ei. Märkälaboratoriokokeissa kolmea kohdeproteiinia vastaan suunnitellut merkityt sitojat vastasivat osumatarkkuudeltaan, sitoutumisvoimakkuudeltaan ja sekvenssien monimuotoisuudeltaan merkitsemättömiä verrokkeja. Rakennemallin osalta yhtiö sanoo ennustustarkkuuden säilyneen ennallaan.

“Tekoäly laajentaa sitä, mitä tutkijat voivat suunnitella, ja DNA-synteesiyrityksillä on tärkeä rooli siinä, että innovaatio skaalautuu vastuullisesti.”

— James Diggans, politiikan ja bioturvallisuuden varatoimitusjohtaja, Twist Bioscience (alkukielinen lainaus englanniksi)

Koodi ulos, painot ehdoilla

Menetelmäpaperin ohella DeepMind julkaisee sekvenssipuolen koodin ja laboratorioaineiston GitHubissa osoitteessa github.com/google-deepmind/synthidbio. Koodi on Apache 2.0 -lisenssillä. Rakennevesileiman mallipainoja ei saa yhtä vapaasti: ne kulkevat AlphaFold 3:n omien käyttöehtojen alla ja edellyttävät erillistä hyväksyntää.

Avaaminen on tässä tapauksessa osa ideaa. Vesileima, jonka vain sen tekijä osaa lukea, ei auta DNA-synteesiyritystä Teksasissa eikä tietokannan ylläpitäjää Euroopassa. Yhtiö kertoo tekevänsä jatkotyötä Stanfordin yliopiston Hie-laboratorion ja Arc Instituten kanssa: ryhmä on vienyt menetelmän Evo 2 -genomimalliin ja merkinnyt sillä suunnitellun bakteriofagin perimän.

Mitä emme tiedä

Tutkijat kutsuvat työtään itse periaatetodistukseksi. Se on rehellinen sana. Avoimia kysymyksiä on useita: kuinka hyvin merkki kestää tahallista poistoyritystä, kuinka monta mallintekijää ottaa menetelmän käyttöön vapaaehtoisesti, ja mitä hyötyä merkistä on silloin kun suunnittelija käyttää merkitsemätöntä avointa mallia. Vesileima kertoo, että jokin on tehty tietyllä mallilla. Se ei kerro, ettei jotain ole tehty tekoälyllä.

Riippumatonta suomalaista arviota ei ollut saatavilla ennen julkaisua. Kommenttipyyntö on osoitettu Helsingin yliopiston ja Aalto-yliopiston laskennallisen biologian tutkijoille, ja juttua päivitetään, jos arvio saadaan. Suomessa aihe ei ole etäinen: molemmissa yliopistoissa tehdään proteiinien laskennallista mallinnusta, ja kotimaiset biotekniikkayritykset tilaavat synteettistä DNA:ta samoilta kansainvälisiltä toimittajilta, joiden seulontaa vesileima on tarkoitettu tukemaan.

Miksi tällä on väliä tavalliselle lukijalle

Samat mallit, jotka suunnittelevat uusia syöpälääkkeiden kandidaatteja, suunnittelevat periaatteessa mitä tahansa muutakin. Valvonta ei voi nojata siihen, että asiantuntija tunnistaa vaarallisen molekyylin silmällä. Jos alkuperämerkintä yleistyy, se tuo biologiaan saman perusasian, joka kuvien ja tekstin puolella on jo opeteltu: kyky kysyä aineistolta, mistä se tuli. Lääkekehityksen kannalta se voi myös nopeuttaa lupaprosesseja, kun viranomainen näkee suunnitelman tuotantoketjun.

100 %↑

Vesileima tunnistettiin kaikista laboratoriossa toimiviksi todetuista sekvensseistä

0,1 %

Sallittu väärien hälytysten osuus luonnollisilla proteiineilla (1/1 000)

yli 99,8 %↑

Rakennevesileimojen tunnistusaste kaikilla testatuilla malleilla

3

Kohdeproteiinia testattiin märkälaboratoriossa

Stutz ym., Nature 2026

Sanasto

Märkälaboratoriokoe
Oikeassa laboratoriossa aidoilla aineilla ja soluilla tehty koe, erotuksena tietokoneella tehdystä simuloinnista.
Mallipainot
Opetetun tekoälymallin sisäiset lukuarvot, joihin sen osaaminen on tallentunut. Kun painot jaetaan, kuka tahansa voi ajaa mallia omalla koneellaan.
Bakteriofagi
Virus, joka tartuttaa vain bakteereita. Faageja tutkitaan muun muassa antibioottien vaihtoehtona.

Nature-paperin tiivistelmässä tekijät muotoilevat tavoitteen varovaisesti: työ on "periaatetodistus siitä, että toimintaa säilyttävä biologinen vesileimaus on mahdollista". Seuraava mittari ei ole prosenttiluku laboratoriosta. Se on se päivä, jona ensimmäinen DNA-synteesiyritys kertoo ajavansa vesileimatarkistusta oikeille tilauksille.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 320 vuotta koodaamatta, sitten 5,4 miljoonaa
  4. 4Datakeskus söisi Lapinlahdella kokonaisen kaupungin sähköt
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.