Tutkimus

Zuckerbergin Biohub avasi proteiinimallit MIT-lisenssillä

Aalto, Orion ja FinnGen saavat ESMFold2:n käyttöön ilman API-maksuja

Hanna HuulivuoHanna Huulivuo
Jaa:
Zuckerbergin Biohub avasi proteiinimallit MIT-lisenssillä
Kuva: Idaho National Laboratory / CC BY 2.0

Mark Zuckerbergin ja Priscilla Chanin perustama Biohub julkaisi keskiviikkona kolmen mallin kokonaisuuden, joka sisältää kielimallin ESMC:n, rakenne-ennustimen ESMFold2:n ja 1,1 miljardin proteiinirakenteen ESM Atlas -tietokannan. Koko pino on saatavilla MIT-lisenssillä, joka on yksi sallivimmista avoimen lähdekoodin lisensseistä.

Tärkein uutinen ei tällä kertaa ole tarkkuus. ESMFold2:n etumatka AlphaFold 3:een vasta-aine–antigeeni-ennustuksessa on jo käsitelty AI Suomessa erikseen. Olennaisempi siirto on lisenssi: aiemmin huippuluokan proteiinimallien painot on usein julkaistu vain ei-kaupallisin ehdoin tai jätetty maksullisen rajapinnan taakse. MIT-lisenssi poistaa molemmat esteet kerralla.

Avoin lisenssi on tutkijalle eri asia kuin ilmainen rajapinta

MIT-lisenssi sallii latauksen, muokkauksen, edelleenjakelun ja kaupallisen käytön ilman erillistä lupaa Biohubilta. Käytännössä tämä tarkoittaa kolmea asiaa. Mallin painot voi siirtää omalle laskentaklusterille, eikä sekvenssidataa tarvitse lähettää kolmannen osapuolen palvelimelle. Pienen lääkeyhtiön tai akateemisen ryhmän ei tarvitse neuvotella jokaiselle uudelle kohteelle erillistä sopimusta. Mallin sisuksiin pääsee käsiksi, mikä mahdollistaa hienosäädön omiin kohteisiin, kuten harvinaisten geenivarianttien tuottamiin proteiinimuotoihin.

Vertailun vuoksi: DeepMindin AlphaFold 3:n painot julkaistiin viime vuonna ei-kaupallisin ehdoin, ja kaupallinen käyttö vaatii erillisen sopimuksen Isomorphic Labsilta. Tämä on muodostunut käytännön kynnykseksi etenkin pienille bioteknologiayhtiöille.

Mitä paketti sisältää

ESMC on kielimalli, joka on koulutettu noin 2,8 miljardilla proteiinisekvenssillä koko elämänkirjosta, mukaan lukien ääriolosuhteissa elävät mikrobit ja yli 20 000 ihmisen proteiinityyppiä. ESMFold2 kääntää sekvenssin kolmiulotteiseksi rakenteeksi ja selviytyy myös biomolekulaarisista komplekseista. ESM Atlas on valmiiksi laskettu varasto: 6,8 miljardia sekvenssiä ja 1,1 miljardia ennustettua rakennetta, mikä ylittää AlphaFoldin tietokannan yli 800 miljoonalla rakenteella.

Biohubin tutkijat osoittivat mallin käyttökelpoisuuden suunnittelemalla sidoslääkkeitä viidelle syöpä- ja immuunikohteelle: EGFR, PDGFRβ, PD-L1, CTLA-4 ja CD45. Kompaktien minibinder-molekyylien laboratoriossa vahvistettu osumaprosentti oli 36–88, vasta-ainepohjaisten muotojen 15–29. Lukemat ovat suunnitteluvaiheessa poikkeuksellisen korkeita.

Mitä Aalto, Orion ja FinnGen saavat

Aalto-yliopiston AI-lääkekehitysryhmä on aiemmin hyödyntänyt julkaisuissaan ESM-mallien edellisiä versioita proteiini-proteiini-vuorovaikutusten ennustamiseen. MIT-lisenssin myötä ryhmä voi nyt hienosäätää ESMFold2:n omilla aineistoillaan ilman uutta sopimusneuvottelua. Otin yhteyttä ryhmän vastuututkijaan keskiviikkona iltapäivällä, mutta vahvistettua kommenttia ei ehtinyt julkaisuun mennessä.

Orion on viestinyt panostavansa tekoälypohjaiseen lääkeaihioiden seulontaan, ja yhtiön viestinnästä on aiemmin todettu, että avoimet työkalut nopeuttavat alkuvaiheen tutkimusta. Vasta-ainekehityksen alkupäässä Biohubin julkaisemat 36–88 prosentin osumaluvut antavat suunnittelukierrokselle aiempaa korkeamman lähtötason. Yhtiön viestintä ei vastannut kysymyksiin julkaisupäivän kuluessa.

FinnGen kerää genomi- ja terveysrekisteritietoa noin 500 000 suomalaisesta. Avoimella proteiinimallilla ryhmä pystyy ennustamaan, miten suomalaisessa väestössä rikastuneet harvinaiset geenivariantit muuttavat proteiinin rakennetta ja miten ne voivat altistaa sairauksille tai vaikuttaa lääkevasteeseen. Ilman avointa mallia tätä joutuisi tekemään API-kutsuina tai erillisellä lisenssillä, mikä kasvattaa kuluja ja rajoittaa kokeilukulttuuria. Suomen genomidata on globaalissa mittakaavassa pieni, mutta tarkasti karakterisoitu aineisto, jossa juuri rakenne-ennustus tuo lisäarvoa.

Mihin avoimuus ei riitä

MIT-lisenssi ei poista laskentakustannusta. ESM Atlas -tietokannan 1,1 miljardin rakenteen säilytys vaatii teratavujen luokkaa olevaa varastointia, ja ESMFold2:n hienosäätö GPU-aikaa, jota yliopistoklusterissa ei tarjoilla ilmaiseksi. Hyödyn ulosmittaaminen vaatii edelleen rahoitusta ja osaamista, jota Suomessa on toistaiseksi harvoissa ryhmissä.

Toinen rajoite on validointi. Malli ennustaa sitoutumisen, mutta lääkeaihion testaaminen vaatii edelleen solu- ja eläinkokeita ja lopulta kliinistä tutkimusta. Aiemman sukupolven avoimet rakennemallit eivät ole lyhentäneet tätä polkua dramaattisesti, ja sama varovaisuus on syytä säilyttää myös ESMFold2:n kohdalla.

Silti lähtötaso on uusi. Vielä kaksi vuotta sitten suomalainen yliopistoryhmä joutui valitsemaan kaupallisen lisenssin maksamisen ja heikomman avoimen vaihtoehdon väliltä. Nyt valintatilanne kääntyi: huippuluokan ennustus on lähtökohta, ja kustannukset siirtyvät laskentaan, validointiin ja domain-osaamiseen. Sitä jakoa Suomi pystyy paremmin kilpailemaan.

1,1 mrd↑

Rakennetta ESM Atlasissa

2,8 mrd

Koulutussekvenssiä

MIT↑

Avoin lisenssi – sallii kaupallisen käytön

Biohub, 27.5.2026

Proteiinimallit Aallolle ja Orionille: lisenssit ja saatavuus

ESMC / ESMFold2 (Biohub)

Julkaistu 27.5.2026

Lisenssi
MIT (avoin)
Kaupallinen käyttö
Sallittu ilman lupaa
API-maksu
Ei (lokaaliajo)
Rakenteita
1,1 mrd

AlphaFold 3 (Google DeepMind)

Vertailukohta

Lisenssi
Ei-kaupallinen
Kaupallinen käyttö
Vaatii erillisen sopimuksen
API-maksu
AlphaFold Server -rajoitukset
Rakenteita
200 M+

Biohub & Nature, 27.5.2026

Sanasto

MIT-lisenssi
Yksi sallivimmista avoimen lähdekoodin lisensseistä. Sallii koodin ja mallien lataamisen, muokkaamisen ja kaupallisen käytön ilman erillistä lupaa tai maksua – vaatimuksena vain alkuperäisen tekijän mainitseminen.
Mallin painot
Lukuarvot, jotka muodostavat tekoälymallin oppimisen tuloksen. Niiden julkaiseminen tarkoittaa, että malli voidaan ladata omalle koneelle ja ajaa ilman alkuperäisen tekijän palvelinta.
Proteiinin rakenne-ennustus
Tekoälyn kykyä päätellä proteiinin kolmiulotteinen muoto sen aminohapposekvenssistä. Muoto määrää proteiinin toiminnan ja on lähtökohta lääkkeiden suunnittelulle.

Mitä MIT-lisenssi sallii käytännössä

MIT-lisenssi on yksi sallivimmista avoimen lähdekoodin lisensseistä. Se sallii koodin ja mallipainojen lataamisen, muokkaamisen, jakamisen ja sisällyttämisen kaupallisiin tuotteisiin ilman erillistä lupaa tai rojaltimaksua. Ainoa vaatimus on alkuperäisen tekijänoikeusmerkinnän säilyttäminen.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.