Mark Zuckerbergin ja Priscilla Chanin perustama Biohub julkaisi keskiviikkona kolmen mallin kokonaisuuden, joka sisältää kielimallin ESMC:n, rakenne-ennustimen ESMFold2:n ja 1,1 miljardin proteiinirakenteen ESM Atlas -tietokannan. Koko pino on saatavilla MIT-lisenssillä, joka on yksi sallivimmista avoimen lähdekoodin lisensseistä.
Tärkein uutinen ei tällä kertaa ole tarkkuus. ESMFold2:n etumatka AlphaFold 3:een vasta-aine–antigeeni-ennustuksessa on jo käsitelty AI Suomessa erikseen. Olennaisempi siirto on lisenssi: aiemmin huippuluokan proteiinimallien painot on usein julkaistu vain ei-kaupallisin ehdoin tai jätetty maksullisen rajapinnan taakse. MIT-lisenssi poistaa molemmat esteet kerralla.
Avoin lisenssi on tutkijalle eri asia kuin ilmainen rajapinta
MIT-lisenssi sallii latauksen, muokkauksen, edelleenjakelun ja kaupallisen käytön ilman erillistä lupaa Biohubilta. Käytännössä tämä tarkoittaa kolmea asiaa. Mallin painot voi siirtää omalle laskentaklusterille, eikä sekvenssidataa tarvitse lähettää kolmannen osapuolen palvelimelle. Pienen lääkeyhtiön tai akateemisen ryhmän ei tarvitse neuvotella jokaiselle uudelle kohteelle erillistä sopimusta. Mallin sisuksiin pääsee käsiksi, mikä mahdollistaa hienosäädön omiin kohteisiin, kuten harvinaisten geenivarianttien tuottamiin proteiinimuotoihin.
Vertailun vuoksi: DeepMindin AlphaFold 3:n painot julkaistiin viime vuonna ei-kaupallisin ehdoin, ja kaupallinen käyttö vaatii erillisen sopimuksen Isomorphic Labsilta. Tämä on muodostunut käytännön kynnykseksi etenkin pienille bioteknologiayhtiöille.
Mitä paketti sisältää
ESMC on kielimalli, joka on koulutettu noin 2,8 miljardilla proteiinisekvenssillä koko elämänkirjosta, mukaan lukien ääriolosuhteissa elävät mikrobit ja yli 20 000 ihmisen proteiinityyppiä. ESMFold2 kääntää sekvenssin kolmiulotteiseksi rakenteeksi ja selviytyy myös biomolekulaarisista komplekseista. ESM Atlas on valmiiksi laskettu varasto: 6,8 miljardia sekvenssiä ja 1,1 miljardia ennustettua rakennetta, mikä ylittää AlphaFoldin tietokannan yli 800 miljoonalla rakenteella.
Biohubin tutkijat osoittivat mallin käyttökelpoisuuden suunnittelemalla sidoslääkkeitä viidelle syöpä- ja immuunikohteelle: EGFR, PDGFRβ, PD-L1, CTLA-4 ja CD45. Kompaktien minibinder-molekyylien laboratoriossa vahvistettu osumaprosentti oli 36–88, vasta-ainepohjaisten muotojen 15–29. Lukemat ovat suunnitteluvaiheessa poikkeuksellisen korkeita.
Mitä Aalto, Orion ja FinnGen saavat
Aalto-yliopiston AI-lääkekehitysryhmä on aiemmin hyödyntänyt julkaisuissaan ESM-mallien edellisiä versioita proteiini-proteiini-vuorovaikutusten ennustamiseen. MIT-lisenssin myötä ryhmä voi nyt hienosäätää ESMFold2:n omilla aineistoillaan ilman uutta sopimusneuvottelua. Otin yhteyttä ryhmän vastuututkijaan keskiviikkona iltapäivällä, mutta vahvistettua kommenttia ei ehtinyt julkaisuun mennessä.
Orion on viestinyt panostavansa tekoälypohjaiseen lääkeaihioiden seulontaan, ja yhtiön viestinnästä on aiemmin todettu, että avoimet työkalut nopeuttavat alkuvaiheen tutkimusta. Vasta-ainekehityksen alkupäässä Biohubin julkaisemat 36–88 prosentin osumaluvut antavat suunnittelukierrokselle aiempaa korkeamman lähtötason. Yhtiön viestintä ei vastannut kysymyksiin julkaisupäivän kuluessa.
FinnGen kerää genomi- ja terveysrekisteritietoa noin 500 000 suomalaisesta. Avoimella proteiinimallilla ryhmä pystyy ennustamaan, miten suomalaisessa väestössä rikastuneet harvinaiset geenivariantit muuttavat proteiinin rakennetta ja miten ne voivat altistaa sairauksille tai vaikuttaa lääkevasteeseen. Ilman avointa mallia tätä joutuisi tekemään API-kutsuina tai erillisellä lisenssillä, mikä kasvattaa kuluja ja rajoittaa kokeilukulttuuria. Suomen genomidata on globaalissa mittakaavassa pieni, mutta tarkasti karakterisoitu aineisto, jossa juuri rakenne-ennustus tuo lisäarvoa.
Mihin avoimuus ei riitä
MIT-lisenssi ei poista laskentakustannusta. ESM Atlas -tietokannan 1,1 miljardin rakenteen säilytys vaatii teratavujen luokkaa olevaa varastointia, ja ESMFold2:n hienosäätö GPU-aikaa, jota yliopistoklusterissa ei tarjoilla ilmaiseksi. Hyödyn ulosmittaaminen vaatii edelleen rahoitusta ja osaamista, jota Suomessa on toistaiseksi harvoissa ryhmissä.
Toinen rajoite on validointi. Malli ennustaa sitoutumisen, mutta lääkeaihion testaaminen vaatii edelleen solu- ja eläinkokeita ja lopulta kliinistä tutkimusta. Aiemman sukupolven avoimet rakennemallit eivät ole lyhentäneet tätä polkua dramaattisesti, ja sama varovaisuus on syytä säilyttää myös ESMFold2:n kohdalla.
Silti lähtötaso on uusi. Vielä kaksi vuotta sitten suomalainen yliopistoryhmä joutui valitsemaan kaupallisen lisenssin maksamisen ja heikomman avoimen vaihtoehdon väliltä. Nyt valintatilanne kääntyi: huippuluokan ennustus on lähtökohta, ja kustannukset siirtyvät laskentaan, validointiin ja domain-osaamiseen. Sitä jakoa Suomi pystyy paremmin kilpailemaan.
Rakennetta ESM Atlasissa
Koulutussekvenssiä
Avoin lisenssi – sallii kaupallisen käytön
Proteiinimallit Aallolle ja Orionille: lisenssit ja saatavuus
ESMC / ESMFold2 (Biohub)
Julkaistu 27.5.2026
- Lisenssi
- MIT (avoin)
- Kaupallinen käyttö
- Sallittu ilman lupaa
- API-maksu
- Ei (lokaaliajo)
- Rakenteita
- 1,1 mrd
AlphaFold 3 (Google DeepMind)
Vertailukohta
- Lisenssi
- Ei-kaupallinen
- Kaupallinen käyttö
- Vaatii erillisen sopimuksen
- API-maksu
- AlphaFold Server -rajoitukset
- Rakenteita
- 200 M+



