Tutkimus

GeneBench paljasti: kärkimallit sössivät biologiassa

Paras malli ratkaisi 129 tehtävästä vain 31,5 prosenttia, muut jäivät kauas taakse.

Hanna HuulivuoHanna Huulivuo
Jaa:
GeneBench paljasti: kärkimallit sössivät biologiassa

OpenAI julkaisi uuden vertailutestin, joka mittaa tekoälymallien osaamista laskennallisessa biologiassa. Tulos oli kylmää kyytiä hypelle: paras testattu malli, GPT-5.6 Sol Pro, ratkaisi vain reilun kolmanneksen tehtävistä. Anthropicin Claude Opus 4.8 jäi kuudennekseen. Kun samat mallit hakkaavat monissa yleistehtävissä ihmisen mennen tullen, biologian numerot kertovat karua kieltä siitä, missä kärkiäly yhä kompuroi.

Mikä GeneBench on?

GeneBench, tarkalta nimeltään GeneBench-Pro, koostuu 129 tehtävästä. Ne kattavat genomianalyysiä, proteiinien laskostumiseen liittyviä kysymyksiä ja märkälaboratorion kokeiden suunnittelua. Kyse ei ole hakukoneella ratkeavista triviakysymyksistä vaan ongelmista, jotka vaativat tohtoritason ymmärrystä alalta.

Testin idea on antaa toimialalle yhteinen mittatikku. Sen sijaan, että jokainen laboratorio arvailisi omilla esimerkeillään, onko malli hyödyllinen, GeneBench tarjoaa vakioidun tavan verrata malleja keskenään ja seurata edistystä ajassa. OpenAI:n mukaan testi toimii lähtötasona myös erikoismalleille, kuten Claude Sciencelle ja yhtiön omalle GPT-Rosalindille.

31,5 %↓

Paras malli GeneBenchin biologiatehtävissä

80–90 %↑

Samat mallit yleisissä päättely- ja koodaustesteissä

129

Tehtävää testissä

OpenAI, GeneBench-Pro

Mitä luvut kertovat

31,5 prosenttia tarkoittaa, että kahdesta kolmesta tehtävästä paraskin malli antoi väärän vastauksen. Claude Opus 4.8:n 16 prosenttia on vielä kauempana käyttökelpoisesta. Vertailun vuoksi: monissa yleisissä päättely- ja koodaustesteissä samat mallit yltävät 80–90 prosenttiin. Kuilu kertoo, ettei laaja yleisosaaminen käänny suoraan syväksi ymmärrykseksi kapealla erikoisalalla.

Laskennallinen biologia on tälle hyvä koetinkivi. Se yhdistää genetiikkaa, kemiaa, tilastotiedettä ja kokeellista suunnittelua tavalla, jossa yksikin virheellinen oletus kaataa koko ketjun. Malli voi tuottaa uskottavan kuuloisen vastauksen, joka on silti biologisesti mahdoton, eikä se itse huomaa eroa.

“Numerot kertovat, kuinka vaikeaa asiantuntijatason laskennallinen biologia on verrattuna moneen muuhun alaan.”

— OpenAI, GeneBench-Pro -julkaisu, Vertailutesti

Miksi tämä koskee muitakin kuin tutkijoita

Lääkekehitys ja terveydenhuolto ovat aloja, joilla tekoälyn lupauksia myydään suurella äänellä. GeneBench muistuttaa, ettei kärkimalliin voi vielä nojata ilman asiantuntijan valvontaa. Kun testissä paraskin malli erehtyy joka toisessa tehtävässä, kliininen tai laboratoriotason päätös sen varassa olisi suoranainen riski potilaalle.

Sanasto

Proteiinien laskostuminen
Ilmiö, jossa pitkä proteiiniketju taittuu kolmiulotteiseen muotoonsa. Muoto ratkaisee, miten proteiini toimii elimistössä, ja sen ennustaminen on yksi biologian vaikeimmista laskennallisista ongelmista.

Yrityksille selvä viesti

Biolääketieteen tiimeille GeneBench toimii kalibrointivälineenä. Noin 31 prosentin tulos tarkoittaa käytännössä, että yleismalli tarvitsee rinnalleen alakohtaisia työkaluja, tietokantayhteyksiä ja tarkistusvaiheita ennen kuin se voi korvata ihmisen missään vaiheessa. Ostajan kannattaa vaatia myyjältä juuri tällaisia lukuja, ei pelkkiä demoja.

Kiinnostavinta ei ehkä ole tämän hetken tulos vaan se, mitä se merkitsee erikoismallien nousulle. GeneBenchin kaltainen lähtötaso antaa Claude Sciencen ja GPT-Rosalindin tapaisille erikoistuneille malleille konkreettisen tavoitteen. Jos ja kun ne alkavat ohittaa yleismallit reippaasti biologian tehtävissä, se on merkki siitä, että tieteen tekoälyt eriytyvät omaksi lajikseen. Yleisnero jää silloin harrastajaksi, ja varsinainen työ siirtyy kapeasti koulutetuille malleille.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat
  5. 5Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.