OpenAI julkaisi uuden vertailutestin, joka mittaa tekoälymallien osaamista laskennallisessa biologiassa. Tulos oli kylmää kyytiä hypelle: paras testattu malli, GPT-5.6 Sol Pro, ratkaisi vain reilun kolmanneksen tehtävistä. Anthropicin Claude Opus 4.8 jäi kuudennekseen. Kun samat mallit hakkaavat monissa yleistehtävissä ihmisen mennen tullen, biologian numerot kertovat karua kieltä siitä, missä kärkiäly yhä kompuroi.
Mikä GeneBench on?
GeneBench, tarkalta nimeltään GeneBench-Pro, koostuu 129 tehtävästä. Ne kattavat genomianalyysiä, proteiinien laskostumiseen liittyviä kysymyksiä ja märkälaboratorion kokeiden suunnittelua. Kyse ei ole hakukoneella ratkeavista triviakysymyksistä vaan ongelmista, jotka vaativat tohtoritason ymmärrystä alalta.
Testin idea on antaa toimialalle yhteinen mittatikku. Sen sijaan, että jokainen laboratorio arvailisi omilla esimerkeillään, onko malli hyödyllinen, GeneBench tarjoaa vakioidun tavan verrata malleja keskenään ja seurata edistystä ajassa. OpenAI:n mukaan testi toimii lähtötasona myös erikoismalleille, kuten Claude Sciencelle ja yhtiön omalle GPT-Rosalindille.
Paras malli GeneBenchin biologiatehtävissä
Samat mallit yleisissä päättely- ja koodaustesteissä
Tehtävää testissä
Mitä luvut kertovat
31,5 prosenttia tarkoittaa, että kahdesta kolmesta tehtävästä paraskin malli antoi väärän vastauksen. Claude Opus 4.8:n 16 prosenttia on vielä kauempana käyttökelpoisesta. Vertailun vuoksi: monissa yleisissä päättely- ja koodaustesteissä samat mallit yltävät 80–90 prosenttiin. Kuilu kertoo, ettei laaja yleisosaaminen käänny suoraan syväksi ymmärrykseksi kapealla erikoisalalla.
Laskennallinen biologia on tälle hyvä koetinkivi. Se yhdistää genetiikkaa, kemiaa, tilastotiedettä ja kokeellista suunnittelua tavalla, jossa yksikin virheellinen oletus kaataa koko ketjun. Malli voi tuottaa uskottavan kuuloisen vastauksen, joka on silti biologisesti mahdoton, eikä se itse huomaa eroa.



