Tutkimus

Tekoäly voitti 23 radiologia 26:sta

Alibaban malli löytää vatsakuvasta 146 löydöstä, mutta vain tutkimuskäyttöön.

Hanna HuulivuoHanna Huulivuo
Jaa:
Tekoäly voitti 23 radiologia 26:sta
Kuva: N509FZ / CC BY-SA 4.0

Kaksikymmentäkuusi radiologia sai eteensä saman kasan vatsan tietokonekerroskuvia. Osan kuvista he tulkitsivat yksin, osan niin, että tekoälyn ehdotukset olivat näkyvissä. Avun kanssa heiltä jäi huomaamatta vähemmän löydöksiä, noin kymmenen prosenttia vähemmän.

Tulos on peräisin Science-lehdessä 17. syyskuuta julkaistusta tutkimuksesta, jossa esitellään RADAR-niminen malli. Sen takana on Alibaban DAMO-akatemia yhdessä Zhejiangin yliopiston sairaalan kanssa, ja kirjoittajia on 42. Ensimmäisenä listalla on Qi Zhang, viimeisenä Tingbo Liang.

Toinen asia jutussa on vähintään yhtä kiinnostava kuin tulos. Koodi on GitHubissa, ja mallin painot voi ladata itselleen.

Mitä koneelle syötetään ja mitä se antaa ulos

Malli ei katso yhtä röntgenkuvaa. Sisään menee kokonainen vatsan varjoainetehostettu tietokonekerroskuvaus: potilaan suoneen ruiskutetaan jodipitoista varjoainetta, joka saa verisuonet ja elimet erottumaan toisistaan, ja laite kuvaa vatsan alueen satoina ohuina poikkileikkauksina.

Ulos tulee kaksi asiaa. Ensin lista löydöksistä, 146 erilaista 18 elimen tai anatomisen rakenteen alueelta, kasvaimista ja kivistä tulehduksiin. Sen lisäksi lausuntoa muistuttava tekstikuvaus siitä, mitä kuvissa näkyy.

Keskimääräinen AUC oli 0,913. AUC mittaa erottelukykyä: 0,5 vastaa kolikonheittoa ja 1,0 virheetöntä erottelua sairaan ja terveen välillä. South China Morning Postin mukaan tuo keskiarvo kertyi lähes 40 000 todellisesta tutkimuksesta.

Opetusaineisto on poikkeuksellisen laaja. Yli 400 000 varjoainetehostettua vatsan TT-tutkimusta ja 15 miljoonaa kuva–teksti-paria, ja mallia opetettiin suoraan radiologien kirjoittamista lausunnoista ilman käsin tehtyä merkkausta. Juuri se on tekninen ydin: merkkaustyö on ollut lääketieteellisen tekoälyn kallein pullonkaula.

Lukijatutkimuksessa RADAR-avustus nosti 26 radiologin diagnostista herkkyyttä noin 10 prosenttia.

Tutkimusartikkelin tiivistelmä, alkukieli englanti, An expert-level generalist AI for abdominal CT diagnosis, Science 393/6817

Mitä tiivistelmä sanoo ja mitä ei

Uutisoinnissa toistuu luku, jonka mukaan RADAR ylsi parempaan tulokseen kuin 23 lukijatutkimuksen 26 radiologista. Science-artikkelin tiivistelmässä tätä vertailua ei ole. Siinä kerrotaan vain avustuskäytön tulos ja se, että malli ylsi korkeaan suorituskykyyn useassa keskuksessa tehdyissä sisäisissä ja ulkoisissa arvioinneissa.

Teen jokaiseen juttuun kolme tarkistusta. Onko vertaisarvioitu: on, Science on vertaisarvioitu lehti. Onko toistettu: ei ole. Kyse on yhdestä julkaisusta, jonka ulkoisetkin arvioinnit teki sama ryhmä samoilla mittareilla. Kuka on kommentoinut julkisesti: tutkimusryhmä itse, joka kutsuu mallia ”maailman ensimmäiseksi asiantuntijatason yleiskäyttöiseksi lääketieteellisen kuvantamisen malliksi”. Sitaatti on englanninkielinen ja peräisin SCMP:n jutusta, jossa ei ole yhtään nimellä esitettyä lainausta.

Riippumatonta radiologia, joka olisi arvioinut tulosta julkisuudessa, en löytänyt 20. syyskuuta mennessä. Artikkelin kokoteksti on maksumuurin takana ja Hugging Facen mallikortti vaatii kirjautumisen, joten lisenssiehdot on tässä jutussa tarkistettu GitHub-julkaisusta.

Kaksi lisenssiä, kaksi eri asiaa

Koodi on julkaistu Apache 2.0 -lisenssillä, joka sallii myös kaupallisen käytön ja muokkaamisen. Mallin painot, eli opetuksen tulos jota ilman koodi ei tee mitään, on julkaistu CC BY-NC-SA 4.0 -ehdoilla: ei-kaupallinen käyttö, tekijän nimeäminen ja saman lisenssin jatkaminen.

Käytännössä hyvinvointialue voi ladata mallin ja ajaa sen omalla kuva-aineistollaan tutkimuksena. Osaksi myytävää palvelua tai maksullista kuvantamistuotetta sitä ei näillä ehdoilla saa laittaa.

Suomessa este on muukin kuin lisenssi

Kliiniseen käyttöön tarkoitettu ohjelmisto on EU:ssa lääkinnällinen laite ja tarvitsee CE-merkinnän. Asetuksessa on poikkeus terveydenhuollon yksikön itse valmistamille ja itse käyttämille laitteille, mutta sen ehdot ovat tiukat ja vaativat dokumentoidun laatujärjestelmän. Avoin malli ei siis ole oikotie potilastyöhön. Se on lupa kokeilla.

Kokeilun arvo on silti aito, koska kuvantamisen kysyntä kasvaa Suomessa nopeammin kuin radiologien määrä. Lääkärilehti kirjoitti radiologien tarpeen kasvusta jo kymmenen vuotta sitten, eikä tilanne ole sen jälkeen helpottanut. Tampereella valmisteltiin viime joulukuussa tutkimusta siitä, voisiko tekoäly keventää radiologien työtaakkaa rintasyöpäseulonnassa.

Potilaalle tämä näkyy yhtenä lukuna: montako päivää kuvauksen ja lausunnon välissä on. Päivystyksessä otettu vatsan TT-kuva katsotaan heti, mutta kiireettömän kuvauksen lausunto voi odottaa jonossa. Jos lukijatutkimuksen kymmenen prosentin lisä herkkyydessä pitää suomalaisessa aineistossa, kyse on niistä löydöksistä, jotka nyt huomataan vasta seuraavalla kuvauskerralla. Jos ei pidä, kyse on kalliista kokeilusta. Kumpikaan ei selviä ilman että joku ajaa mallin suomalaisilla kuvilla läpi.

23/26

Radiologia, jotka malli päihitti tarkkuudessa

+10 %

Radiologien herkkyyden nousu, kun malli avusti

146

Tunnistettavaa löydöstä 18 elimen alueelta

0,913

Mallin keskimääräinen AUC, kun 1,0 on virheetön erottelu

Science 393/6817, An expert-level generalist AI for abdominal CT diagnosis

Avointa koodia, rajattu lisenssi

Lähdekoodi

Vapaasti saatavilla GitHubissa

Kaupallinen käyttö
Sallittu
Missä
alibaba-damo-academy/RADAR

Mallin painot

Ladattavissa, mutta rajatusti

Kaupallinen käyttö
Ei sallittu
Missä
Hugging Face, vaatii kirjautumisen

RADARin lähdekoodi ja lisenssitiedot, tarkistettu 20.9.2026

Sanasto

Mallin painot
Opetuksen tuloksena syntyneet lukuarvot, joihin malli on tallentanut oppimansa. Ilman painoja pelkkä ohjelmakoodi on tyhjä kuori.
Herkkyys
Lääketieteellinen mittari sille, kuinka suuri osa todellisista löydöksistä tulee havaituksi. Korkea herkkyys tarkoittaa, että vähän jää huomaamatta.

Lääkärit eivät ole yhtä innoissaan

Wolters Kluwerin Future Ready Healthcare -kyselyssä, jonka Ipsos toteutti ja joka julkaistiin kesäkuussa 2026, 74 prosenttia vastanneista kliinikoista pelkäsi, että liiallinen tekoälyyn nojaaminen rapauttaa heidän omaa osaamistaan. Vastaajia oli 355. Kysely on siis kesältä, ei tältä viikolta, mutta se on tuorein laaja mittaus aiheesta.

Pelko ei ole abstrakti. Kun malli ehdottaa löydökset ensin, lääkärin katse ohjautuu niihin, ja tutkimuskirjallisuudessa ilmiöstä käytetään nimeä automaatioharha. RADARin lukijakoe mittasi herkkyyttä eli sitä, löytyvätkö oikeat asiat. Se ei kerro mitään siitä, mitä tapahtuu viiden vuoden päästä radiologille, joka ei ole koskaan lukenut vatsan TT-sarjaa ilman konetta vieressään.

Avoin julkaisu siirtää todistustaakkaa kiinnostavalla tavalla. Radiologian tekoälyille on kertynyt vertaisarvioitua näyttöä vuosien ajan pieninä paloina, ja tämä on yhden ryhmän yksi julkaisu. Nyt kuka tahansa yliopistosairaala voi ladata painot ja ajaa mallin läpi omalla potilasaineistollaan, myös sellaisella jolla se pärjää huonosti. Seuraava kiinnostava uutinen RADARista tulee todennäköisesti joltain muulta kuin Alibabalta.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.