Kaksikymmentäkuusi radiologia sai eteensä saman kasan vatsan tietokonekerroskuvia. Osan kuvista he tulkitsivat yksin, osan niin, että tekoälyn ehdotukset olivat näkyvissä. Avun kanssa heiltä jäi huomaamatta vähemmän löydöksiä, noin kymmenen prosenttia vähemmän.
Tulos on peräisin Science-lehdessä 17. syyskuuta julkaistusta tutkimuksesta, jossa esitellään RADAR-niminen malli. Sen takana on Alibaban DAMO-akatemia yhdessä Zhejiangin yliopiston sairaalan kanssa, ja kirjoittajia on 42. Ensimmäisenä listalla on Qi Zhang, viimeisenä Tingbo Liang.
Toinen asia jutussa on vähintään yhtä kiinnostava kuin tulos. Koodi on GitHubissa, ja mallin painot voi ladata itselleen.
Mitä koneelle syötetään ja mitä se antaa ulos
Malli ei katso yhtä röntgenkuvaa. Sisään menee kokonainen vatsan varjoainetehostettu tietokonekerroskuvaus: potilaan suoneen ruiskutetaan jodipitoista varjoainetta, joka saa verisuonet ja elimet erottumaan toisistaan, ja laite kuvaa vatsan alueen satoina ohuina poikkileikkauksina.
Ulos tulee kaksi asiaa. Ensin lista löydöksistä, 146 erilaista 18 elimen tai anatomisen rakenteen alueelta, kasvaimista ja kivistä tulehduksiin. Sen lisäksi lausuntoa muistuttava tekstikuvaus siitä, mitä kuvissa näkyy.
Keskimääräinen AUC oli 0,913. AUC mittaa erottelukykyä: 0,5 vastaa kolikonheittoa ja 1,0 virheetöntä erottelua sairaan ja terveen välillä. South China Morning Postin mukaan tuo keskiarvo kertyi lähes 40 000 todellisesta tutkimuksesta.
Opetusaineisto on poikkeuksellisen laaja. Yli 400 000 varjoainetehostettua vatsan TT-tutkimusta ja 15 miljoonaa kuva–teksti-paria, ja mallia opetettiin suoraan radiologien kirjoittamista lausunnoista ilman käsin tehtyä merkkausta. Juuri se on tekninen ydin: merkkaustyö on ollut lääketieteellisen tekoälyn kallein pullonkaula.
“Lukijatutkimuksessa RADAR-avustus nosti 26 radiologin diagnostista herkkyyttä noin 10 prosenttia.”
Mitä tiivistelmä sanoo ja mitä ei
Uutisoinnissa toistuu luku, jonka mukaan RADAR ylsi parempaan tulokseen kuin 23 lukijatutkimuksen 26 radiologista. Science-artikkelin tiivistelmässä tätä vertailua ei ole. Siinä kerrotaan vain avustuskäytön tulos ja se, että malli ylsi korkeaan suorituskykyyn useassa keskuksessa tehdyissä sisäisissä ja ulkoisissa arvioinneissa.
Teen jokaiseen juttuun kolme tarkistusta. Onko vertaisarvioitu: on, Science on vertaisarvioitu lehti. Onko toistettu: ei ole. Kyse on yhdestä julkaisusta, jonka ulkoisetkin arvioinnit teki sama ryhmä samoilla mittareilla. Kuka on kommentoinut julkisesti: tutkimusryhmä itse, joka kutsuu mallia ”maailman ensimmäiseksi asiantuntijatason yleiskäyttöiseksi lääketieteellisen kuvantamisen malliksi”. Sitaatti on englanninkielinen ja peräisin SCMP:n jutusta, jossa ei ole yhtään nimellä esitettyä lainausta.
Riippumatonta radiologia, joka olisi arvioinut tulosta julkisuudessa, en löytänyt 20. syyskuuta mennessä. Artikkelin kokoteksti on maksumuurin takana ja Hugging Facen mallikortti vaatii kirjautumisen, joten lisenssiehdot on tässä jutussa tarkistettu GitHub-julkaisusta.
Kaksi lisenssiä, kaksi eri asiaa
Koodi on julkaistu Apache 2.0 -lisenssillä, joka sallii myös kaupallisen käytön ja muokkaamisen. Mallin painot, eli opetuksen tulos jota ilman koodi ei tee mitään, on julkaistu CC BY-NC-SA 4.0 -ehdoilla: ei-kaupallinen käyttö, tekijän nimeäminen ja saman lisenssin jatkaminen.
Käytännössä hyvinvointialue voi ladata mallin ja ajaa sen omalla kuva-aineistollaan tutkimuksena. Osaksi myytävää palvelua tai maksullista kuvantamistuotetta sitä ei näillä ehdoilla saa laittaa.



