Tutkimus

Tekoäly päihitti radiologin ilman yhtäkään röntgenkuvaa

Tutkijat löysivät kangastuspäättelyn – mallit kuvailevat kuvia joita ei ole

Hanna HuulivuoHanna Huulivuo
Jaa:
Tekoäly päihitti radiologin ilman yhtäkään röntgenkuvaa

Kuvittele lääkäri, joka kirjoittaa tarkan röntgenlausunnon katsomatta yhtään kuvaa. Stanfordin yliopiston tutkijaryhmä osoitti maaliskuussa julkaistussa MIRAGE-tutkimuksessa, että nykyiset multimodaaliset tekoälymallit tekevät juuri niin. Tutkijat poistivat kuvat kokonaan kuuden yleisen ja lääketieteellisen vertailutestin tehtävistä ilman, että mallien kehotteita muutettiin millään tavalla. GPT-5, Gemini 3 Pro ja Claude Opus 4.5 säilyttivät silti 70–80 prosenttia alkuperäisestä tarkkuudestaan ja tuottivat yksityiskohtaisia kuvauksia kuvista, joita niille ei koskaan näytetty.

Fei-Fei Lin johtama tutkijaryhmä kutsuu ilmiötä kangastuspäättelyksi (mirage reasoning). Se eroaa tavanomaisista hallusinaatioista olennaisella tavalla: malli ei keksi yksittäistä faktaa vaan rakentaa kokonaisen kuvitellun kehyksen, jossa se käyttäytyy kuin visuaalinen syöte olisi todella olemassa. Kaikki päättely perustuu tähän olemattomaan pohjaan, ja lopputulos muistuttaa aitoa analyysiä niin tarkasti, että ulkopuolinen arvioija ei välttämättä huomaa eroa.

Ero paljastui koeasetelmassa. Kun mallille kerrottiin suoraan, ettei kuvaa ole, ja pyydettiin arvaamaan, tarkkuus laski selvästi. Kangastustilassa, jossa kuvan puuttumisesta ei mainittu mitään, mallit tuottivat itsevarmoja ja yksityiskohtaisia vastauksia. Tutkijat huomauttavat, että mallit toimivat kahdessa eri päättelytilassa sen mukaan, uskovatko ne saaneensa kuvan vai eivät.

Näkymätön röntgenkuva, tarkka diagnoosi

Tutkimuksen lääketieteelliset havainnot ovat hälyttäviä. Kangastustilassa Gemini 3 Pro tuotti diagnooseja, joissa vakavat löydökset hallitsivat: sydäninfarkteja, melanoomia ja karsinoomia esiintyi suhteettoman paljon verrattuna normaalilöydöksiin. Malli ei ainoastaan keksinyt nähneensä kuvan, vaan löysi siitä järjestelmällisesti sairauksia. Terveydenhuollon sovelluksissa tällainen vinoutuma voisi johtaa turhiin jatkotutkimuksiin ja vääriin diagnooseihin.

Ryhmä teki myös provosoivan kokeen. He kouluttivat pienen, kolmen miljardin parametrin tekstimallin, jolla ei ole lainkaan kuvankäsittelykykyä, vastaamaan rintakehän röntgenkuviin liittyviin kysymyksiin pelkän kysymystekstin perusteella. Tämä superpäättelijä päihitti kaikki testatut multimodaaliset mallit ja ylitti ihmisradiologien tarkkuuden yli kymmenellä prosenttiyksiköllä ReXVQA-testissä. Tulos viittaa siihen, etteivät nykyiset vertailutestit mittaa visuaalista ymmärrystä, vaan mallien kykyä päätellä todennäköinen vastaus kysymystekstin kielellisistä vihjeistä.

“Mallit eivät ainoastaan vastanneet kilpailukykyisesti, vaan ylittivät ihmisradiologien suorituksen ilman minkäänlaista visuaalista syötettä.”

— MIRAGE-tutkimus, Stanfordin yliopisto

Kolme neljästä testikysymyksestä karsiutui

Malleja testattiin kuudella vertailutestillä. Yleisistä visuaalisista testeistä mukana olivat MMMU-Pro ja Video-MMMU, lääketieteellisistä VQA-Rad, MicroVQA ja MedXpertQA-MM. Tutkijat loivat myös Phantom-0-testin, joka sisälsi 200 visuaalista kysymystä 20 kategoriasta ilman yhtään kuvaa. Lääketieteellisissä testeissä mallit saavuttivat jopa 99 prosenttia kuvallisesta tarkkuudestaan pelkän tekstin perusteella.

Tutkijat kehittivät ongelmaan ratkaisun nimeltä B-Clean. Viitekehys karsii vertailutestistä kaikki kysymykset, joihin mikä tahansa testattu malli vastasi oikein ilman kuvaa. Jäljelle jäävät vain sellaiset tehtävät, jotka todella vaativat visuaalista ymmärrystä. Puhdistuksen tulokset olivat rajuja: 74–77 prosenttia kaikista kysymyksistä karsiutui. GPT-5.1:n tarkkuus MicroVQA-testissä putosi 61,5 prosentista 15,4 prosenttiin, ja mallien keskinäinen paremmuusjärjestys muuttui merkittävästi.

Kangastuspäättely ei koske pelkästään lääketiedettä. Sama ilmiö voi vaikuttaa mihin tahansa sovellukseen, jossa tekoälyn oletetaan analysoivan kuvia: autonomiseen ajamiseen, teollisuuden laadunvalvontaan tai turvallisuuskameroihin. Jos malli tuottaa uskottavan kuvauksen olemattomasta röntgenkuvasta, mikään ei takaa, ettei se tee samaa liikennekameran kuvalle tai satelliittikuvalle. Nykyiset testausmenetelmät eivät paljasta ongelmaa, ja tutkijoiden mukaan B-Clean tai vastaava viitekehys on välttämätön kaikille aloille, joilla kuvien analysointi on turvallisuuskriittistä.

Sanasto

Multimodaalinen malli
Tekoälymalli joka osaa käsitellä useita tiedon muotoja – esimerkiksi tekstiä, kuvia ja ääntä – pelkän tekstin sijaan. GPT-5 ja Gemini ovat tunnettuja esimerkkejä.

Mitä seurata

MIRAGE-tutkimuksen B-Clean-viitekehys on julkaistu avoimesti. Seuraava keskeinen kysymys on, ottavatko mallinvalmistajat sen tai vastaavan menetelmän osaksi testausprosessiaan. Fei-Fei Lin ryhmä Stanfordissa jatkaa tutkimusta multimodaalisten mallien visuaalisen päättelyn mekanismeista, ja lisätutkimuksia on odotettavissa lähikuukausina. Myös lääketieteellisen tekoälyn sääntelyyn erikoistuneet viranomaiset joutuvat arvioimaan, riittävätkö nykyiset hyväksymismenettelyt tunnistamaan kangastuspäättelyn kaltaisia ongelmia.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.