Kuvittele lääkäri, joka kirjoittaa tarkan röntgenlausunnon katsomatta yhtään kuvaa. Stanfordin yliopiston tutkijaryhmä osoitti maaliskuussa julkaistussa MIRAGE-tutkimuksessa, että nykyiset multimodaaliset tekoälymallit tekevät juuri niin. Tutkijat poistivat kuvat kokonaan kuuden yleisen ja lääketieteellisen vertailutestin tehtävistä ilman, että mallien kehotteita muutettiin millään tavalla. GPT-5, Gemini 3 Pro ja Claude Opus 4.5 säilyttivät silti 70–80 prosenttia alkuperäisestä tarkkuudestaan ja tuottivat yksityiskohtaisia kuvauksia kuvista, joita niille ei koskaan näytetty.
Fei-Fei Lin johtama tutkijaryhmä kutsuu ilmiötä kangastuspäättelyksi (mirage reasoning). Se eroaa tavanomaisista hallusinaatioista olennaisella tavalla: malli ei keksi yksittäistä faktaa vaan rakentaa kokonaisen kuvitellun kehyksen, jossa se käyttäytyy kuin visuaalinen syöte olisi todella olemassa. Kaikki päättely perustuu tähän olemattomaan pohjaan, ja lopputulos muistuttaa aitoa analyysiä niin tarkasti, että ulkopuolinen arvioija ei välttämättä huomaa eroa.
Ero paljastui koeasetelmassa. Kun mallille kerrottiin suoraan, ettei kuvaa ole, ja pyydettiin arvaamaan, tarkkuus laski selvästi. Kangastustilassa, jossa kuvan puuttumisesta ei mainittu mitään, mallit tuottivat itsevarmoja ja yksityiskohtaisia vastauksia. Tutkijat huomauttavat, että mallit toimivat kahdessa eri päättelytilassa sen mukaan, uskovatko ne saaneensa kuvan vai eivät.
Näkymätön röntgenkuva, tarkka diagnoosi
Tutkimuksen lääketieteelliset havainnot ovat hälyttäviä. Kangastustilassa Gemini 3 Pro tuotti diagnooseja, joissa vakavat löydökset hallitsivat: sydäninfarkteja, melanoomia ja karsinoomia esiintyi suhteettoman paljon verrattuna normaalilöydöksiin. Malli ei ainoastaan keksinyt nähneensä kuvan, vaan löysi siitä järjestelmällisesti sairauksia. Terveydenhuollon sovelluksissa tällainen vinoutuma voisi johtaa turhiin jatkotutkimuksiin ja vääriin diagnooseihin.
Ryhmä teki myös provosoivan kokeen. He kouluttivat pienen, kolmen miljardin parametrin tekstimallin, jolla ei ole lainkaan kuvankäsittelykykyä, vastaamaan rintakehän röntgenkuviin liittyviin kysymyksiin pelkän kysymystekstin perusteella. Tämä superpäättelijä päihitti kaikki testatut multimodaaliset mallit ja ylitti ihmisradiologien tarkkuuden yli kymmenellä prosenttiyksiköllä ReXVQA-testissä. Tulos viittaa siihen, etteivät nykyiset vertailutestit mittaa visuaalista ymmärrystä, vaan mallien kykyä päätellä todennäköinen vastaus kysymystekstin kielellisistä vihjeistä.
“Mallit eivät ainoastaan vastanneet kilpailukykyisesti, vaan ylittivät ihmisradiologien suorituksen ilman minkäänlaista visuaalista syötettä.”
Kolme neljästä testikysymyksestä karsiutui
Malleja testattiin kuudella vertailutestillä. Yleisistä visuaalisista testeistä mukana olivat MMMU-Pro ja Video-MMMU, lääketieteellisistä VQA-Rad, MicroVQA ja MedXpertQA-MM. Tutkijat loivat myös Phantom-0-testin, joka sisälsi 200 visuaalista kysymystä 20 kategoriasta ilman yhtään kuvaa. Lääketieteellisissä testeissä mallit saavuttivat jopa 99 prosenttia kuvallisesta tarkkuudestaan pelkän tekstin perusteella.
Tutkijat kehittivät ongelmaan ratkaisun nimeltä B-Clean. Viitekehys karsii vertailutestistä kaikki kysymykset, joihin mikä tahansa testattu malli vastasi oikein ilman kuvaa. Jäljelle jäävät vain sellaiset tehtävät, jotka todella vaativat visuaalista ymmärrystä. Puhdistuksen tulokset olivat rajuja: 74–77 prosenttia kaikista kysymyksistä karsiutui. GPT-5.1:n tarkkuus MicroVQA-testissä putosi 61,5 prosentista 15,4 prosenttiin, ja mallien keskinäinen paremmuusjärjestys muuttui merkittävästi.
Kangastuspäättely ei koske pelkästään lääketiedettä. Sama ilmiö voi vaikuttaa mihin tahansa sovellukseen, jossa tekoälyn oletetaan analysoivan kuvia: autonomiseen ajamiseen, teollisuuden laadunvalvontaan tai turvallisuuskameroihin. Jos malli tuottaa uskottavan kuvauksen olemattomasta röntgenkuvasta, mikään ei takaa, ettei se tee samaa liikennekameran kuvalle tai satelliittikuvalle. Nykyiset testausmenetelmät eivät paljasta ongelmaa, ja tutkijoiden mukaan B-Clean tai vastaava viitekehys on välttämätön kaikille aloille, joilla kuvien analysointi on turvallisuuskriittistä.



