Testi, jossa tekoäly ei pärjää
ARC Prize Foundation julkaisi tiistaina uuden ARC-AGI-3-testin, joka mittaa tekoälyn kykyä toimia tuntemattomissa ympäristöissä ilman minkäänlaisia ohjeita. Tulos on tyly: ihmiskoehenkilöt ratkaisivat kaikki 135 testiympäristöä, kun taas paras tekoälymalli – Googlen Gemini 3.1 Pro – ylsi vain 0,37 prosentin tulokseen.
Muut suuret mallit pärjäsivät vielä heikommin. OpenAI:n GPT 5.4 sai 0,26 prosenttia, Anthropicin Opus 4.6 pääsi 0,25 prosenttiin ja xAI:n Grok-4.20 jäi pyöreään nollaan. Ihmiset, joille testit olivat täysin uusia, ratkaisivat ne keskimäärin 7,4 minuutissa.
Pelimäiset ympäristöt ilman sääntökirjaa
ARC-AGI-3 eroaa edeltäjistään radikaalisti. Aiemmat versiot perustuivat staattisiin ruudukkotehtäviin, joissa piti tunnistaa kuvioita ja täydentää puuttuvia osia. Kolmas versio siirtää testin kokonaan interaktiivisiin, vuoropohjaisiin ympäristöihin.
Käytännössä kyse on sadoista pelisuunnittelijoiden käsin rakentamista ympäristöistä ja tuhansista tasoista 64×64-väriruudukoilla. Tekoälyagentti ei saa mitään ohjeita tavoitteista, säännöistä tai mekaniikasta. Sen pitää itse selvittää, mitä ympäristössä tapahtuu, päätellä tavoitteet ja kehittää strategia niiden saavuttamiseksi. Testi arvioi neljää kyvykkyyttä: tutkimista, ympäristön mallintamista, tavoitteen päättelyä ja strategista suunnittelua.
Pisteytys perustuu RHAE-mittariin (Relative Human Action Efficiency), joka vertaa tekoälyn tarvitsemien toimintojen määrää ihmisen suoritukseen. Kaava on neliöllinen: jos tekoäly tarvitsee kymmenen kertaa enemmän siirtoja kuin ihminen, se saa vain yhden prosentin kyseisen tason pisteistä. Myöhemmät tasot painottuvat enemmän, koska ne ovat monimutkaisempia. Raa'alla kokeilulla ei siis pärjää.
Viidessä vuodessa ratkaisusta takaisin nollaan
ARC-testisarjan historia kertoo tekoälyn kehityksestä paljon. Vuonna 2019 julkaistu ARC-AGI-1 kesti viisi vuotta ennen kuin tekoälymallit alkoivat ratkaista sitä kunnolla. Nyt Gemini 3.1 Pro yltää siinä 98 prosenttiin – testi on käytännössä ratkaistu.
Maaliskuussa 2025 julkaistu ARC-AGI-2 oli selvästi vaikeampi. Puhtaat kielimallit saivat siinä nolla prosenttia, mutta päättelymallit ja räätälöidyt ratkaisut nostivat pisteitä nopeasti. Vuoden 2025 Kaggle-kilpailun paras tulos oli 24 prosenttia, ja Gemini 3 Deep Think pääsi jo 84,6 prosenttiin.
ARC-AGI-3 nollasi tilanteen. Duken yliopiston tutkijat havaitsivat kuvaavan esimerkin: Opus 4.6 saavutti 97,1 prosentin tuloksen tutussa ympäristössä räätälöidyllä ohjauslogiikalla, mutta kun sama malli kohtasi tuntemattoman ympäristön, tulos putosi nollaan. Opittu ei siirtynyt uuteen tilanteeseen.
AGI-lupausten todellisuustarkistus
Tulos asettaa tekoälyalan lupaukset kiusalliseen valoon. Suuret teknologiayhtiöt puhuvat yleisen tekoälyn saavuttamisesta lähivuosina, mutta ARC-AGI-3 osoittaa, etteivät nykyjärjestelmät kykene edes perustutkimiseen tuntemattomissa ympäristöissä.
François Chollet, ARC-testin luoja, tiivistää ongelman: "G kirjaimessa AGI tarkoittaa 'yleistä'. Aidosti yleinen tekoäly ei tarvitsisi tehtäväkohtaista ihmisen ohjausta, kun tavalliset ihmiset selviävät samoista tehtävistä itsenäisesti."
Käytännön merkitys on selvä. Yrityksissä tekoälyagentteja aletaan käyttää yhä itsenäisempiin tehtäviin, mutta ARC-AGI-3 paljastaa perustavanlaatuisen rajoitteen: nykymallien itsenäisyys on lähinnä kykyä seurata valmiita ohjeita tehokkaasti. Kun tehtävä poikkeaa opitusta kaavasta, järjestelmä ei osaa mukautua. Kuka tahansa, joka suunnittelee liiketoimintaa tekoälyagenttien varaan, tekee viisaasti pitäessään ihmisen lähellä päätöksiä.
Tekoäly on toki hyödyllistä monessa tehtävässä – koodaamisessa, tekstin tuottamisessa ja datan analysoinnissa mallit ovat jo vakuuttavia. ARC-AGI-3 ei kumoa näitä saavutuksia, mutta se osoittaa, että nykyjärjestelmien ja ihmisen sopeutumiskyvyn välinen kuilu on valtava.
Kokeile itse
25 ARC-AGI-3-ympäristöä on vapaasti testattavissa ARC Prizen sivuilla (arcprize.org/arc-agi/3). Voit verrata omaa suoritustasi tekoälymallien tuloksiin. Kaggle-kilpailuun voi osallistua marraskuuhun asti, ja palkintosumma on kaksi miljoonaa dollaria.



