Tutkimus

Ihminen 100, tekoäly 0: uusi testi nollasi kaikki mallit

ARC-AGI-3 mittaa kykyä oppia lennossa – paras malli pääsi 0,37 prosenttiin

Hanna HuulivuoHanna Huulivuo
Jaa:
Ihminen 100, tekoäly 0: uusi testi nollasi kaikki mallit

Testi, jossa tekoäly ei pärjää

ARC Prize Foundation julkaisi tiistaina uuden ARC-AGI-3-testin, joka mittaa tekoälyn kykyä toimia tuntemattomissa ympäristöissä ilman minkäänlaisia ohjeita. Tulos on tyly: ihmiskoehenkilöt ratkaisivat kaikki 135 testiympäristöä, kun taas paras tekoälymalli – Googlen Gemini 3.1 Pro – ylsi vain 0,37 prosentin tulokseen.

Muut suuret mallit pärjäsivät vielä heikommin. OpenAI:n GPT 5.4 sai 0,26 prosenttia, Anthropicin Opus 4.6 pääsi 0,25 prosenttiin ja xAI:n Grok-4.20 jäi pyöreään nollaan. Ihmiset, joille testit olivat täysin uusia, ratkaisivat ne keskimäärin 7,4 minuutissa.

Pelimäiset ympäristöt ilman sääntökirjaa

ARC-AGI-3 eroaa edeltäjistään radikaalisti. Aiemmat versiot perustuivat staattisiin ruudukkotehtäviin, joissa piti tunnistaa kuvioita ja täydentää puuttuvia osia. Kolmas versio siirtää testin kokonaan interaktiivisiin, vuoropohjaisiin ympäristöihin.

Käytännössä kyse on sadoista pelisuunnittelijoiden käsin rakentamista ympäristöistä ja tuhansista tasoista 64×64-väriruudukoilla. Tekoälyagentti ei saa mitään ohjeita tavoitteista, säännöistä tai mekaniikasta. Sen pitää itse selvittää, mitä ympäristössä tapahtuu, päätellä tavoitteet ja kehittää strategia niiden saavuttamiseksi. Testi arvioi neljää kyvykkyyttä: tutkimista, ympäristön mallintamista, tavoitteen päättelyä ja strategista suunnittelua.

Pisteytys perustuu RHAE-mittariin (Relative Human Action Efficiency), joka vertaa tekoälyn tarvitsemien toimintojen määrää ihmisen suoritukseen. Kaava on neliöllinen: jos tekoäly tarvitsee kymmenen kertaa enemmän siirtoja kuin ihminen, se saa vain yhden prosentin kyseisen tason pisteistä. Myöhemmät tasot painottuvat enemmän, koska ne ovat monimutkaisempia. Raa'alla kokeilulla ei siis pärjää.

Viidessä vuodessa ratkaisusta takaisin nollaan

ARC-testisarjan historia kertoo tekoälyn kehityksestä paljon. Vuonna 2019 julkaistu ARC-AGI-1 kesti viisi vuotta ennen kuin tekoälymallit alkoivat ratkaista sitä kunnolla. Nyt Gemini 3.1 Pro yltää siinä 98 prosenttiin – testi on käytännössä ratkaistu.

Maaliskuussa 2025 julkaistu ARC-AGI-2 oli selvästi vaikeampi. Puhtaat kielimallit saivat siinä nolla prosenttia, mutta päättelymallit ja räätälöidyt ratkaisut nostivat pisteitä nopeasti. Vuoden 2025 Kaggle-kilpailun paras tulos oli 24 prosenttia, ja Gemini 3 Deep Think pääsi jo 84,6 prosenttiin.

ARC-AGI-3 nollasi tilanteen. Duken yliopiston tutkijat havaitsivat kuvaavan esimerkin: Opus 4.6 saavutti 97,1 prosentin tuloksen tutussa ympäristössä räätälöidyllä ohjauslogiikalla, mutta kun sama malli kohtasi tuntemattoman ympäristön, tulos putosi nollaan. Opittu ei siirtynyt uuteen tilanteeseen.

AGI-lupausten todellisuustarkistus

Tulos asettaa tekoälyalan lupaukset kiusalliseen valoon. Suuret teknologiayhtiöt puhuvat yleisen tekoälyn saavuttamisesta lähivuosina, mutta ARC-AGI-3 osoittaa, etteivät nykyjärjestelmät kykene edes perustutkimiseen tuntemattomissa ympäristöissä.

François Chollet, ARC-testin luoja, tiivistää ongelman: "G kirjaimessa AGI tarkoittaa 'yleistä'. Aidosti yleinen tekoäly ei tarvitsisi tehtäväkohtaista ihmisen ohjausta, kun tavalliset ihmiset selviävät samoista tehtävistä itsenäisesti."

Käytännön merkitys on selvä. Yrityksissä tekoälyagentteja aletaan käyttää yhä itsenäisempiin tehtäviin, mutta ARC-AGI-3 paljastaa perustavanlaatuisen rajoitteen: nykymallien itsenäisyys on lähinnä kykyä seurata valmiita ohjeita tehokkaasti. Kun tehtävä poikkeaa opitusta kaavasta, järjestelmä ei osaa mukautua. Kuka tahansa, joka suunnittelee liiketoimintaa tekoälyagenttien varaan, tekee viisaasti pitäessään ihmisen lähellä päätöksiä.

Tekoäly on toki hyödyllistä monessa tehtävässä – koodaamisessa, tekstin tuottamisessa ja datan analysoinnissa mallit ovat jo vakuuttavia. ARC-AGI-3 ei kumoa näitä saavutuksia, mutta se osoittaa, että nykyjärjestelmien ja ihmisen sopeutumiskyvyn välinen kuilu on valtava.

Kokeile itse

25 ARC-AGI-3-ympäristöä on vapaasti testattavissa ARC Prizen sivuilla (arcprize.org/arc-agi/3). Voit verrata omaa suoritustasi tekoälymallien tuloksiin. Kaggle-kilpailuun voi osallistua marraskuuhun asti, ja palkintosumma on kaksi miljoonaa dollaria.

100 %↑

Ihmisten tulos

0,37 %↓

Paras tekoälymalli

135

Testiympäristöä

2 milj. $

Kilpailun palkintosumma

ARC Prize Foundation, 2026

Sanasto

AGI (Artificial General Intelligence)
Yleinen tekoäly – hypoteettinen järjestelmä joka pystyisi suoriutumaan mistä tahansa älyllisestä tehtävästä ihmisen tasoisesti ilman tehtäväkohtaista ohjelmointia. Nykyiset tekoälymallit ovat erikoistuneita eivätkä täytä tätä määritelmää.
Päättelymalli
Kielimalli joka on koulutettu ratkaisemaan ongelmia vaihe vaiheelta, ei vain tuottamaan todennäköisintä seuraavaa sanaa. Esimerkiksi Googlen Gemini Deep Think kuuluu tähän kategoriaan.

Avoin lähdekoodi pakollista

ARC Prize 2026 jakaa yli kaksi miljoonaa dollaria palkintoina kolmessa sarjassa. Välitarkistukset ovat kesä- ja syyskuussa, lopulliset tulokset julkistetaan joulukuussa.

Kilpailun säännöt pakottavat avoimuuteen. Ratkaisut pitää julkaista avoimena lähdekoodina ennen virallista arviointia, eikä Kaggle-ympäristössä ole internet-yhteyttä. Ulkoisten mallien API-kutsut eivät toimi, joten osallistujien on kehitettävä aidosti uusia ratkaisutapoja.

Aiemmat ARC-kilpailut ovat tuottaneet aitoja läpimurtoja päättelymallien kehityksessä. Jos joku onnistuu rakentamaan järjestelmän, joka oppii lennossa uusissa ympäristöissä ilman räätälöityä ohjausta, se olisi merkittävä askel kohti yleistä tekoälyä. Toistaiseksi sellaista ratkaisua ei ole – ja juuri siksi kilpailu on kiinnostava.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.