Tekoäly

Tekoälyt ajoivat Corollaa kartioradalla – vain yksi pääsi maaliin

Kielimallit ohjasivat oikeaa autoa, ja useimmat eksyivät jo ensimmäisessä mutkassa

Aino AikajärviAino Aikajärvi
Jaa:
Tekoälyt ajoivat Corollaa kartioradalla – vain yksi pääsi maaliin
Kuva: オーバードライブ83 / CC BY-SA 4.0

Parkkipaikalla San Franciscon lahden alueella seisoo vuoden 2022 Toyota Corolla. Kuljettajan paikalla istuu ihminen jalka jarrupolkimen yllä, mutta rattia hän ei käännä. Sen tekee kielimalli, joka katsoo auton kameroiden kuvaa ja lähettää komentoja muutaman sekunnin välein.

Tehtävä kuulostaa helpolta: aja noin 130 metrin mittainen, pienillä värikkäillä kartioilla merkitty rata sinisellä merkittyyn maalialueeseen. Nopeus on rajattu kävelyvauhtiin. Neljästä testatusta mallista vain yksi onnistui.

Kyse on DrivingBench-nimisestä riippumattomasta testistä, jonka ovat tehneet Aditya Ramabadran, Simon Mahns ja Tobias Gessler. Kärkeen nousi OpenAI:n GPT-6 Astra, joka ajoi radan läpi toisella yrityksellään ajassa 5 minuuttia 22 sekuntia.

Kolme yritystä, yksi maali

Jokainen malli sai radalle enintään kolme yritystä saman keskustelun aikana, joten se pystyi oppimaan edellisistä virheistään. Tulos kertoo, kuinka suuren osan radasta auto ehti ajaa ennen kuin se ajautui ulos rajoilta.

GPT-6 Astra pääsi ensimmäisellä kerralla 49 prosenttiin ja toisella maaliin. Anthropicin Claude Fable 5.1 ajoi ensin 9 ja sitten 10 prosenttia, ja kolmannella yrityksellä se ylsi 45 prosenttiin. xAI:n Grok 4.6 jäi kaikilla kerroilla 8–11 prosenttiin. OpenAI:n GPT-5.6 Sol pysähtyi kolmesti samaan kohtaan, 6 prosentin kohdalle.

Raportin mukaan kaikki yritykset Astran onnistunutta ajoa lukuun ottamatta kaatuivat ensimmäiseen mutkaan tai jo ennen sitä. Astran ensimmäinen yritys ja Fablen kolmas ehtivät suunnilleen radan puoliväliin.

Väärä puoli kartiorivistä

Yleisin virhe ei ollut ohjaustekninen. Mallit tulkitsivat väärin, kummalla puolella kartioita ajoväylä kulkee. Testissä mallit kirjoittivat jokaisen yrityksen jälkeen oman arvionsa siitä, mikä meni pieleen, ja nämä pohdinnat ovat raportin paljastavinta antia.

Claude Fable 5.1 totesi toisen yrityksensä jälkeen englanniksi: ”I picked the wrong side of the boundary again.” Suomeksi: ”Valitsin taas rajan väärän puolen.” GPT-5.6 Sol päätyi samaan: ”The decisive error was assuming that cone color identified boundary side”, eli ratkaiseva virhe oli olettaa, että kartion väri kertoo, kummalla puolella raja on.

Grok 4.6 huomasi ensimmäisen yrityksensä jälkeen, että ”auto on leveämpi kuin kamera antaa ymmärtää” (alkuperäinen: ”The car is wider than the camera makes it look”). Kameran kuvasta ei myöskään näe aivan auton vierelle, joten kartio voi kadota näkyvistä juuri silloin, kun se on lähimpänä.

Muitakin ongelmia oli. Mallit käänsivät rattia liian varovasti tiukkoihin mutkiin, eivätkä ne ehtineet antaa uutta komentoa ennen kuin edellinen oli jo päättynyt. Openpilot-ohjelmisto myös kiihdytti lähdössä yli pyydetyn: kun malli pyysi 0,8–1,5 metriä sekunnissa, auto liikkui hetken 1,6–2,4 metrin sekuntinopeudella.

“I declared the car aligned too early.”

— GPT-6 Astra, kielimallin oma arvio ensimmäisen epäonnistuneen yrityksensä jälkeen (suomeksi: ”Julistin auton suoristuneeksi liian aikaisin.”)

Miten maaliin sitten päästiin

Astran onnistuminen syntyi siitä, että se muutti tapaansa ajaa. Ensimmäisen yrityksen jälkeen se kirjasi aikovansa ajaa saarekkeiden ja mutkien kohdalla lyhyempiä pätkiä noin 0,5–0,8 metrin sekuntinopeudella. Toisella kerralla se ei ylittänyt tätä vauhtia kertaakaan ja käänsi ratin ääriasentoon 20 komennossa 24:stä.

Fable oppi myös. Kolmas yritys alkoi toteamuksella ”tällä kertaa pidän vinon kartiorivin vasemmalla puolellani”, ja malli laski vähitellen ohjauskulmiaan 60–100 prosentista noin 30 prosenttiin. Se riitti puoliväliin.

Näin testi oli rakennettu

Autossa oli comma.ai:n Comma Four -laite, joka on kytketty auton CAN-väylään. Kielimalli ohjasi autoa kolmen työkalun kautta: se pystyi katsomaan kameroiden kuvaa ja auton tilaa, antamaan ajokomennon suunnalla, ohjauskulmalla, nopeudella ja kestolla, tai pysäyttämään auton heti. Nopeus oli rajattu useassa ohjelmistokerroksessa 0,5–3,5 metriin sekunnissa eli enintään noin 13 kilometriin tunnissa.

Astra ja Sol ajoivat Codexin kautta, Fable Claude Coden kautta ja Grok Cursorin kautta, kaikki keskitason päättelyasetuksella.

Sanasto

CAN-väylä
Auton sisäinen tietoverkko, jonka kautta ohjainlaitteet, kuten ohjaus, jarrut ja moottori, välittävät viestejä toisilleen. Siihen kytketty laite voi lukea auton tietoja ja antaa sille komentoja.
Openpilot
Comma.ai:n avoimen lähdekoodin kuljettajaa avustava ohjelmisto, joka pystyy ohjaamaan tuettujen automallien rattia, kaasua ja jarrua. Testissä se toteutti kielimallin antamat ajokomennot.
Päättelyasetus
Säätö, jolla määrätään, kuinka paljon aikaa ja laskentaa kielimalli käyttää pohtimiseen ennen vastaamista. Korkeampi asetus tuottaa yleensä huolellisempia mutta hitaampia vastauksia.

Tämä ei ole testi robottiautoista

Tuloksista on helppo vetää liian suuria johtopäätöksiä. Waymon kaltaiset robottitaksit eivät ohjaa autoa yleiskäyttöisellä kielimallilla, joka katsoo muutaman kameran kuvaa ja kirjoittaa komennon kerrallaan. Niiden taustalla on juuri ajamiseen koulutettuja järjestelmiä, tutkia, laserkeilaimia ja valtava määrä ajodataa.

DrivingBench mittaa muuta: kuinka hyvin keskusteluun tehty malli selviää fyysisessä maailmassa, kun sen tulkinnoilla on seurauksia. Juuri tätä monet tekoäly-yhtiöt nyt myyvät, kun ne puhuvat agenteista, jotka hoitavat tehtäviä itsenäisesti.

Tulos on tuttu myös toimistosta. Malli voi kuvata tilanteen sujuvasti ja tehdä silti perustavan tulkintavirheen, jonka ihminen näkisi heti. AI Suomi kertoi aiemmin, miten tekoäly pankkineuvojana sai 37 pistettä sadasta. Parkkipaikalla virhe näkyy kaatuneena kartiona. Pankkineuvonnassa tai yrityksen asiakaspalvelussa se ei näy yhtä helposti, ja siksi agentteja käyttöön ottavan yrityksen kannattaa miettiä, kuka tarkistaa tulkinnat.

Turvallisuudesta raportti on selvä. Autossa istui koko ajan ihminen, joka tekijöiden mukaan oli jalka jarrun yllä valmiina jarruttamaan, jos auto ajautuu rajojen ulkopuolelle (alkuperäinen: ”ready to brake whenever the car either goes out of bounds”). Openpilotin kuljettajavalvonta oli päällä, eikä turvaominaisuuksia kytketty pois. Raportti ei erittele, kuinka usein kuljettaja joutui käytännössä puuttumaan ajoon.

Kiinnostavin luku ei ehkä ole Astran 5.22 vaan Solin kolmesti toistunut 6 prosenttia. Sama malli teki saman virheen kolme kertaa, vaikka se sai joka kerta kirjoittaa itselleen, mikä meni vikaan. Keskustelun sisällä oppiminen toimi kahdella mallilla neljästä, ja se on mittari, jota kannattaa katsoa, kun seuraavat versiot tulevat radalle.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  2. 220 vuotta koodaamatta, sitten 5,4 miljoonaa
  3. 3Uusi Siri saapui – mutta ei suomeksi eikä iPhoneen
  4. 4Google kaatoi 300 hehtaaria metsää – virasto selvittää
  5. 5Datakeskus söisi Lapinlahdella kokonaisen kaupungin sähköt

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.