Parkkipaikalla San Franciscon lahden alueella seisoo vuoden 2022 Toyota Corolla. Kuljettajan paikalla istuu ihminen jalka jarrupolkimen yllä, mutta rattia hän ei käännä. Sen tekee kielimalli, joka katsoo auton kameroiden kuvaa ja lähettää komentoja muutaman sekunnin välein.
Tehtävä kuulostaa helpolta: aja noin 130 metrin mittainen, pienillä värikkäillä kartioilla merkitty rata sinisellä merkittyyn maalialueeseen. Nopeus on rajattu kävelyvauhtiin. Neljästä testatusta mallista vain yksi onnistui.
Kyse on DrivingBench-nimisestä riippumattomasta testistä, jonka ovat tehneet Aditya Ramabadran, Simon Mahns ja Tobias Gessler. Kärkeen nousi OpenAI:n GPT-6 Astra, joka ajoi radan läpi toisella yrityksellään ajassa 5 minuuttia 22 sekuntia.
Kolme yritystä, yksi maali
Jokainen malli sai radalle enintään kolme yritystä saman keskustelun aikana, joten se pystyi oppimaan edellisistä virheistään. Tulos kertoo, kuinka suuren osan radasta auto ehti ajaa ennen kuin se ajautui ulos rajoilta.
GPT-6 Astra pääsi ensimmäisellä kerralla 49 prosenttiin ja toisella maaliin. Anthropicin Claude Fable 5.1 ajoi ensin 9 ja sitten 10 prosenttia, ja kolmannella yrityksellä se ylsi 45 prosenttiin. xAI:n Grok 4.6 jäi kaikilla kerroilla 8–11 prosenttiin. OpenAI:n GPT-5.6 Sol pysähtyi kolmesti samaan kohtaan, 6 prosentin kohdalle.
Raportin mukaan kaikki yritykset Astran onnistunutta ajoa lukuun ottamatta kaatuivat ensimmäiseen mutkaan tai jo ennen sitä. Astran ensimmäinen yritys ja Fablen kolmas ehtivät suunnilleen radan puoliväliin.
Väärä puoli kartiorivistä
Yleisin virhe ei ollut ohjaustekninen. Mallit tulkitsivat väärin, kummalla puolella kartioita ajoväylä kulkee. Testissä mallit kirjoittivat jokaisen yrityksen jälkeen oman arvionsa siitä, mikä meni pieleen, ja nämä pohdinnat ovat raportin paljastavinta antia.
Claude Fable 5.1 totesi toisen yrityksensä jälkeen englanniksi: ”I picked the wrong side of the boundary again.” Suomeksi: ”Valitsin taas rajan väärän puolen.” GPT-5.6 Sol päätyi samaan: ”The decisive error was assuming that cone color identified boundary side”, eli ratkaiseva virhe oli olettaa, että kartion väri kertoo, kummalla puolella raja on.
Grok 4.6 huomasi ensimmäisen yrityksensä jälkeen, että ”auto on leveämpi kuin kamera antaa ymmärtää” (alkuperäinen: ”The car is wider than the camera makes it look”). Kameran kuvasta ei myöskään näe aivan auton vierelle, joten kartio voi kadota näkyvistä juuri silloin, kun se on lähimpänä.
Muitakin ongelmia oli. Mallit käänsivät rattia liian varovasti tiukkoihin mutkiin, eivätkä ne ehtineet antaa uutta komentoa ennen kuin edellinen oli jo päättynyt. Openpilot-ohjelmisto myös kiihdytti lähdössä yli pyydetyn: kun malli pyysi 0,8–1,5 metriä sekunnissa, auto liikkui hetken 1,6–2,4 metrin sekuntinopeudella.
“I declared the car aligned too early.”
Miten maaliin sitten päästiin
Astran onnistuminen syntyi siitä, että se muutti tapaansa ajaa. Ensimmäisen yrityksen jälkeen se kirjasi aikovansa ajaa saarekkeiden ja mutkien kohdalla lyhyempiä pätkiä noin 0,5–0,8 metrin sekuntinopeudella. Toisella kerralla se ei ylittänyt tätä vauhtia kertaakaan ja käänsi ratin ääriasentoon 20 komennossa 24:stä.
Fable oppi myös. Kolmas yritys alkoi toteamuksella ”tällä kertaa pidän vinon kartiorivin vasemmalla puolellani”, ja malli laski vähitellen ohjauskulmiaan 60–100 prosentista noin 30 prosenttiin. Se riitti puoliväliin.



