Googlen DeepMind on kehittänyt tekoälyjärjestelmän, joka suunnittelee peliteoria-algoritmeja paremmin kuin alan huippuasiantuntijat. AlphaEvolve-niminen järjestelmä yhdistää kielimallin koodinkirjoituskyvyn evoluutio-algoritmin järjestelmälliseen hakuprosessiin ja tuottaa ratkaisuja, jollaisia ihmistutkijat eivät ole löytäneet. Tutkijat Zun Li, John Schultz, Daniel Hennes ja Marc Lanctot julkaisivat tulokset helmikuussa 2026.
Keskeisin saavutus on VAD-CFR-niminen algoritmi, joka päihitti ihmisten käsin suunnittelemat ratkaisut kymmenessä peliteoreettisessa testiympäristössä yhdestätoista. Ainoastaan neljän pelaajan Kuhn-pokerissa se jäi toiseksi. Peliteorian algoritmeja ovat tähän asti kehittäneet lähes yksinomaan matemaatikot ja tietojenkäsittelytieteilijät, joten tulos haastaa perinteisen käsityksen siitä, kuka tai mikä voi tehdä tieteellistä löytötyötä.
Kielimalli ja evoluutio yhteistyössä
AlphaEvolve eroaa perinteisestä koneoppimisesta olennaisella tavalla. Sen sijaan, että järjestelmä optimoisi numeerisia parametreja, se kirjoittaa ja muokkaa algoritmien lähdekoodia. Googlen Gemini 2.5 Pro -kielimalli tuottaa koodi-ehdotuksia, ja evoluutio-algoritmi testaa niiden toimivuuden peliympäristöissä automaattisesti.
Prosessi muistuttaa luonnonvalintaa. Jokainen sukupolvi tuottaa joukon algoritmi-ehdokkaita, jotka kilpailevat keskenään ennalta määritellyissä peliympäristöissä. Parhaiten suoriutuneet jatkavat seuraavalle kierrokselle, ja kielimalli käyttää niitä pohjana uusille muunnelmille. Kierros kierrokselta algoritmit kehittyvät tehokkaammiksi ilman, että ihminen ohjaa prosessia tai valitsee suuntaa.
Ratkaiseva ero perinteisiin lähestymistapoihin on se, että kielimalli ei vain säädä lukuarvoja vaan voi muuttaa algoritmin rakennetta kokonaan. Se lisää uusia ehtolauseita, poistaa tarpeettomia vaiheita ja yhdistelee mekanismeja tavoilla, joita ohjelmoija ei välttämättä kokeilisi.
Algoritmi jota kukaan ei suunnitellut
VAD-CFR perustuu CFR-algoritmiin (Counterfactual Regret Minimization), joka on peliteorian perustyökalu epätäydellisen informaation peleissä. CFR vähentää asteittain huonojen päätösten aiheuttamaa katumusta ja lähestyy optimaalista strategiaa. Pokerin kaltaisissa peleissä se on ollut alan standardi jo vuosia.
AlphaEvolve paransi CFR:ää kolmella tavalla, joita ihmistutkijat eivät olleet keksineet. Ensimmäinen on volatiliteettiin sopeutuva muisti: algoritmi seuraa katumussignaalien vaihteluvoimakkuutta reaaliajassa ja päättää sen perusteella, kuinka nopeasti vanha historia unohdetaan. Epävakaina jaksoina se reagoi tuoreempaan tietoon, vakaampina säilyttää pidemmän historian.
Toinen mekanismi on niin sanottu kova lämmitin, joka viivästyttää strategian keskiarvoistamista 500 iteraation verran. Kolmas on positiivisten katumussignaalien vahvistaminen kertoimella 1,1, mikä ohjaa algoritmia tutkimaan lupaavia suuntia tehokkaammin. Mikään näistä ratkaisuista ei ole intuitiivinen, eikä ihmistutkija olisi todennäköisesti päätynyt kokeilemaan juuri tätä yhdistelmää.
Testaus tehtiin Googlen OpenSpiel-peliteoriakehyksessä. VAD-CFR:ää koulutettiin pienemmillä peleillä, kuten Kuhn-pokerilla ja Liar's Dice:llä, mutta se yleistyi menestyksekkäästi myös suurempiin pelivariantteihin. Yleistymiskyky on tärkeä, sillä peliteorian käytännön sovelluksissa peliympäristöt ovat harvoin yksinkertaisia.
Tekoäly löysi jotain, mitä se ei voinut tietää
AlphaEvolve valitsi 500 iteraation kynnyksen itsenäisesti, vaikka se ei tiennyt arvioinnin tapahtuvan 1 000 iteraation kohdalla. Järjestelmä löysi algoritmisen rakenteen, jota sen suunnittelijat eivät osanneet etsiä.



