Tutkimus

Berkeleyn keksintö kolminkertaisti tekoälyn älykkyyden

Yksi rajapinta optimoi promptit, koodin ja agentit – ja päihitti Googlen AlphaEvolven

Hanna HuulivuoHanna Huulivuo
Jaa:
Berkeleyn keksintö kolminkertaisti tekoälyn älykkyyden

Tekstiä sisään, optimoitua ulos

UC Berkeleyn tutkijat julkaisivat 18. helmikuuta optimize_anything-rajapinnan, joka tekee yksinkertaisen lupauksen: anna sille mikä tahansa tekstimuotoinen artefakti ja mittari, niin se optimoi sen puolestasi. Promptit, koodialgoritmit, tekoälyagenttien arkkitehtuurit, pilvikonfiguraatiot – kaikki käy, kunhan tulos on mitattavissa.

Rajapinta on osa GEPA-kehystä (Genetic-Pareto), joka yhdistää geneettisen evoluution ja kielimallipohjaisen reflektion. Tutkimus hyväksyttiin ICLR 2026 -konferenssiin suullisena esitelmänä. Suullisen esityksen sai vain 1,2 prosenttia lähes 19 000 lähetetystä paperista, joten kyseessä on vertaisarvioijien vahva tunnustus.

Käytännössä kehittäjä kirjoittaa muutaman rivin Python-koodia: antaa alkukandidaatin, arviointifunktion ja mahdollisesti harjoitusdatan. GEPA hoitaa loput – hakustrategian, diagnostiikan ja parannuskierrokset.

Kolme optimointitilaa yhden rajapinnan alla

optimize_anything tarjoaa kolme tapaa optimoida erilaisia tehtäviä, ja kaikki toimivat saman rajapinnan kautta.

Yksittäistehtävähaku ratkaisee yhden vaikean ongelman ilman erillistä datasettia. Kandidaatti itsessään on ratkaisu, ja arvioija pisteyttää sen suoraan. Tällä tilalla GEPA optimoi esimerkiksi ympyräpakkausalgoritmeja, joissa tavoitteena on mahduttaa ympyrät mahdollisimman pieneen tilaan.

Monitehtävähaku optimoi useita toisiinsa liittyviä ongelmia niin, että yhdestä tehtävästä opitut parannukset siirtyvät toisiin. GEPA käytti tätä tilaa CUDA-ytimien generointiin, jossa eri PyTorch-operaatioiden optimointi hyödytti toisiaan.

Yleistystila rakentaa artefakteja, joiden pitää toimia myös ennennäkemättömillä esimerkeillä – tuttu haaste koneoppimisesta. Harjoitusaineistolla hiotun ratkaisun on pärjättävä myös validointidatalla. Tällä tilalla GEPA kehitti ARC-AGI-tehtävien ratkaisuagentin ja optimoi pilvireitityksen kustannuksia.

Ratkaisevaa on, ettei kehittäjän tarvitse tietää etukäteen, minkä tilan tehtävä vaatii. Sama API-kutsu käsittelee kaikki kolme tilannetta.

Tekstioptimoinnin gradientti

GEPA:n keskeinen innovaatio on Actionable Side Information eli ASI, diagnostinen palaute, joka toimii eräänlaisena tekstioptimoinnin gradienttina. Perinteiset optimoijat näkevät vain pistemäärän: kandidaatti sai 0,72 pistettä. GEPA sen sijaan lukee kääntäjävirheet, suorituslokit ja kustannuserittelyt ja käyttää kielimallia analysoimaan, miksi kandidaatti epäonnistui ja miten sitä pitäisi korjata.

Ero on käytännöllinen. Jos CUDA-ydin kaatuu muistivirheeseen, GEPA ei kokeile satunnaisia mutaatioita vaan lukee virheilmoituksen ja ehdottaa kohdennettua korjausta. Tutkijoiden mukaan tämä tekee optimoinnista merkittävästi tehokkaampaa kuin sokea evoluutio.

Toinen innovaatio on Pareto-rintaman ylläpito. Sen sijaan että järjestelmä valitsisi aina parhaan kokonaispisteet saaneen kandidaatin, se säilyttää kaikki kandidaatit, jotka ovat jossakin yksittäisessä asiassa parhaita. Yksi kandidaatti voi olla erinomainen tietyntyyppisissä tehtävissä ja heikko toisissa. Pareto-rintama pitää sen mukana, ja ajan myötä täydentävät vahvuudet kertyvät paremmaksi kokonaisuudeksi kuin mikään yksittäinen kandidaatti olisi.

ARC-AGI-harppaus ja AlphaEvolven päihitys

Näyttävin yksittäinen tulos tuli ARC-AGI-testistä, joka mittaa järjestelmien kykyä abstraktiin päättelyyn. GEPA lähti liikkeelle kymmenen rivin naiivin agentin koodista ja kehitti sen yli 300-riviseksi järjestelmäksi, joka sisältää sääntöpäättelyn, koodiverifikaation ja iteratiivisen tarkentamisen. Testin tarkkuus nousi 32,5 prosentista 89,5 prosenttiin Gemini 3 Flash -mallilla.

Konteksti on tärkeä. Googlen Gemini 3 Deep Think saavutti helmikuussa 84,6 prosenttia ARC-AGI-2-testissä, joka on alkuperäistä ARC-AGI:ta selvästi vaikeampi versio. GEPA:n ja Googlen tulokset eivät siis ole suoraan verrattavissa, mutta ne kertovat samasta suunnasta: tekoälyjärjestelmät paranevat nopeasti abstraktissa päättelyssä.

Ympyräpakkauksessa GEPA haastoi suoraan Googlen AlphaEvolven. 26 ympyrän tehtävässä GEPA saavutti pistemäärän 2,63598, mikä päihittää AlphaEvolven tuloksen 2,63586 – ja vähemmillä arviointikerroilla. AlphaEvolve on Googlen toukokuussa 2025 julkaisema evoluutiopohjainen koodausagentti, joten parannus on merkki siitä, ettei Google hallitse kenttää yksin.

Muut tulokset vahvistavat kuvaa. CUDA-ytimien generoinnissa 87 prosenttia tuotetuista ytimistä vastasi tai päihitti lähtötason ja neljännes saavutti yli 20 prosentin nopeutuksen. Pilvireitityksen optimoinnissa GEPA löysi algoritmin, joka säästi kustannuksia 40 prosenttia verrattuna Dijkstra-perusviivaan. Koodausagentin taidoissa Claude Haiku 4.5:n läpäisyprosentti nousi 79:stä sataan, ja optimoidut taidot siirtyivät suoraan mallista toiseen.

10 → 300+

Koodiriviä (ARC-AGI-agentti)

40 %↑

Pilvireitityksen kustannussäästö

87 %

CUDA-ytimistä vastasi lähtötasoa

> 20 %↑

CUDA-nopeutus parhaimmillaan

UC Berkeley, GEPA-tutkimus (ICLR 2026)

Avoin työkalu suljetussa kentässä

GEPA:n merkitys ulottuu yksittäisiä tuloksia pidemmälle. AlphaEvolve vaatii Googlen Gemini-malleja ja infrastruktuuria. GEPA toimii minkä tahansa kielimallin kanssa, on asennettavissa komennolla pip install gepa ja julkaistu avoimena lähdekoodina. Tutkimuksen takana on UC Berkeleyn, Washingtonin yliopiston ja usean muun laitoksen tutkijoita.

Kehittäjille ja tutkijoille optimize_anything tarjoaa konkreettisen työkalun: sama rajapinta optimoi prompteja, koodia ja agenttiarkkitehtuureja. Yrityksille kiinnostavin viesti on pilvireitityksen 40 prosentin kustannussäästö, joka osoittaa ettei kyse ole pelkästä akateemisesta harjoituksesta.

Se, ottavatko kehittäjät optimize_anything-rajapinnan laajasti käyttöön, on vielä avoin kysymys. ICLR-hyväksyntä ja vahvat tulokset antavat hyvän lähtökohdan, mutta kilpailu on kovaa – AlphaEvolven avoimen lähdekoodin versio OpenEvolve kerää sekin aktiivista yhteisöä.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.