Nvidia ja brittiläinen Ineffable Intelligence ilmoittivat keskiviikkona 13. toukokuuta insinööritason kumppanuudesta. Yritykset rakentavat yhdessä infrastruktuuria tekoälylle, joka opettelee maailmaa kokeilemalla ja erehtymällä, ilman ihmisten kirjoittamaa dataa. Yhteistyö on poikkeuksellinen, koska Ineffable on vasta huhtikuun lopussa siemenrahoituksen kerännyt alkuvaiheen yhtiö. Sen takana on kuitenkin David Silver, mies jonka tutkimus oli AlphaGon ja AlphaZeron sydän.
DeepMindin RL-vetäjä rakentaa omaa polkuaan
Silver kuuluu vahvistusoppimisen (reinforcement learning, RL) pioneereihin. Hän aloitti DeepMindissa konsulttina vuonna 2010, siirtyi vakituiseksi tutkijaksi 2013 ja veti yhtiön RL-tutkimusta yli vuosikymmenen, kunnes jätti yhtiön alkuvuodesta 2026. Hänen johdollaan syntyivät AlphaGo, joka kaatoi go-mestari Lee Sedolin 2016, ja AlphaZero, joka oppi shakin, gon ja shogin ilman yhtäkään ihmispelin esimerkkiä. Silver toimii myös University College Londonin professorina.
Ineffable Intelligence rekisteröitiin loppuvuodesta 2025. Yhtiön huhtikuun siemenrahoituskierros kasvoi 1,1 miljardiin dollariin ja arvostus 5,1 miljardiin, mikä on Euroopan ennätys. Pääsijoittajiksi merkittiin Sequoia ja Lightspeed, mutta mukana ovat myös Nvidia (vähintään 250 miljoonalla dollarilla), Google, Index Ventures, DST Global ja Britannian valtion Sovereign AI -rahasto.
Trial-and-error-RL haastaa LLM-paradigman
Nykyiset suuret kielimallit, kuten GPT, Claude ja Gemini, oppivat ihmisten kirjoittamasta tekstistä. Ne ovat valtavia tilastollisia jäljittelyitä: jokainen vastaus pohjautuu siihen, mitä joku on aiemmin kirjoittanut. Mallien kehityksen rajat ovat alkaneet näkyä, kun laadukas ihmisteksti loppuu kesken.
Silverin lupaus on toisenlainen. Hänen mukaansa todellinen yleisäly syntyy vain, kun järjestelmä rakentaa tietonsa itse vuorovaikutuksessa ympäristön kanssa. AlphaZero osoitti ajatuksen pelilaudalla. Nyt tavoite on viedä sama logiikka kaikkialle. Ineffable kuvaa hanketta superoppijaksi, joka tuottaa kaiken osaamisensa alkeismotoriikasta abstrakteihin oivalluksiin asti omasta kokemuksestaan.
Veto on tutkimuksellisesti iso. Puhdas RL ilman ihmisdataa on toiminut tähän asti vain kapeissa ympäristöissä, joiden säännöt ovat tunnettuja: lautapeleissä, videopeleissä ja robotiikan simulaatioissa. Avoimen maailman tehtävät kuten esseet, koodi ja lääkemolekyylit ovat osoittautuneet paljon hankalammiksi. Jos Ineffable onnistuu, koko nykyisen tekoälyn data-arkkitehtuuri muuttuu tarpeettomaksi.
“Jos onnistumme, tämä on Darwinin lain veroinen tieteellinen läpimurto, joka selittää ja rakentaa kaiken älyn.”
Nvidia antaa insinöörinsä, ei vain piirinsä
Nvidian rooli on poikkeuksellinen. Yhtiö on yleensä sirujen myyjä ja pääomasijoittaja, mutta nyt se asettaa omat insinöörinsä Ineffablen rinnalle. Yhteistyössä rakennetaan laaja RL-laskentaympäristö Nvidian uusimpien Grace Blackwell -prosessoreiden ja tulevan Vera Rubin -alustan päälle. Käytännössä tämä tarkoittaa, että Ineffablen ohjelmistopino syntyy yhdessä niiden insinöörien kanssa, jotka tietävät piirien rajat parhaiten.
Jensen Huang on puhunut julkisesti superoppijoista, järjestelmistä jotka jatkavat oppimistaan kokemuksesta käytön aikana. Nvidia näyttää veikkaavan, että seuraava sukupolvi tekoälyä vaatii erilaisen laitearkkitehtuurin kuin LLM:t. RL-järjestelmien laskenta on epäjatkuvaa: paljon kevyttä simulaatiota, jatkuvia palautesilmukoita ja raskasta tilanhallintaa. Tämä eroaa kielimallien sisäisistä matriisilaskuista, joille nykyiset GPU-piirit on alunperin viritetty.



