Tutkimus

Päättelymalli tuhannella dollarilla

Singaporelainen Sapient koulutti miljardin parametrin HRM-Text-mallin yhdessä päivässä

Hanna HuulivuoHanna Huulivuo
Jaa:
Päättelymalli tuhannella dollarilla
Kuva: Aatu Dorochenko / CC BY-SA 4.0

Aivopohjainen arkkitehtuuri kahdella moduulilla

Singaporelainen tutkimusyritys Sapient Intelligence julkaisi 18. toukokuuta avoimen HRM-Text-päättelymallin. Mallissa on miljardi parametria, mutta sen koulutus vei vain noin päivän 16 GPU-yksiköllä kahdella koneella. Hintalappu jäi noin tuhanteen dollariin, murto-osaan siitä mitä etureunan kielimallit nielevät.

Nimi tulee sanoista Hierarchical Reasoning Model. Arkkitehtuuri jakaa työn kahteen rinnakkaiseen moduuliin. Hidas ohjain suunnittelee ja päättelee korkealla abstraktiotasolla, nopea työntekijä hoitaa yksityiskohtaiset laskennat alemmalla tasolla. Moduulit pyörivät sisäkkäisenä rekursiona piilevässä avaruudessa ennen kuin malli tuottaa yhtään merkkiä ulos.

Tavallinen transformer tekee yhden eteenpäinajon kerrallaan. HRM-Text kierrättää laskentaa moduulien välillä, mikä Sapientin mukaan vastaa ihmisaivojen tapaa erottaa hidas harkinta nopeasta intuitiosta. Tämä laskennan uudelleenkäyttö, ei mallin koon kasvattaminen, on rakenteen ydinidea.

Sapient julkaisi alkuperäisen HRM:n viime vuonna. Mallissa oli vain 27 miljoonaa parametria, mutta se ratkaisi vaikeita Sudoku-tehtäviä ja sokkelopolkuja paremmin kuin moni miljardimalli. HRM-Text laajentaa saman idean tekstipohjaiseen päättelyyn ja yleisempiin kielellisiin tehtäviin.

40 miljardia tokenia – tuhat kertaa vähemmän kuin tavallisesti

Koulutusaineiston määrä paljastaa yhtä paljon kuin laskentakustannus. HRM-Text opetettiin 40 miljardilla tokenilla strukturoitua dataa. Etureunan kielimallit kuluttavat tyypillisesti 4–36 biljoonaa tokenia. Suhde voi olla jopa tuhatkertainen.

Suorituskyky ei jää kauaksi suurempien mallien tasolta. MATH-vertailussa malli saavutti 56,2 prosenttia, ARC-Challengessa 81,9, DROP-tehtävässä 82,2 ja MMLU-yleistesteissä 60,7 prosenttia. Tulokset ovat samaa luokkaa kuin monilla seitsemän ja 13 miljardin parametrin malleilla.

Koko malli mahtuu 0,6 gigatavuun. Painot pyörivät tavallisella älypuhelimella ilman pilvipalvelua. Tämä avaa oven käyttötapauksille, joissa data ei saa lähteä laitteelta: henkilökohtaiset terveysmittarit, asianajotoimistojen sisäiset järjestelmät tai tutkijoiden työasemat.

Aalto, Helsingin yliopisto ja VTT pääsevät mukaan

Suomalaisille tutkimusryhmille muutos on konkreettinen. Tähän asti päättelymallien rakentaminen on vaatinut laskentakapasiteettia, johon yliopistojen budjetit eivät yllä. Tuhannen dollarin koulutuskustannus mahtuu jo tutkijan matkalaskujen tarkkuusrajaan.

Aalto-yliopiston tietotekniikan laitos, Helsingin yliopiston HIIT-tutkimusinstituutti sekä VTT:n tekoälytiimit voivat nyt jatkokouluttaa HRM-Textin pohjalle suomenkielisiä päättelymalleja tai kotimaiselle datalle räätälöityjä erikoismalleja. Koodi ja painot löytyvät Hugging Facen sivuilta avoimella lisenssillä.

Suomenkielinen päättelymalli on ollut tutkijoiden toivelistalla pitkään. Kotimaisesta aineistosta jälkikoulutettu HRM-Text voisi palvella oikeudellista päättelyä, terveydenhuollon päätöksentukea tai julkishallinnon kysymys-vastausjärjestelmiä ilman, että data lähtee Yhdysvaltoihin tai Kiinaan. Tämä on aito ero arkielämälle: kunnan asiakaspalvelu tai sairaalan triage-järjestelmä voi pyöriä omilla servereillä, ja tutkijat voivat säätää mallia kotimaan sääntöihin.

“27 miljoonaa parametria riittää lähes täydelliseen suoritukseen vaativissa päättelytehtävissä alle 200 megatavun muistilla, ilman esikoulutusta tai ketjutettua päättelyä.”

— Sapient Intelligence, HRM-tutkimuspaperi (arXiv 2506.21734)
1 000 $↓

Koulutuskustannus

40 mrd

Tokenia koulutuksessa

~2 GB↓

Mallin koko

1 mrd

Parametria

Sapient Intelligence & arXiv 2506.21734

Sanasto

Token
Tekstin perusyksikkö, jonka kielimalli käsittelee. Yksi token on suomeksi noin puoli sanaa, joten 40 miljardia tokenia vastaa karkeasti 20 miljardia suomen sanaa.
Transformer
Vuonna 2017 kehitetty neuroverkkoarkkitehtuuri, joka on lähes kaikkien nykyisten kielimallien pohjana. Sen vahvuus on kyky käsitellä laajoja tekstijaksoja kerralla.
Piilevä avaruus
Mallin sisäinen abstrakti laskenta-avaruus, jossa se käsittelee merkityksiä numeroina ennen kuin tuottaa lopullista tekstiä. Sieltä päätellään lopulta ulos kirjaimet ja sanat.

Mitä tämä kertoo suuruuden ylivallasta?

Viime vuodet ovat opettaneet, että suurempi malli on parempi. Sapient ei kumoa tätä, mutta kyseenalaistaa sen yksinvallan. Yhtiön väite on, että älykkään arkkitehtuurin ja huolella valitun datan yhdistelmä voi korvata huomattavan osan raakaa laskentaa.

Yhden julkaisun tulokset eivät vielä todista pysyvää käännettä. Riippumaton vertailu ja toistettavuus ratkaisevat, kestääkö Sapientin lupaus julkista käsittelyä. Jos kestää, tekoälytutkimuksen sisäänpääsykynnys laskee selvästi nykyisten miljardibudjettien tasolta, ja Suomi pääsee mukaan kilpailuun ilman että valtio kustantaa kymmenen miljardin laskentahallin.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.