Aivopohjainen arkkitehtuuri kahdella moduulilla
Singaporelainen tutkimusyritys Sapient Intelligence julkaisi 18. toukokuuta avoimen HRM-Text-päättelymallin. Mallissa on miljardi parametria, mutta sen koulutus vei vain noin päivän 16 GPU-yksiköllä kahdella koneella. Hintalappu jäi noin tuhanteen dollariin, murto-osaan siitä mitä etureunan kielimallit nielevät.
Nimi tulee sanoista Hierarchical Reasoning Model. Arkkitehtuuri jakaa työn kahteen rinnakkaiseen moduuliin. Hidas ohjain suunnittelee ja päättelee korkealla abstraktiotasolla, nopea työntekijä hoitaa yksityiskohtaiset laskennat alemmalla tasolla. Moduulit pyörivät sisäkkäisenä rekursiona piilevässä avaruudessa ennen kuin malli tuottaa yhtään merkkiä ulos.
Tavallinen transformer tekee yhden eteenpäinajon kerrallaan. HRM-Text kierrättää laskentaa moduulien välillä, mikä Sapientin mukaan vastaa ihmisaivojen tapaa erottaa hidas harkinta nopeasta intuitiosta. Tämä laskennan uudelleenkäyttö, ei mallin koon kasvattaminen, on rakenteen ydinidea.
Sapient julkaisi alkuperäisen HRM:n viime vuonna. Mallissa oli vain 27 miljoonaa parametria, mutta se ratkaisi vaikeita Sudoku-tehtäviä ja sokkelopolkuja paremmin kuin moni miljardimalli. HRM-Text laajentaa saman idean tekstipohjaiseen päättelyyn ja yleisempiin kielellisiin tehtäviin.
40 miljardia tokenia – tuhat kertaa vähemmän kuin tavallisesti
Koulutusaineiston määrä paljastaa yhtä paljon kuin laskentakustannus. HRM-Text opetettiin 40 miljardilla tokenilla strukturoitua dataa. Etureunan kielimallit kuluttavat tyypillisesti 4–36 biljoonaa tokenia. Suhde voi olla jopa tuhatkertainen.
Suorituskyky ei jää kauaksi suurempien mallien tasolta. MATH-vertailussa malli saavutti 56,2 prosenttia, ARC-Challengessa 81,9, DROP-tehtävässä 82,2 ja MMLU-yleistesteissä 60,7 prosenttia. Tulokset ovat samaa luokkaa kuin monilla seitsemän ja 13 miljardin parametrin malleilla.
Koko malli mahtuu 0,6 gigatavuun. Painot pyörivät tavallisella älypuhelimella ilman pilvipalvelua. Tämä avaa oven käyttötapauksille, joissa data ei saa lähteä laitteelta: henkilökohtaiset terveysmittarit, asianajotoimistojen sisäiset järjestelmät tai tutkijoiden työasemat.
Aalto, Helsingin yliopisto ja VTT pääsevät mukaan
Suomalaisille tutkimusryhmille muutos on konkreettinen. Tähän asti päättelymallien rakentaminen on vaatinut laskentakapasiteettia, johon yliopistojen budjetit eivät yllä. Tuhannen dollarin koulutuskustannus mahtuu jo tutkijan matkalaskujen tarkkuusrajaan.
Aalto-yliopiston tietotekniikan laitos, Helsingin yliopiston HIIT-tutkimusinstituutti sekä VTT:n tekoälytiimit voivat nyt jatkokouluttaa HRM-Textin pohjalle suomenkielisiä päättelymalleja tai kotimaiselle datalle räätälöityjä erikoismalleja. Koodi ja painot löytyvät Hugging Facen sivuilta avoimella lisenssillä.
Suomenkielinen päättelymalli on ollut tutkijoiden toivelistalla pitkään. Kotimaisesta aineistosta jälkikoulutettu HRM-Text voisi palvella oikeudellista päättelyä, terveydenhuollon päätöksentukea tai julkishallinnon kysymys-vastausjärjestelmiä ilman, että data lähtee Yhdysvaltoihin tai Kiinaan. Tämä on aito ero arkielämälle: kunnan asiakaspalvelu tai sairaalan triage-järjestelmä voi pyöriä omilla servereillä, ja tutkijat voivat säätää mallia kotimaan sääntöihin.
“27 miljoonaa parametria riittää lähes täydelliseen suoritukseen vaativissa päättelytehtävissä alle 200 megatavun muistilla, ilman esikoulutusta tai ketjutettua päättelyä.”
Koulutuskustannus
Tokenia koulutuksessa
Mallin koko
Parametria



