Koneoppiminen

Startup poltti tekoälymallin suoraan piisiruun

HC1-siru on 10 kertaa nopeampi ja 20 kertaa halvempi kuin GPU-ratkaisut

Hanna HuulivuoHanna Huulivuo
Jaa:
Startup poltti tekoälymallin suoraan piisiruun

Tekoäly ilman muistipullonkauloja

GPU-pohjaisen tekoälypäättelyn suurin pullonkaula ei ole laskentatehon puute vaan datan liikuttelu. Mallin painot, miljardit numeeriset arvot joihin kielimallin osaaminen tiivistyy, kulkevat jatkuvasti edestakaisin muistin ja laskentayksikön välillä. Tätä ilmiötä kutsutaan muistimuuriksi, ja se rajoittaa nopeutta riippumatta siitä, kuinka tehokas itse laskentayksikkö on.

Torontolaisyritys Taalas väittää ratkaisseensa ongelman tavalla, jota kukaan muu ei ole kokeillut tässä mittakaavassa. Yhtiö koodaa kielimallin painot suoraan piisirun transistoreihin niin, ettei erillistä muistia tarvita lainkaan. Helmikuussa julkistettu HC1-siru on ensimmäinen tuote, joka perustuu tähän kovakoodatun päättelyn arkkitehtuuriin.

HC1 on valmistettu TSMC:n 6 nanometrin prosessilla. Sirussa on 53 miljardia transistoria 815 neliömillimetrin alueella, ja siihen on kovakoodattu Metan Llama 3.1 8B -kielimalli kokonaisuudessaan. Kyseessä ei ole tavallinen kiihdytinkortti, joka voi ajaa eri malleja, vaan siru joka on rakennettu palvelemaan yhtä ainoaa mallia mahdollisimman tehokkaasti.

Taalas käyttää erityistä lukumuistikudosta, johon mallin painot on poltettu pysyvästi. Painot on kvantisoitu aggressiivisesti räätälöityihin 3- ja 6-bittisiin tarkkuuksiin tilan säästämiseksi. KV-välimuisti, jota tarvitaan keskusteluhistorian ylläpitoon päättelyn aikana, toimii erillisessä SRAM-muistissa. Lopputulos on siru, jossa tallennus ja laskenta yhdistyvät samassa paikassa.

Mikä on muistimuuri?

Perinteisissä tekoälykiihdyttimissä mallin painot haetaan erillisestä HBM-muistista laskentayksikölle. Tämä siirto on usein koko järjestelmän hitain vaihe, ja sitä kutsutaan muistimuuriksi. Taalas ratkaisee ongelman yhdistämällä tallennus ja laskenta samalle sirulle – yksittäinen transistori sekä varastoi dataa että suorittaa siihen liittyvän laskutoimituksen.

17 000 tokenia sekunnissa

Taalaksen lupaus kuulostaa liian hyvältä ollakseen totta, mutta yhtiö esittää konkreettisia lukuja tuekseen. HC1 tuottaa noin 17 000 tokenia sekunnissa Llama 3.1 8B -mallilla yhtä käyttäjää kohden. Yksinkertaisissa kyselyissä luku nousee lähes 20 000 tokeniin, ja yhtiön demossa sadan sivun kirjan rakenteen luomiseen kului 0,064 sekuntia.

Vertailuksi: Nvidian tuore Blackwell B200, yksi markkinoiden tehokkaimmista tekoälypiireistä, jää suorituskyvyssä selvästi jälkeen. Taalas on noin kymmenen kertaa nopeampi myös Cerebrasin wafer-mittakaavan siruja vastaan. Miljoona tokenia maksaa Taalaksen laitteistolla 0,75 senttiä, mikä on murto-osa nykyisistä GPU-pohjaisista hinnoista.

Energiankulutus on yhtä vaikuttava. Yhden HC1-kortin tehonkulutus on noin 200 wattia, ja kymmenen kortin palvelinjärjestelmä vetää 2 500 wattia. Se on kymmenesosa vastaavan GPU-kokoonpanon energiatarpeesta. Valmistuskustannukset ovat yhtiön mukaan noin 20 kertaa pienemmät kuin kilpailijoilla.

Käytännössä HC1 tuottaa tekstiä nopeammin kuin ihminen ehtii sitä lukea. Taalaksen ChatJimmy-nimisessä demosovelluksessa vastaukset ilmestyvät ruudulle käytännössä välittömästi. Yhtiö tähtää nimenomaan datakeskusmarkkinoille, joissa nopeus ja kustannustehokkuus ratkaisevat kilpailun.

“Varastoimme neljä bittiä ja suoritamme niihin liittyvän kertolaskun – kaiken – yhdellä ainoalla transistorilla.”

— Ljubisa Bajic, Taalaksen toimitusjohtaja ja perustaja

200 miljoonaa dollaria ja yksi malli

Taalaksen perustivat Ljubisa Bajic, Lejla Bajic ja Drago Ignjatovic, jotka kaikki työskentelivät aiemmin Tenstorrentilla ja AMD:llä. Yhtiön 25 insinöörin tiimissä on entisiä AMD:n, Applen, Googlen ja Nvidian osaajia. Rahoitusta on kerätty kolmella kierroksella yli 200 miljoonaa dollaria, josta noin 170 miljoonaa on vielä käyttämättä.

Lähestymistavan ilmeisin rajoitus on joustamattomuus. Koska mallin painot on kovakoodattu piiin, uuden malliversion käyttöönotto vaatii uuden sirun valmistamisen. Taalas lupaa prosessin kestävän noin kaksi kuukautta tilauksesta valmiiseen PCI Express -korttiin. Yhtiö on lisännyt tukea LoRA-hienosäädölle ja säädettävälle konteksti-ikkunalle, mikä tuo jonkin verran joustavuutta ilman fyysistä muutosta siruun.

HC1 tukee toistaiseksi vain yhtä 8 miljardin parametrin mallia. Se riittää moneen käytännön sovellukseen, kuten asiakaspalveluun ja tekstin tiivistämiseen, mutta ei kilpaile suurten kielimallien kanssa. Yhtiön tiekartta lupaa keväällä 2026 keskikokoisen päättelymallin ja vuoden lopussa HC2-sukupolven sirun, joka tukisi jopa 20 miljardia parametria. Todellinen koetinkivi on se, skaalautuuko lähestymistapa satojen miljardien parametrien malleihin.

17 000↑

Tokenia sekunnissa

0,75 ¢

Hinta per miljoona tokenia

10×↑

Nopeampi kuin GPU-ratkaisut

200 W

Tehonkulutus per kortti

Taalas / CNX Software, 2026

Sanasto

Token
Tekstin perusyksikkö, jonka kielimalli käsittelee kerrallaan. Yksi token vastaa suomeksi noin puolta sanaa.
GPU (Graphics Processing Unit)
Grafiikkaprosessori – alun perin näytönohjaimiin suunniteltu piiri, josta on tullut tekoälyn tärkein laskentayksikkö. Nvidian GPU:t hallitsevat nykyistä tekoälymarkkinaa.

Halvempi päättely avaa ovia Suomessa

Suomalaiset tekoäly-yritykset ja -startupet nojaavat pitkälti pilvipalveluiden rajapintoihin, joiden hinnoittelu perustuu suoraan päättelykustannuksiin. Jos Taalaksen kaltainen teknologia yleistyy ja päättelykustannukset putoavat murto-osaan nykyisestä, monet sovellukset muuttuvat taloudellisesti kannattaviksi käyttötapauksissa, joissa ne eivät vielä ole. Erityisesti reaaliaikaiset palvelut – suomenkielinen puheentunnistus, tekoälyavusteiset asiakaspalveluratkaisut ja älykkäät hakujärjestelmät – hyötyisivät merkittävästi. Pienille toimijoille, joilla ei ole varaa omiin GPU-klustereihin, kustannusten lasku voisi tarkoittaa siirtymää ostetusta rajapinnasta omaan päättelyinfrastruktuuriin.

Sovelluskohtaisia ASIC-piirejä on käytetty vuosikymmeniä signaalinkäsittelyssä ja kryptovaluuttojen louhinnassa, joten ajatus ei sinänsä ole uusi. Taalaksen innovaatio on siinä, miten yhtiö soveltaa periaatetta massiivisiin kielimalleihin. Samalla se lyö ison vedon siitä, että mallit vakiintuvat riittävästi kiinteän laitteiston perustelemiseksi. Tekoälyalan kehitysvauhti tekee tästä vedosta riskialttiin, sillä puolessa vuodessa nykyiset mallit voivat olla vanhentuneita.

Taalas uskoo kuitenkin, ettei kaikkien tarvitse ajaa uusinta ja suurinta mallia. Jos yhtiö on oikeassa ja HC2 todella skaalautuu kymmeniin miljardeihin parametreihin, edessä voi olla siirtymä, jossa GPU:n rooli tekoälypäättelyssä pienenee huomattavasti – ja päättelyn hinta putoaa tasolle, joka avaa kokonaan uusia markkinoita.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  4. 4Datakeskukset Suomessa – hankkeet, sähkö ja vero
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.