Suomalaisen viraston tietohallinnossa on viime vuosina kysytty yhä uudelleen samaa: saako asiakkaiden tietoja syöttää tekoälylle, jonka palvelimet ovat jossain muualla? Suljettujen kielimallien kohdalla vastaus on usein kielteinen tai vähintään pitkä selvitys.
Ranskalainen Mistral AI julkaisi 6. lokakuuta esiversion uudesta lippulaivamallistaan Mistral Large 4:stä. Samalla se lupasi jakaa mallin painot vapaasti. ”Julkaisemme painot kuun loppuun mennessä”, yhtiö kirjoittaa englanninkielisessä tiedotteessaan. Malli on suuri: siinä on biljoona parametria, joista kerrallaan käytössä on 49 miljardia.
Mitä avoimet painot sitten oikeastaan tarkoittavat? Ja miksi niistä puhutaan Euroopassa nyt niin paljon?
Painot ovat mallin muisti
Kielimalli on pohjimmiltaan valtava joukko lukuja. Koulutuksen aikana näitä lukuja eli painoja säädetään, kunnes malli oppii ennustamaan tekstiä. Kun koulutus on valmis, kaikki opittu on tallentunut painoihin.
Suljetun mallin, kuten OpenAI:n GPT-sarjan tai Anthropicin Clauden, painot pysyvät yhtiön omilla palvelimilla. Käyttäjä lähettää kysymyksensä rajapinnan eli API:n kautta ja saa vastauksen takaisin. Data kulkee siis aina palveluntarjoajan kautta.
Avoimen painon malli toimii toisin. Painot ladataan tiedostoina, ja kuka tahansa, jolla on tarpeeksi laskentatehoa, voi ajaa mallia omalla palvelimellaan, omassa konesalissaan tai valitsemassaan pilvessä. Mallia voi myös hienosäätää omalla aineistolla, esimerkiksi viraston asiakirjoilla.
Avoin paino on eri asia kuin avoin lähdekoodi. Täysin avoimessa mallissa julkaistaan myös koulutusdata ja koulutuskoodi, jolloin mallin voisi periaatteessa rakentaa alusta uudelleen. Useimmat avoimen painon mallit eivät tee sitä. Lisenssi taas ratkaisee, saako mallia käyttää kaupallisesti. Mistral ei ole vielä kertonut, millä lisenssillä Large 4:n painot jaetaan.
Suljettu, avoin paino vai avoin lähdekoodi?
Suljettu malli: käytettävissä vain palveluntarjoajan rajapinnan kautta, data kulkee yhtiön palvelimille.
Avoimen painon malli: painot ladattavissa ja ajettavissa omalla laitteistolla, mutta koulutusaineisto on yleensä salainen.
Avoimen lähdekoodin malli: painojen lisäksi julkaistaan koulutusdata ja -koodi.
Kiinalaiset ehtivät ensin
Avoimien mallien kärjessä ovat viime vuosina olleet kiinalaiset toimijat. DeepSeek, Alibaban Qwen, Zhipun GLM ja Moonshotin Kimi ovat jakaneet painonsa vapaasti, ja niitä käytetään laajasti myös länsimaisissa yrityksissä.
Eurooppalaiselle organisaatiolle asetelma on hankala. Kiinalaista mallia voi ajaa omalla koneella, jolloin data ei lähde mihinkään. Mallin koulutusaineistoista ja mahdollisista sisäänrakennetuista rajoituksista tiedetään kuitenkin vähän, eikä moni julkisen sektorin hankkija halua ottaa sitä riskiä.
Mistral tähtää Large 4:llä juuri tähän rakoon. Yhtiön omien testien mukaan malli ohittaa koodausagentteja mittaavassa Coding Agent Index -vertailussa DeepSeek V4 Pron ja Qwen3.8 Maxin. Zhipun GLM-5.3:een verrattuna arvioijat suosivat Mistralin mukaan Large 4:ää matematiikan, fysiikan ja CAD-suunnittelun tehtävissä. Kyse on yhtiön omista vertailuista, joita ulkopuoliset eivät ole vielä toistaneet.
Suljetuista kärkimalleista Large 4 jää yhä jälkeen. Artificial Intelligence News -sivuston mukaan malli sai koodaustehtävien sokkoarvioinnissa 3,74 pistettä viidestä, kun Claude Opus 5 sai 4,22. Mistral kertoo testaavansa mallia tositilanteissa yhdessä tietoturva-alan johtajien, tarkastettujen kumppanien ja valtiollisten viranomaisten kanssa.
“Malli tulee saataville useilla alueilla eri puolilla maailmaa, myös eurooppalaisessa ympäristössä, jota Mistral operoi alusta loppuun itse, riippumattomana muista digitaalisten palvelujen tarjoajista ja eurooppalaisen lainsäädännön alaisena.”
Mistral Large 4 ja suomalainen Poro 34B
Mistral Large 4
Ranskalaisen Mistral AI:n lippulaivamalli, esiversio 6.10.2026
Parametrit
Noin biljoona, joista 49 miljardia käytössä kerrallaan
Painot jakoon
Lokakuun 2026 loppuun mennessä
Lisenssi
Ei vielä kerrottu
Kielet
Yli 160 kieltä, kaikki EU:n viralliset kielet
Poro 34B
Silo AI:n, TurkuNLP:n ja HPLT-hankkeen LUMIssa kouluttama malli
Suuret mallit jaetaan usein erikoistuneisiin osiin, joista vain kysymykseen sopivimmat otetaan kerrallaan käyttöön. Siksi biljoonan parametrin malli laskee jokaisen vastauksen 49 miljardilla parametrilla, mikä säästää laskentatehoa.
Apache 2.0 -lisenssi
Yleinen ja salliva käyttölupa, jonka nojalla ohjelmaa tai mallia saa käyttää, muokata ja hyödyntää kaupallisesti maksutta, kunhan alkuperäinen tekijä mainitaan.
Suvereeni tekoäly
Tekoäly, jonka käyttäjä pystyy pitämään kokonaan omassa hallinnassaan ilman riippuvuutta ulkomaisesta palveluntarjoajasta. Tällöin myös data ja malli ovat oman lainsäädännön piirissä.
Mitä tämä tarkoittaa suomalaiselle virastolle?
Avoimen painon mallin suurin lupaus on hallinta. Kun malli pyörii omassa konesalissa tai suomalaisella palvelimella, potilastiedot, veroasiakirjat tai yrityksen tuotekehitysaineisto eivät lähde talon ulkopuolelle. Silloin tietosuoja-asetuksen ja julkisten hankintojen vaatimukset on helpompi täyttää kuin ulkomaisen API-palvelun kanssa.
Mistral lupaa tätä suoraan. ”Organisaatioille, jotka tarvitsevat suvereenia ja auditoitavaa tekoälyä tietoturvaoperaatioihin, mallia voidaan ajaa yksityisessä pilvessä tai omissa tiloissa”, yhtiö kirjoittaa tiedotteessaan (alkuperäinen englanniksi).
Halpaa se ei ole. Biljoonan parametrin malli vaatii jo pelkkään käyttöön useita huipputason näytönohjaimia, eikä sellaista laitteistoa löydy useimmilta kunnilta. Tässä kohtaa kuvaan tulee Kajaani.
LUMI ja suomen kieli
CSC:n ylläpitämä LUMI-supertietokone Kajaanissa on Euroopan tehokkaimpia. Sen ympärille rakennettu LUMI AI Factory tarjoaa laskentatehoa ja tukea startupeille, pk-yrityksille, suuryrityksille, tutkimuslaitoksille ja julkisen palvelun organisaatioille. Hanketta rahoittavat EU:n EuroHPC-yhteisyritys sekä Suomi, Tšekki, Tanska, Viro, Norja ja Puola.
LUMIssa on koulutettu suomalainen avoin malli ennenkin. Silo AI, Turun yliopiston TurkuNLP-ryhmä ja HPLT-hanke kouluttivat siellä Poro 34B -mallin, joka julkaistiin keväällä 2024 Apache 2.0 -lisenssillä. Sen 34 miljardia parametria opetettiin suomen- ja englanninkielisellä tekstillä sekä ohjelmakoodilla. AMD osti Silo AI:n myöhemmin samana vuonna.
Poro osoitti, että pienelle kielelle voi rakentaa käyttökelpoisen mallin, kun aineisto kootaan huolella. Suurten monikielisten mallien suomi on usein kankeampaa kuin niiden englanti. Mistralin mukaan Large 4:n koulutusaineisto kattaa yli 160 kieltä ja kaikki EU:n viralliset kielet, siis myös suomen. Kuinka hyvin malli taivuttaa sijamuotoja ja ymmärtää virkakieltä, selviää vasta, kun painot ovat jaossa ja suomalaiset pääsevät kokeilemaan.
Ratkaisu tulee lisenssissä
Mistralin tiedotteessa ei lainata nimeltä ketään yhtiön johdosta. Silo AI:n tai CSC:n kommenttia suomalaisten virastojen mahdollisuuksista ajaa mallia itse ei ollut saatavilla jutun julkaisuun mennessä.
Varsinainen testi alkaa marraskuussa. Kun painot ovat ladattavissa, nähdään, millä ehdoilla niitä saa käyttää, kuinka raskas malli on LUMIn kaltaisissa ympäristöissä ja ryhtyykö joku suomalainen toimija hienosäätämään sitä kotimaiseen käyttöön. Jos lisenssi sallii kaupallisen ja julkisen käytön ilman lisäehtoja, eurooppalainen hankkija voi valita kärkitason avoimen mallin ilman kiinalaisen mallin riskiarviota. Jos ehdot ovat tiukat, kiinalaisiin malleihin turvaudutaan todennäköisesti jatkossakin.
Viikoittainen uutiskirje
Tule firmasi fiksuimmaksi AI-osaajaksi
Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.