Avoin malli mahtuu 8 gigatavun muistiin ja generoi 16 megapikselin kuvan alle 20 sekunnissa.
Mitä Sana on
NVIDIA julkaisi avoimen lähdekoodin Sana-mallin GitHubissa Apache 2.0 -lisenssillä. Malli generoi 4 096 × 4 096 pikselin eli 16 megapikselin kuvan natiivisti ilman erillistä yläskaalausta. Tutkijoiden ilmoituksen mukaan generointiin kuluu kuluttajakortilla noin 20 sekuntia.
Vertailukohtana Black Forest Labsin Flux-12B vaatii datakeskus-GPU:n eikä mahdu kuluttajalaitteistolle. Sana on NVIDIAn omien mittausten mukaan 20-kertaa pienempi ja 100-kertaa nopeampi. Tämä siirtää korkearesoluutiokuvan generoinnin pilvestä paikalliselle koneelle.
Mitä 4-bit kvantisaatio tarkoittaa
Diffuusio-malli sisältää miljardeja painokertoimia, jotka kertovat verkolle miten kohinaa muutetaan asteittain kuvaksi. Tavallisesti nämä luvut tallennetaan 16-bittisinä liukulukuina. Kvantisaatiossa tarkkuus pudotetaan, ja neljään bittiin pakattu malli vie nelinkertaisesti vähemmän tilaa kuin alkuperäinen.
Tarkkuus ei putoa täysin lineaarisesti pakkaussuhteen mukana. Kalibrointitekniikoilla 4-bit versio säilyttää valtaosan 16-bit mallin laadusta arkikäytössä, vaikka rinnakkaisvertailussa hienojen yksityiskohtien eroja löytyy. Tutkijoille kyse on käytännön kompromissista: vähän laatua vastaan paljon saavutettavuutta.
Miksi 8 gigatavun raja on merkittävä
Kahdeksan gigatavun videomuisti on raja, jonka alle mahtuu suurin osa pelikannettavista ja keskihintaisista pöytäkoneista. NVIDIAn RTX 4060 -kannettavakorteissa muistia on tyypillisesti 8 GB, samoin edellisen sukupolven RTX 3070:ssä. Aiemmin korkearesoluutiokuvan generointi vaati joko pilvipalveluja tai 24 gigatavun RTX 3090- tai 4090-kortteja, joiden hinta liikkuu 1 500 eurossa pelkän osan osalta.
Käytännössä Sana siirtää 4K-kuvan tekemisen kotikoneelle. Vaikutus näkyy hinnoissa, käyttötavoissa ja yksityisyydessä: kuvia voi tehdä ilman että prompteja ja luonnoksia lähetetään ulkopuoliselle palvelimelle.
4 096 × 4 096 px
Natiivi resoluutio (16 megapikseliä)
8 GB
Vaadittu videomuisti – sopii pelikannettavaan
20× pienempi↑
Mallin koko verrattuna Flux-12B:hen
100× nopeampi↑
Generointinopeus verrattuna Flux-12B:hen
NVIDIA Research, GitHub NVlabs/Sana, 2026
Sanasto
- Diffuusiomalli
- Kuvageneraattorin tyyppi joka luo kuvan poistamalla satunnaista kohinaa askel kerrallaan, kunnes kuva tulee näkyviin. Useimmat nykyiset AI-kuvageneraattorit toimivat näin.
- Kvantisaatio
- Tekniikka jolla tekoälymallin sisäiset luvut pakataan pienempään tilaan vähentämällä tarkkuutta. 4-bit kvantisaatio kutistaa mallin noin neljäsosaan ilman että laatu romahtaa.
- Latentti esitys
- Tiivistetty matemaattinen koodi joka tallentaa kuvan olennaiset piirteet pieneen muotoon. Diffuusiomalli työskentelee tällä tiivistetyllä esityksellä, ei suoraan miljoonilla pikseleillä.
Arkkitehtuuri pakkaa kontekstin tiukemmaksi
Sanan tehokkuus ei perustu pelkkään kvantisaatioon. NVIDIAn tutkimusryhmä korvasi tavanomaisen huomion (attention) lineaarisella huomiolla, joka kasvaa lineaarisesti pikselien määrän mukaan eikä neliöllisesti. 4K-kokoluokassa pikseleitä on yli 16 miljoonaa, joten ero on tuntuva.
Lisäksi malli käyttää DC-AE-nimistä autoenkooderia, joka pakkaa kuvan latentin esityksen 32-kertaisesti tavanomaisten diffuusio-mallien 8-kertaiseen verrattuna. Yhdistelmä tarkoittaa että itse diffuusio-osan käsittelemät tokenit vähenevät murto-osaan aiemmasta.
Sprint-versio ajaa H100:lla silmänräpäyksessä
Tutkijaryhmä julkaisi Sanan rinnalla SANA-Sprintin, joka tislaa monivaiheisen diffuusio-prosessin yhteen askeleeseen. 1 024 pikselin kuva valmistuu H100-näytönohjaimella 0,1 sekunnissa. Kuluttajakorteilla sama operaatio vie noin sekunnin, joka tuntuu jo reaaliaikaiselta.
Vauhti avaa oven kuvankäsittelyn interaktiivisille käyttöliittymille, joissa malli ehtii generoida uuden version käyttäjän muokkausten tahdissa. Vastaavaa kokemusta ovat tarjonneet tähän asti lähinnä Adoben Fireflyn ja muiden maksullisten palveluiden pilvipohjat.
Aalto ja suomalaiset luovan alan tekijät
Aalto-yliopiston tietotekniikan laitoksella generatiiviset kuvamallit kuuluvat konenäön ja koneoppimisen tutkimusryhmien työsarkaan. Avoimen Sanan vapautuminen helpottaa kotimaisten ryhmien työtä: mallia voi jatkokouluttaa omilla aineistoilla ilman miljoonien eurojen klusteri-investointia.
Käytännön merkitys ulottuu laajemmalle. Suomalaiset graafikot, kuvittajat ja pelistudiot ovat aiemmin joutuneet valitsemaan joko pilvipalveluiden kuukausimaksut tai 5 000 euron työaseman. Sana kaventaa eroa ammattikalustojen ja kotikoneen välillä, mikä auttaa pieniä toimijoita ja itsenäisiä taiteilijoita. Konseptikuvituksen tekeminen siirtyy entistä enemmän paikalliseksi prosessiksi.
Avoin malli, hämärät koulutusaineistot
Avoimuus tarkoittaa että Sanan voi ladata, jatkokouluttaa ja muokata ilman lupaa. Tämä erottaa sen Midjourneystä ja DALL-E:stä, joiden taustalla on suljettu malli. NVIDIAn motiivi on selvä: avoin julkaisu kasvattaa GeForce-näytönohjainten houkutusta luovan alan ammattilaisten silmissä, jotka eivät halua maksaa kuukausimaksuja palveluntarjoajille.
Avoin koodi ei kuitenkaan tarkoita avointa koulutusaineistoa. NVIDIAn dokumentaatio mainitsee LAION-pohjaiset aineistot, mutta tarkkaa inventaariota ei ole julkaistu. EU:n AI Act ja sen toukokuussa 2025 voimaan astuneet yleiskäyttöisen tekoälyn säännökset edellyttävät julkaisijalta tiivistelmää aineiston sisällöstä. Selvitys jää viranomaisille ja tutkijoille tulevina kuukausina.
Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta.
Lue lisää toimintaperiaatteistamme.