Koneoppiminen

LongCat-2.0 hiipi kärkeen nimellä 'Owl Alpha'

Meituanin avoin 1,6 biljoonan parametrin malli ylsi kärkeen – ilman Nvidiaa.

Hanna HuulivuoHanna Huulivuo
Jaa:
LongCat-2.0 hiipi kärkeen nimellä 'Owl Alpha'
Kuva: Fumikas Sagisavas / CC0

Pöllö, joka osoittautui kissaksi

OpenRouterin mallilistalle ilmestyi kesäkuun lopulla nimetön tulokas, 'Owl Alpha'. Kehittäjät ottivat sen testiin koodaustehtävissä ja huomasivat pian, että malli pärjäsi poikkeuksellisen hyvin, paikoin länsimaisten kärkimallien tasolla. Kukaan ei tiennyt, kuka sen oli rakentanut.

Nyt salaisuus on paljastunut. 'Owl Alpha' oli kiinalaisen Meituanin LongCat-2.0, yksi kaikkien aikojen suurimmista avoimista kielimalleista. Ruokalähetteistään tunnettu jätti on parissa vuodessa noussut yhdeksi Kiinan kunnianhimoisimmista tekoälytoimijoista.

Mitä LongCat-2.0 osaa

Mallin kokoluokka on tavaton: 1,6 biljoonaa parametria. Se on moninkertainen useimpiin avoimiin malleihin verrattuna ja lähentelee suljettujen huippumallien arvioituja mittasuhteita. Meituanin aiemmat LongCat-mallit ovat perustuneet mixture-of-experts-arkkitehtuuriin, jossa vain osa parametreista aktivoituu kerrallaan. Se pitää ajokustannukset siedettävinä valtavasta koosta huolimatta.

Kiinnostavin luku ei ole kuitenkaan koko vaan suoritus. LongCat-2.0 ylsi 59,5 prosenttiin SWE-bench Pro -testissä. Kyseessä on koodaustehtävien vaikeampi ja vaikeammin huijattava versio, jossa malli joutuu ratkomaan aitoja ohjelmisto-ongelmia oikeista koodivarastoista. Lähes 60 prosentin tulos asettaa avoimen mallin samaan sarjaan parhaiden kaupallisten koodausmallien kanssa.

“Kun malli testataan nimettömänä, kukaan ei anna sille etua brändin perusteella. Owl Alphan tulokset kertoivat, että kiinalainen avomalli pystyy haastamaan lännen kärjen ilman markkinointikoneistoa.”

— AI Suomen arvio

Miksi malli piiloutui salanimen taakse

Nimettömät mallit ovat yleistyneet OpenRouterin kaltaisilla alustoilla. Kehittäjä voi julkaista mallin peitenimellä, kerätä aitoa käyttäjäpalautetta ja verrata sitä kilpailijoihin ilman, että brändi ohjaa odotuksia. Samalla syntyy pöhinää: kun testaajat huomaavat tuntemattoman mallin kiipeävän listoilla, arvailu sen alkuperästä leviää nopeasti.

LongCat-2.0:n tapauksessa taktiikka toimi. Kun 'Owl Alpha' paljastui Meituanin malliksi, sen benchmark-tulokset oli jo ehditty vahvistaa riippumattomasti. Mainepohja rakentui suoritukselle, ei julistuksille.

Koulutettu ilman Nvidiaa

Meituanin mukaan LongCat-2.0 koulutettiin kokonaan kiinalaisilla ASIC-siruilla, eli tiettyyn tehtävään räätälöidyillä kiihdyttimillä. Länsimaisten GPU-jättien sijaan malli nojasi kotimaiseen laitteistoon alusta loppuun. Se kertoo enemmän Kiinan piiriomavaraisuuden edistymisestä kuin yksittäisen mallin tehosta.

Mitä tämä tarkoittaa käytännössä

Tavalliselle kehittäjälle avoin kärkimalli tarkoittaa vaihtoehtoa. Yritys voi ajaa LongCat-2.0:aa omilla palvelimillaan, hienosäätää sitä omaan käyttöön ja välttää kalliit rajapintamaksut, joita OpenAI:n ja Anthropicin mallit perivät. Koodausmallin osaaminen heijastuu suoraan ohjelmistotyön tuottavuuteen.

Laajemmin kyse on avoimien mallien kilpajuoksusta. Kiinalaiset laboratoriot ovat viime kuukausina julkaisseet avoimia malleja tahdilla, joka painostaa myös länsimaisia toimijoita. Jokainen ilmainen ja ladattava huippumalli laskee rimaa sille, mitä yritysten kannattaa maksaa suljetuista vaihtoehdoista.

1,6 biljoonaa

Parametria mallissa

59,5 %↑

SWE-bench Pro -tulos

Build Fast with AI

Sanasto

Mixture-of-experts
Mallirakenne, jossa valtavasta mallista aktivoituu kerrallaan vain pieni osa "asiantuntijoita" kuhunkin tehtävään. Näin iso malli pysyy ajokustannuksiltaan kohtuullisena.
SWE-bench Pro
Testi, jolla mitataan tekoälymallin kykyä ratkaista aitoja ohjelmointiongelmia oikeista koodivarastoista. Mitä korkeampi prosentti, sitä parempi malli on koodaajana.

Arviointi siirtyy brändeistä numeroihin

LongCat-2.0:n tarina kertoo yhtä paljon tekoälyn arviointikulttuurista kuin itse mallista. Kun malli voi nousta kärkeen nimettömänä, painoarvo siirtyy markkinoinnista mitattuun suoritukseen. Se on hyvä uutinen kaikille, jotka haluavat valita työkalunsa todellisen osaamisen eikä logon perusteella.

Pöllö osoittautui kissaksi, mutta kynnet olivat aidot.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Datakeskukset Suomessa – hankkeet, sähkö ja vero
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat
  5. 5Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.