Tekoäly

ChatGPT vaihtoi mallia – hallusinaatiot puolittuivat

GPT-5.5 Instant vastaa 30 % lyhyemmin ja erehtyy 52,5 % harvemmin.

Aino AikajärviAino Aikajärvi
Jaa:
ChatGPT vaihtoi mallia – hallusinaatiot puolittuivat
Kuva: HaeB / CC BY-SA 4.0

OpenAI vaihtoi 5. toukokuuta ChatGPT:n oletusmallin GPT-5.5 Instantiksi. Yhtiön mukaan uusi malli tuottaa 52,5 prosenttia vähemmän hallusinoituja väitteitä korkean panoksen aiheissa, kuten lääketieteessä, juridiikassa ja taloudessa, kuin sitä edeltänyt GPT-5.3 Instant. Vastaukset myös lyhenivät esimerkkimittauksissa noin 30 prosenttia.

Päivitys koskee jokaista, joka avaa ChatGPT:n. Maksuton versio sai saman oletusmallin kuin Plus ja Pro, mutta tilaajien web-versioon tuli erikseen muistihaku, joka voi hakea taustaksi tietoja käyttäjän Gmailistä, ladatuista tiedostoista ja aiemmista keskusteluista. Ominaisuus laajenee myöhemmin Free-, Go-, Business- ja Enterprise-käyttäjille.

Hallusinaatiot vähenivät erityisesti riskialttiissa aiheissa

OpenAI:n vertailussa korkean panoksen kysymyksinä olivat muun muassa lääkkeiden yhteisvaikutukset, sopimusehdot ja verotuskäytännöt. Tällaisissa kysymyksissä uusi malli keksi väitteitä 52,5 prosenttia vähemmän kuin edeltäjänsä. Erikseen mitattuna keskusteluissa, joissa käyttäjä oli aiemmin merkinnyt vastauksen virheelliseksi, epätarkkojen väitteiden määrä laski 37,3 prosenttia.

Riski ei silti poistu. Yli puolet entisistä virheistä jää, ja yksittäinen keksitty viittaus lääkeannokseen, oikeustapaukseen tai pörssikurssiin voi johtaa vahinkoon. OpenAI ei ole julkaissut riippumatonta testidataa, johon luvut perustuvat, joten kolmannen osapuolen vahvistus puuttuu toistaiseksi. ChatGPT:n vastaus pysyy edelleen lähtökohtana, ei lopputuotteena.

Lyhyemmät vastaukset ja paremmat testitulokset

OpenAI on saanut käyttäjäpalautetta, että ChatGPT käytti usein liikaa väliotsikoita, ranskalaisia viivoja ja toistoa. GPT-5.5 Instantia on viritetty tiiviimmäksi. Yhtiön esimerkkimittauksissa malli käytti samaan tehtävään 30,2 prosenttia vähemmän sanoja ja 29,2 prosenttia vähemmän rivejä kuin edeltäjänsä, ja Tom's Guiden testaaja totesi muutoksen näkyvän heti vastauksen sävyssä.

Suorituskyky parani myös benchmark-testeissä. AIME 2025 -matematiikkakokeessa uusi malli sai 81,2 pistettä, kun GPT-5.3 Instantin tulos oli 65,4. Multimodaalisen päättelyn MMMU-Pro-testissä pisteet nousivat 69,2:sta 76:een. Kehittäjille malli on saatavilla rajapintaan nimellä chat-latest, ja vanha GPT-5.3 Instant säilyy maksavien tilaajien valittavissa kolmen kuukauden ajan.

Muistihaku ja GDPR

Muistihaku ulottuu Plus- ja Pro-käyttäjien Gmail-postilaatikkoon, mikä on EU:ssa erityishuomion paikka. Tietosuoja-asetus edellyttää, että käyttäjä tietää, mitä henkilötietoja palvelu käsittelee ja mihin tarkoitukseen.

OpenAI vastaa tähän osittain uudella muistilähde-näkymällä, jossa käyttäjä näkee, mitkä aiemmat keskustelut tai sähköpostit ovat olleet vastauksen pohjana ja voi poistaa tai korjata tiedot. Suomen tietosuojavaltuutetun toimisto ei ole toistaiseksi kommentoinut päivitystä.

Anthropic ja Google ovat valinneet eri painotukset

Hallusinaatioiden hillitsemisessä OpenAI:n kilpailijat ovat valinneet osin eri reittejä. Anthropicin Claude-mallit on opetettu tunnustamaan epävarmuus ja kieltäytymään vastaamasta, kun lähdedata ei riitä. Googlen Gemini taas tukeutuu epävarmoissa kysymyksissä Google-hakuun: malli näyttää lähdelinkit ja merkitsee, mikä kohta on haetusta tekstistä peräisin.

GPT-5.5 Instantin painotus on kolmas: pidetään malli nopeana ja tavoitellaan vähemmän virheitä yleistettävillä parannuksilla, ei pelkästään lähdeintegraatiolla. Käyttäjän kannalta erot näkyvät arjen yksityiskohdissa: Geminin vastauksissa on enemmän linkkejä, Claude kertoo herkemmin, ettei tiedä, ja ChatGPT vastaa lyhyemmin ja enemmän asiaan.

−52,5 %↓

Hallusinoidut väitteet korkean panoksen aiheissa

−30 %↓

Vastausten pituus lyhentyi

81,2↑

AIME 2025 -pisteet (oli 65,4)

OpenAI: GPT-5.5 Instant

Sanasto

Hallusinaatio
Tekoälyn tuottama virheellinen mutta vakuuttavalta kuulostava väite – esimerkiksi keksitty oikeustapaus, väärä lääkeannos tai olematon lähdeviite.
Benchmark
Vertailutesti, jolla mitataan tekoälymallien suorituskykyä esimerkiksi matematiikassa tai päättelyssä. Mahdollistaa eri mallien vertailun samoilla tehtävillä.
Multimodaalinen
Tekoälyn kyky käsitellä samalla mallilla useita syötetyyppejä – tekstiä, kuvia, ääntä ja videota.

Mitä tämä merkitsee suomalaiselle käyttäjälle

Suomessa ChatGPT on käytetyin yleiskäyttöinen tekoälypalvelu. Moni asiantuntija käyttää sitä päivittäin tausta-ajoon, käännöksiin ja sähköpostien runkoon. Lyhyemmät vastaukset säästävät lukijalta aikaa, ja virheellisten väitteiden putoaminen alle puoleen vähentää tarkistustyötä erityisesti ammattilaisilla, jotka käyttävät ChatGPT:tä juridiikan tai terveysalan tausta-ajoon.

Käytännön työpäivässä muutos näkyy rytmissä: kun ChatGPT vastaa neljän kappaleen sijaan kahdella, vastauksen ehtii silmäillä kahvitauolla. Lääkärin tai juristin pöydällä tämä on hyödyllinen muutos, mutta ei syy poistaa tarkistusvaihetta. Hallusinaation puolittuminen ei ole sen poistuminen, ja seuraavan virheen voi tehdä uusikin malli.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 1Saloon nousee 2 miljardin datakeskus sokeritehtaan viereen
  2. 2Robotit hyppäsivät sulaan teräkseen Imatralla
  3. 3Datakeskukset Suomessa – hankkeet, sähkö ja vero
  4. 4Kunta antoi johtajien työt tekoälylle – nyt asia on poliisilla
  5. 5Eurooppa jarruttaa datakeskuksia – Suomessa kunnat kosivat yhä

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.