Tekoäly

Claude tarkistaa nyt GPT:n kotitehtävät

Microsoftin Copilot Researcher ajaa kilpailevia malleja yhteen

Aino AikajärviAino Aikajärvi
Jaa:
Claude tarkistaa nyt GPT:n kotitehtävät

Microsoft julkisti maanantaina kaksi uutta ominaisuutta Copilot Researcher -tutkimustyökaluunsa. Critique-tilassa OpenAI:n GPT tuottaa tutkimusraportin ja Anthropicin Claude arvioi sen laadun. Council-tilassa molemmat mallit tekevät oman raporttinsa, ja erillinen arvioijamalli vertailee tuloksia.

Uudistus on merkki siitä, että tekoälyala siirtyy yksittäisten mallien kilpailuttamisesta mallien väliseen yhteistyöhön. Microsoftin oman DRACO-vertailukokeen mukaan Critique paransi tutkimusraporttien tarkkuutta lähes 14 prosenttia verrattuna markkinoiden parhaaseen kilpailijaan.

Kirjoittaja ja kriitikko

Critique erottaa raportin kirjoittamisen ja arvioinnin toisistaan. Ensimmäisessä vaiheessa GPT suunnittelee tutkimustehtävän, hakee tietoa useista lähteistä ja tuottaa raportin ensiversion. Toisessa vaiheessa Claude astuu kriitikon rooliin.

Claude arvioi raportin kolmella akselilla: ovatko lähteet luotettavia, kattaako raportti aiheen riittävän laajasti ja perustuvatko väitteet todella käytettyihin lähteisiin. Jos Claude löytää puutteita, se merkitsee ne ja ehdottaa korjauksia. Vasta kun tarkistus on valmis, käyttäjä saa lopputuloksen.

Käytännössä jokainen Copilot Researcherilla tehty tutkimus käy kahden mallin käsittelyn läpi. Critique on oletusasetus automaattisessa mallivalinnassa, joten käyttäjän ei tarvitse itse tietää prosessista mitään. Malli muistuttaa perinteistä toimitustyötä, jossa toimittaja kirjoittaa ja toimitussihteeri tarkistaa – ero on siinä, että molemmat osapuolet ovat tekoälymalleja eri yhtiöistä.

Kaksi raporttia, yksi yhteenveto

Council toimii toisella periaatteella. GPT ja Claude tuottavat kumpikin itsenäisen raportin samasta aiheesta samanaikaisesti. Erillinen arvioijamalli lukee molemmat ja koostaa yhteenvedon.

Yhteenvedossa arvioija nostaa esiin kohdat, joissa mallit ovat samaa mieltä, ja merkitsee ne, joissa näkemykset eroavat. Käyttäjä saa raporttien lisäksi eräänlaisen kansilehden, joka kertoo kuinka yhteneväisiä mallien vastaukset ovat. Kahden riippumattoman mallin konsensus antaa käyttäjälle paremman pohjan arvioida tulosten luotettavuutta kuin yhden mallin vastaus yksinään.

Lähes 14 prosentin parannus

Microsoft mittasi Critiquen tehon DRACO-vertailukokeella. DRACO sisältää sata vaativaa tutkimustehtävää kymmeneltä eri alalta, ja vastaukset arvioidaan neljällä akselilla: faktojen oikeellisuus, analyysin syvyys ja laajuus, esityksen laatu sekä lähdeviittausten laatu.

Vertailukohdaksi valittiin Perplexityn Deep Research, joka nojaa Anthropicin Claude Opus 4.6 -malliin ja jota on pidetty alan parhaana tutkimusjärjestelmänä. Critique ylitti sen kokonaispisteissä 7,0 pisteellä eli 13,88 prosentilla. Parannus näkyi kaikissa neljässä kategoriassa: analyysin syvyydessä ja laajuudessa (+3,33 pistettä), esityksen laadussa (+3,04) ja faktojen oikeellisuudessa (+2,58). Kymmenestä testatusta alasta kahdeksalla tulos oli tilastollisesti merkitsevä.

Claude toimi vertailukokeessa kahdessa roolissa: Perplexityn järjestelmässä se hoiti tutkimuksen yksin, Microsoftin järjestelmässä se toimi kriitikkona GPT:n rinnalla. Jälkimmäinen yhdistelmä osoittautui paremmaksi.

Kilpailijoista työkavereita

Microsoftin ratkaisu kuvastaa laajempaa muutosta tekoälyalalla. Yhtiöt eivät enää kilpaile pelkästään sillä, kenen yksittäinen malli on paras. Sen sijaan parannuksia haetaan mallien yhteistyöstä, myös kilpailijoiden mallien kanssa.

Asetelma on erikoinen. Microsoft on OpenAI:n suurin sijoittaja, mutta maksaa nyt myös Anthropicille siitä, että Claude tarkistaa OpenAI:n mallin tuotoksia. Aiemmin tekoäly-yhtiöt kohtelivat mallejaan kärkituotteina, joita ei sekoiteta kilpailijoiden kanssa. Nyt niitä kohdellaan pikemminkin kuin erikoistuneita asiantuntijoita, joista kukin hoitaa oman tehtävänsä.

Yrityskäyttäjille muutos näkyy parempina tuloksina ilman lisätyötä. Taustalla tapahtuva mallien välinen tarkistusprosessi on käyttäjälle näkymätön. Suomalaisille Microsoft 365 -käyttäjille uudistus tarkoittaa käytännössä sitä, että Copilotin tuottamat tutkimusraportit ovat jatkossa tarkempia ja paremmin lähteistettyjä.

Molemmat ominaisuudet ovat nyt saatavilla Microsoftin Frontier-ohjelmassa, joka on yhtiön edelläkävijäohjelma suurille Copilot-asiakkaille. Laajemmin ajateltuna monimalliarkkitehtuuri voi muuttaa koko tekoälyalan dynamiikkaa: jos parhaat tulokset syntyvät mallien yhteistyöstä, kilpailijoista tulee väistämättä myös toistensa yhteistyökumppaneita.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Luetuimmat

Viimeiset 7 päivää

  1. 120 vuotta koodaamatta, sitten 5,4 miljoonaa
  2. 2Teemu Roos: tekoälyn tuhopuheissa voi olla kyse rahasta
  3. 3Mikä on Jev? Tekoälymalli, joka päättää eikä kirjoita
  4. 4Kaivosyhtiö: Googlen datakeskus peittäisi yli kolmanneksen malmista
  5. 5Mediakonserni osti suomalaisen tekoälyn, joka lukee julkiset hankinnat

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.