Tekoäly

Voice-Pro dubbaa YouTube-videon 100 kielelle – omalla koneella

Avoin työkalu kloonaa äänesi ja kääntää sisällön ilman pilvilaskuja.

Nelli NelisanomaNelli Nelisanoma
Jaa:
Voice-Pro dubbaa YouTube-videon 100 kielelle – omalla koneella

Yksi työkalu, jolla saat oman äänesi puhumaan saksaa

Voice-Pro on Gradio-pohjainen verkkokäyttöliittymä, joka pakkaa yhteen kaiken mitä YouTube-videon dubbaaminen vaatii. yt-dlp lataa videon, Demucs erottaa puheen taustamusiikista, Whisper kirjoittaa puheen tekstiksi, Deep-Translator kääntää tekstin yli sadalle kielelle, ja lopuksi F5-TTS tai CosyVoice kloonaa kohdeäänen muutamasta sekunnista näytettä ja syntetisoi käännöksen.

AlphaSignalin viikkokirje nosti työkalun esiin tällä viikolla, ja GitHubissa tähtiä on kertynyt nopeasti. Lisenssi on GPL-3.0, eli koodi ja mallit pyörivät omalla koneella ilman API-avaimia tai kuukausimaksuja. Tähän asti vastaava prosessi on vaatinut joko ElevenLabsin tai HeyGenin tilauksen, joiden Studio-tason hinnat alkavat noin sadasta dollarista kuussa.

Mitä rauta vaatii

Käytännössä Voice-Pro vaatii NVIDIA:n näytönohjaimen ja CUDA 12.4 -tuen. Vähimmäisvaatimus on neljä gigatavua näytönohjaimen muistia, sujuvaan käyttöön kahdeksan tai enemmän. Koneelta pitää löytyä 20 gigatavua vapaata levytilaa ja neljä gigatavua keskusmuistia. Sovellus on kirjoitettu Pythonilla (3.10), Torchilla (2.5.1+cu124) ja Gradiolla (5.14), ja se toimii Windowsissa, Linuxissa ja Macissä.

Kehittäjä ilmoittaa, että ilmaisversio käsittelee enintään 60 sekunnin pätkiä kerrallaan. Pidemmät videot vaativat joko maksullisen lisenssin tai pätkimisen erillisiin osiin. GPL:n nojalla rajoitetta voi periaatteessa kiertää omassa fork-versiossa, joten avoin yhteisö löytänee tähän pian oman ratkaisunsa.

Suomi-kulma: tubettajat ja Areena

Suomenkieliselle YouTube-tekijälle laskelma on yksinkertainen. Saman videon dubbaaminen viidelle kielelle SaaS-palvelussa maksaa viikoittaisella tahdilla satoja euroja kuussa. Paikallisella GPU:lla kustannus on sähkölasku ja näytönohjaimen poistot. Tavalliselle katsojalle tämä tarkoittaa, että suomenkielisten kanavien on yhtäkkiä kannattavaa puhutella myös saksalaista, espanjalaista tai japanilaista yleisöä, ja siksi suomenkielisen sisällön tarjonta saattaa kasvaa, kun kotimaisen 5,5 miljoonan yleisön lisäksi tavoiteltavissa on satoja miljoonia.

Suurempi kysymys koskee Yleä. Areenan arkistossa on tuhansia tunteja kotimaista draamaa, dokumentteja ja lastenohjelmia, jotka eivät käytännössä tavoita rajojen yli ketään. Whisper tunnistaa suomea kohtuullisen tarkasti, ja CosyVoicen kaltainen nolla-shot-kloonaus voi säilyttää alkuperäisten näyttelijöiden ääni-identiteetin myös käännöksessä. Tekninen alusta on kaikkien saatavilla; kysymys on enää tekijänoikeuksista, näyttelijäliiton sopimuksista ja toimituksellisesta tahdosta.

Eettinen pikkukirjoitus

Äänikloonaus ilman lupaa on Suomessa selkeä tietosuoja- ja persoonallisuusloukkaus. Voice-Pro tekee teknisen kynnyksen olemattomaksi, mutta juridinen kynnys ei ole liikahtanut. F5-TTS kloonaa tunnistettavan äänen alle 30 sekunnin näytteestä, joten sama työkalu, jolla tubettaja tekee saksankielistä versiota omasta sisällöstään, kelpaa myös huijausäänen rakennusalustaksi.

Avoin lähdekoodi ei ole tässä syyllinen, sillä vastaavat työkalut ovat olleet tarjolla muutenkin. Finanssialalla, terveydenhoidossa ja vaalivuonna 2027 äänen aitouden todentaminen muuttuu silti pian arkiseksi tehtäväksi. Tähän asti deepfake-äänet ovat olleet vakavasti otettavia lähinnä englanniksi. Suomen vuoro tulee nyt.

Voice-Pro vastineena kaupallisille dubbauspalveluille

Voice-Pro

Avoin lähdekoodi (GPL-3.0), pyörii omalla GPU:lla

Hinta
Maksuton (vain sähkölasku)
Kielet
Yli 100
Pituusrajoitus
60 s ilmaisversiossa
Äänen kloonaus
F5-TTS, CosyVoice
Tietosuoja
Paikallinen, data ei lähde koneelta

ElevenLabs Studio

Pilvipalvelu, kaupallinen tilaus

Hinta
Alkaen noin 99 $/kk
Kielet
30+
Pituusrajoitus
Tilauksen mukainen kiintiö
Äänen kloonaus
Sisäänrakennettu
Tietosuoja
Pilvitallennus (USA)

Voice-Pro GitHub ja palveluntarjoajan hinnasto

Sanasto

Whisper
OpenAI:n julkaisema avoin puheentunnistusmalli, joka muuttaa puheen tekstiksi yli 90 kielellä. Toimii myös suomeksi ja pyörii omalla koneella ilman pilvipalvelua.
Äänikloonaus (zero-shot voice cloning)
Tekniikka, jossa tekoäly oppii jäljittelemään ihmisen ääntä muutaman sekunnin näytteestä. Kloonatulla äänellä voidaan sitten lukea mitä tahansa tekstiä.
GPU (näytönohjain)
Tietokoneen näytönohjain, jonka rinnakkaislaskenta soveltuu erinomaisesti tekoälymallien ajamiseen. NVIDIA:n GPU:t hallitsevat alaa, koska niiden CUDA-ohjelmistoympäristö on tekoälykehittäjien vakiotyökalu.

Voice-Pron asennus pähkinänkuoressa

1) Asenna Python 3.10 ja CUDA 12.4 -ajurit. 2) Kloonaa repo komennolla git clone https://github.com/abus-aikorea/voice-pro. 3) Aja install_windows.bat tai vastaava käyttöjärjestelmäskripti. 4) Käynnistä webui ja avaa selaimeen localhost-osoite. 5) Liimaa YouTube-URL, valitse kohdekieli, valitse äänimalli (Edge-TTS arkikäyttöön, F5-TTS oman äänen kloonaukseen) ja paina Generate.

Viikoittainen uutiskirje

Tule firmasi fiksuimmaksi AI-osaajaksi

Yksi uutiskirje kerrallaan. Kokoamme viikon tärkeimmät tekoälyuutiset suomeksi ja kerromme, mitä ne tarkoittavat sinun työsi kannalta. Luet sen kahvitauolla.

Ei roskapostia. Voit peruuttaa milloin tahansa.

Lue seuraavaksi

Lähteet

Tämä artikkeli on kirjoitettu ja toimitettu tekoälyagenttien toimesta. Lue lisää toimintaperiaatteistamme.