Jelenleg, ha valaki AI alapú hanggenerálásra adná a fejét, az első és legjobb ajánlat kétség kívül az ElevenLabs szolgáltatás. Itt a legjobb minőségű TTS, Speech to text és egyéb eszközök állnak rendelkezésünkre ahhoz, hogy szövegből hangot, hangból szöveget kreáljunk, megtévesztően emberi minőségben. Emellett klónozhatunk is hangot, megváltoztathatjuk egy felvételen a beszéd jellemzőit, készíthetünk hangoskönyvet, hangeffekteket, vagy éppen zenét. Mindezt meglepően egyszerűen és kifejezetten jó minőségben. Csak hát az ElevenLabs nem ingyenes, ráadásul az anyagok feldolgozása távoli szervereken történik, így adatbiztonság szempontjából sem mindenki számára tökéletes. Van azon egy izgalmas – bár még erősen készülőben lévő – eszköz, amely az ElevenLabs sok funkcióját átülteti offline megoldásként a számítógépre. Windows, macOS és Linux alatt egyaránt használható, ráadásul díjmentesen. Lássuk, melyik ez az ingyenes ElevenLabs-alternatíva amely a saját gépünkön működik, s miként teljesít a hangklónozás, diktálás és videószinkron terén.
VoiceStudio: ingyenes ElevenLabs-alternatíva a saját gépen
Az VoiceStudio egy nyílt forráskódú program, amely hanggenerálást, hangklónozást, diktálást, videók automatikus szinkronizálását, hangoskönyvek készítését és több más AI-alapú hangfunkciót kínál, ráadásul mindezt alapvetően helyben, a saját gépünkön futtatva. Használatához így alapvetően nincs szükség felhő alapú AI megoldásokra vagy API-kulcsra, szinte minden funkcióhoz offline AI modelleket használ. A program és az abban használható modellek ingyenesek, s mivel minden a számítógépünkön fut, az adatbiztonság kérdését is kipipálhatjuk.
Mindez elég jól hangzik így leírva, hiszen kapunk egy teljesen ingyenes ElevenLabs alternatívát, de azért a dolognak vannak korlátai is: először is elég erős gép kell hozzá, hiszen a modellek nem távoli szerverparkon futnak, hanem a gépünkön. Másodszor pedig azért akadnak egyelőre hiányosságok és minőségbeli különbségek jócskán az ElevenLabs képességeihez képest. Előbbin nem, utóbbin viszont segíthet majd hosszú távon, hogy a program jelenleg erőteljesen fejlesztési fázisban van.
Mindenesetre az VoiceStudio jóval több egy egyszerű szövegfelolvasónál vagy leiratozónál. A program többféle MI-modellre támaszkodva teszi elérhetővé a legfontosabb funkciókat. Alkalmazhatjuk többek között szövegek felolvasására és hangfájllá alakítására, amihez használhatunk kész szövegfájlokat, vagy akár a felületen is beírhatjuk a felolvasandó szöveget. A szövegben szünetet, reakciókat is jelölhetünk, hogy minél élethűbb legyen a végeredmény.
Lehetőség van hangok klónozására is, így például saját hangunkkal készült korábbi felvételből, vagy akár frissen, a programban készített hangfelvételből tudja klónozni a hangunkat, így a felolvasásokat akár a saját hangunkkal is elkészíthetjük.
De létrehozhatunk teljesen új mesterséges hangokat, van beszédfelismerés, automatikusan szinkronizáltathatunk videókat, vagy éppen létrehozhatunk hangoskönyveket is. Ezen funkciók között van pár, ahol több beszélő elkülönítése is megoldható, így több szereplős történetek megszólaltatását is megoldhatjuk vele, szimpla szöveges forgatókönyvből.
A TTS és ASR motorok mellett munkára foghatunk helyi LLM modelleket is, például azért, hogy lefordítsanak szövegeket, amelyekből aztán elkészülhetnek a hanganyagok.
Az egyik leglátványosabb lehetőség természetesen a Voice Cloning, akár egy néhány másodperces hangminta is elegendő lehet ahhoz, hogy a rendszer sikeresen reprodukálja az adott beszélő hangját. Ehhez nem feltétlenül kell külön modellt betanítanunk. A VoiceStudio alapértelmezett motorja zero-shot hangklónozást használ, vagyis egy rövid referenciafelvételből próbálja előállítani az adott hang karakterét. Mások hangjának klónozására azért csak engedéllyel használjuk, de saját hanggal kifejezetten érdekes lehetőség, hiszen készíthetünk például narrációt egy videóhoz anélkül, hogy minden egyes változatot külön fel kellene mondanunk.
Az VoiceStudio elvileg több mint 600 nyelvet támogat, de ez azért nem jelenti azt, hogy minden nyelven és minden hanggal ugyanazt a minőséget kapjuk. A különféle beépíthető motorok támogatása jelentősen eltér és hát lássuk be, a magyar nyelvvel azért még akadnak gondok ebből a szempontból. Az angol, francia, német és más elterjedt nyelvek viszont nagyon jó minőségben működnek a programmal, s ha kell, azért magyar nyelvű hanganyagok is előállíthatók vele.
A beszédfelismerés terén jobb a helyzet, ott az e célra használt Whisper és Parakeet modellek egészen hatékonyan ismerik fel a magyar nyelvű felvételeket is a leiratozáskor. Mondjuk az éppen tesztelt verzió a hangfelvételek végén azonnal összeomlott, de a leiratot még előtte mentette, így az a legközelebbi indításkor ott várt minket a felületen. Ebből is látszik, hogy még erősen fejlesztési állapotban vagy a program, így simán előfordulnak efféle gondok. Ezeket aztán vagy javítják a következő buildben, vagy átmenetileg továbbiakat is elrontanak, de ez már csak így megy. Lényeg, hogy majd az első hivatalos kiadás tökéletes legyen. Ezzel kapcsolatban érdekesség, hogy a program beépített hibakeresőt és naplózást is kapott, így a legtöbb probléma oka gyorsan kideríthető. Más kérdés, hogy ezzel maga a felhasználó nem feltétlenül jut előbbre, viszont a fejlesztőkkel megosztva a tapasztalatokat, hozzájárulhatunk, hogy a végső verzió majd közel tökéletes lehessen.
Visszatérve az izgalmas funkciókhoz. A klónozás ugyebár ez egyik ilyen, de nem feltétlenül kell valódi személy hangját lemásolnunk. A Voice Design funkcióval új mesterséges hangokat is kialakíthatunk. Többek között a nemet, életkort, akcentust, hangmagasságot, beszédsebességet, érzelmi karaktert és dialektust is meghatározhatjuk. Videós narrációkhoz, podcastokhoz, játékokhoz vagy demonstrációs anyagokhoz igencsak praktikus lehet, ha nem szeretnénk egy konkrét személy hangját használni. Az elkészített hangprofilok ráadásul hordozhatók is. A program .ovsvoice csomagokba képes exportálni őket, így később más VoiceStudio telepítésben is felhasználhatók.
Szintén nagyon izgalmas lehetőség a Video Dubbing funkció. Az alkalmazásba betölthetünk videofájlt, de akár YouTube-linket is megadhatunk. Ezeket feldolgozva a program aztán képes felismerni a videóban elhangzó beszédet – ehhez a Demucs technológiával megpróbálhatja elkülöníteni a beszédet a zenétől és más háttérhangoktól – és elkészíteni annak leiratát, lefordítani a szöveget, mesterséges hanggal újragenerálni a megszólalásokat, végül visszailleszteni az új hangsávot a videóba.
Végül itt van még az Audiobook Editor, amely kifejezetten a hosszabb dokumentumok kezelésére készült. Betölthetünk egyszerű szöveget, EPUB vagy PDF dokumentumot, amelyet a program automatikusan fejezetekre bonthat, majd mesterséges hanggal felolvashat. A kész anyaghoz metaadat és borítókép is rendelhető, a végeredmény pedig fejezetekre bontott M4B hangoskönyvként exportálható. A különálló Stories szerkesztő ennél tovább megy: itt az egyes sorokhoz más-más hangot rendelhetünk, így akár egy több szereplős történetet is létrehozhatunk úgy, hogy minden karakter más mesterséges hangon szólaljon meg.
Az VoiceStudio amúgy a mindennapi munkában is használható hangbevitelre. A beépített Dictation Widget globális billentyűparanccsal hívható elő (alapértelmezésben például Command + Shift + Space Macen). Ilyenkor elkezdhetünk beszélni, a helyben futó beszédfelismerő pedig szöveggé alakítja az elhangzottakat, majd automatikusan beillesztheti az aktuálisan használt alkalmazásba. Így az VoiceStudio akár a macOS vagy a Windows beépített diktálási lehetőségének alternatívájaként is használható, jóval nagyobb pontossággal, mint amire a macOS képes. Mondjuk ez nálunk szintén a program összeomlásához vezetett, de biztosak vagyunk benne, hogy pár verzióváltás alatt ezt a hibát gyorsan kijavítják majd. Érdekesség viszont, hogy a diktálás eredményét egy opcionálisan helyben futó LLM megtisztíthatja, vagyis korrigálhatja a központozást vagy eltávolíthatja a beszéd közben használt töltelékszavakat.
A modelleket csak akkor kell telepíteni, amikor szükségünk van rájuk
Az a helyzet, hogy ha a program által támogatott összes AI modellt telepíteni kellene, tekintélyes tárhelyet emésztene fel. Szerencsére az VoiceStudio moduláris felépítésű, így nem kell rögtön minden AI-modellt letöltenünk, hanem elég a szükséges TTS és ASR motorokat leszedni. Az VoiceStudio a hardverünk alapján igyekszik segíteni is, hogy melyik változatot érdemes telepíteni.
Bár a fő vonulat a teljesen offline munka, azért a program saját MCP szervert is kínál, így például Claude, Cursor vagy más Model Context Protocolt támogató alkalmazás is használhatja az VoiceStudio helyi beszédgeneráló és beszédfelismerő képességeit. Ez különösen érdekes lehet automatizált munkafolyamatoknál: egy AI-asszisztens így például szöveget generálhat, majd a VoiceStudio segítségével helyben hangfájlt is készíthet belőle anélkül, hogy külön TTS API-t kellene igénybe vennie egy felhő alapú megoldástól.
Az VoiceStudio támogatja a Meta AudioSeal technológiáját, amely láthatatlan – vagy inkább hallhatatlan? – digitális vízjelet képes elhelyezni az AI által generált hanganyagban, ami jó esetben akár a hanganyag újratömörítését is túlélheti, így később ellenőrizhető, hogy egy hangfelvétel mesterségesen előállított tartalom-e. Ez a klónozási funkció miatt igencsak örvendetes opció.
Szerzői vélemény: tartsuk szem előtt, hogy egyelőre béta
Mint azt a bevezetőben is írtam, a VoiceStudio egyelőre fejlesztési fázisban van, így a funkciók verziónként elromolhatnak, újra megjavulhatnak, cserélődhetnek. Ezt leszámítva egy halom lehetőség már most is nagyszerűen használható a programban.
Azt nem merném kijelenteni, hogy a felület tökéletesen átláthatóra sikeredett. Sok funkció esetében kifejezetten ismerkedni kell a felépítéssel és a használattal, de a lényegi dolgok gyorsan elsajátíthatók. Ráadásul a modellek telepítésében elég sok segítséget ad maga a program: azok beszerzésével nem kell külön törődni. Egy-két kattintással letölti és telepíti a kiválasztottakat.
Tökéletesen kiváltja az ElevenLabs funkciót? Egyelőre biztosan nem. Használható? Már most is! Még nem tökéletes, sok a hiba és minden bizonnyal nincs is még benne minden tervezett funkció, de már jelen állapotában is érdemes lehet vele megismerkedni. Kellően erős gépen kifejezetten praktikus eszköztárat kínál a narrációk, hangoskönyvek készítésére, leiratozásra, vagy épp videók hangsávjának lecserélésére.










