Nem is olyan régen írtunk egy rendkívül izgalmas alkalmazásról, amely egészen hatékonyan tudja helyettesíteni a népszerű ElevenLabs eszközöket, méghozzá úgy, hogy a feldolgozandó hangfelvételek vagy szövegek nem hagyják el a gépünket. Mindezt ráadásul ingyen, Windowson, macOS-en és Linuxon egyaránt. Az ElevenLabs-hoz hasonlóan népszerű AI eszköz a Wisprflow is, amely felhő alapú megoldásként tudja röptében írott szöveggé alakítani azt, amit éppen diktálunk a gépnek, több nyelven, és igencsak jó hatékonysággal. Ám az a helyzet, hogy ennek kiváltására is tudunk ajánlani alternatívát. Íme egy ingyenes program diktáláshoz helyi AI modellekkel, amely ráadásul több rendszeren is használható, így WIndowson, macOS-en vagy iOS-en egyaránt beüzemelhetjük.
TypeWhisper: sokoldalú offline Wisprflow alternatíva
A különféle speech-to-text alkalmazások, amelyek a diktált szöveget írott anyaggá alakítják, nem ma kezdték pályafutásukat, ám az biztos, hogy elődeikhez képest jelentősen nőtt a teljesítményük, mióta a generatív mesterséges intelligencia meghódította a világot. Jelenleg a legnépszerűbb megoldás kétség kívül a Wisprflow, de az a helyzet, hogy nem feltétlenül van szükség havi előfizetésre és a hangfelvételek felhőbe küldésére ahhoz, hogy bármikor diktálhassunk a számítógépnek.
Itt van rögtön a TypeWhisper, amely egy cross-platform megoldás, vagyis Windowson, macOS-en és iOS-en egyaránt használható. Mondjuk iOS alatt kissé korlátozottabbak a lehetőségei, de macOS-en és Windowson hihetetlenül kényelmes és hatékony a működéséhez letölthető – szintén ingyenes – Parakeet TDT modellel. Apple környezetben amúgy az Apple Speech is használható, így megúszhatjuk modell-telepítés nélkül, de magyar nyelven a Parakeet TDT hozza csak az elvárt formát. Emellett pedig még bevethetjük – szintén egy kattintásos telepítéssel – a WhisperKitet is.
A program lehetőséget ad felhő alapú megoldások – OpenAI, ElevenLabs, Reson8, Soniox, Groq – használatára is, de ebben az esetben már saját API kulcsra is szükségünk lesz, s persze ezzel együtt veszik az ingyenesség (az API-k kivétel nélkül fizetősek) és a privát, helyi feldolgozás is, hiszen minden felvétel azonnal megy a felhőbe, s ott kerül feldolgozásra. Cserébe ez egy gyorsabb és hatékonyabb eljárás.
Míg iOS alatt csak a program felületén hozhatunk létre leiratokat, amelyeket aztán kényelmesen tovább másolhatunk onnan, addig macOS és Windows alatt a diktálást bármely program ablakának tetszőleges szövegmezőjében elkezdhetjük. Csak kattintsunk bele a kívánt szövegmezőbe (kitöltendő űrlapon, szövegszerkesztőben, jegyzetelőben stb.) és nyomjuk le a TypeWhisper felvételhez rendelt billentyűkombinációját. Ez egyébként kétféle is lehet: van lehetőség egyszeri lenyomással elindítani folyamatos felvételt, vagy a Push-to-talk opciót beállítva azt is megoldható, hogy csak akkor rögzítse a hangot a program, amikor a kérdéses billentyűkombinációt épp lenyomva tartjuk.
Ilyenkor megjelenik egy kis visszajelző felület, amelyen láthatjuk menet közben is a felismert szöveg aktuális részletét, de ha végeztünk, a program automatikusan beszúrja a diktált szöveget az aktuális szövegmezőbe.
Érdekesség, hogy a program felületén a File Transcription részben korábban készünk hangfelvételeket, hangfájlokat is leiratoztathatunk. Emellett ott van még a Recorder funkció is, amellyel akár egy komplett megbeszélés szövegét is kényelmesen rögzíthetjük. A hanganyagból aztán a program elkészíti a leiratot is, így meglesz a megbeszélés hanganyaga és szöveges átirata egyaránt. Sőt, további AI modelleket – offline és online egyaránt – is bevonhatunk a munkába az Integrations részben.
Ha valakinek még ez sem lenne elég, akkor a Dictionary részben lehetőségünk van a szövegek pontosabb feldolgozását segítő szótárak importálására, a Snippets részben pedig megadhatunk olyan rövid kifejezéseket, amelyeket a program automatikusan tud lecserélni a hozzájuk rendelt hosszabb szövegrészekre.
Az eddig felsoroltakat ingyen lehet használni, de a programnak van néhány Premium funkciója is, mint a meeting-emlékeztető, a javításokból történő önálló tanulás, a szótárak és töredékek szinkronizálása stb.
Használatához persze nem árt egy modernebb gép, hiszen itt a hanganyag feldolgozását nem egy bivaly erős szerverpark végzi, hanem a helyi CPU/GPU/NPU hardver. Szóval kellő mennyiségű (minimum 16 GB javasolt) RAM és egy modernebb CPU/GPU is jól jön, ha gyors eredményre vágyunk.








