▸ // spis treści
Przetestowałem w tym tygodniu kilka lokalnych generatorów głosu - Piper, Higgs, TADA, XTTS. Wygrał jeden: OmniVoice Studio.
Klonuję nim swój głos i generuję audio do wpisów tu, na damianslimak.pl. Lokalnie, na własnym Macu, bez wysyłania czegokolwiek do chmury.
To otwarta alternatywa dla ElevenLabs: 646 języków, klonowanie głosu, dubbing i dyktowanie, wszystko na Twoim komputerze.
Z tego artykułu dowiesz się:
- czym OmniVoice Studio różni się od chmurowych generatorów głosu i dlaczego to ma znaczenie,
- jak realnie używam go u siebie - klonuję głos i robię podcasty do artykułów,
- czy można go legalnie używać komercyjnie (licencja AGPL - sprawdziłem, zanim wrzuciłem to na produkcję).
Co to jest OmniVoice Studio
Otwarta aplikacja desktopowa autorstwa Palasha Debnatha, około 8900 gwiazdek na GitHubie. Sama się opisuje jako „otwarta alternatywa dla ElevenLabs".
Robi cztery rzeczy: klonuje głos, dubbinguje wideo, dyktuje na żywo i składa audiobooki. Wszystko chodzi lokalnie - Twój głos i teksty nie wychodzą z komputera.
Pod spodem to menedżer wielu silników (m.in. omnivoice, mlx-audio, sherpa-onnx). Wybierasz ten, który pasuje do Twojego sprzętu, i on ładuje właściwy model.

Co potrafi
Konkretnie, nie z ulotki:
- synteza mowy w 646 językach (transkrypcja w 99),
- klonowanie głosu z kilkusekundowej próbki,
- dubbing wideo,
- dyktowanie na żywo, czyli mowa na tekst,
- audiobooki, izolacja wokalu, rozdzielanie mówców.
Do tego wystawia lokalny serwer z API zgodnym z OpenAI oraz wiązania MCP. Prościej: podłączasz to pod agenta i sterujesz z kodu. Do tego zaraz wrócę, bo to właśnie robię u siebie.
Jak używam tego u siebie
Mam na blogu mechanizm, który z każdego artykułu robi audio-streszczenie - krótki podcast czytany moim głosem.
Cały łańcuch jest prosty:
- biorę gotowy wpis,
- piszę z niego skrypt mówiony,
- OmniVoice syntetyzuje go moim sklonowanym głosem, profil „Damian 001",
- gotowy plik audio ląduje przy artykule.
Sklonowanie głosu zajęło jedną krótką próbkę. Wygenerowanie dwuminutowego streszczenia - około czterdziestu sekund. Na moim Macu z układem M4 Pro silnik chodzi akcelerowany na GPU (MPS), nie tylko na procesorze. Testowałem to na własnym workflow, więc nie zgaduję.
Pułapka, w którą wpadają: biorą ciężki model klasy serwerowej, jak Higgs albo TADA (cztery, pięć miliardów parametrów, pisane pod karty NVIDIA), i dziwią się, że nie rusza na Macu. OmniVoice ma silniki dobrane pod Apple Silicon, więc po prostu działa.
Czy można go używać komercyjnie
Tak, i to sprawdziłem, zanim wrzuciłem go do produkcji.
Licencja to AGPL-3.0, a nota licencyjna mówi wprost: możesz używać wyników komercyjnie, sprzedawać wygenerowane audio, świadczyć usługi klientom i wdrożyć aplikację w firmie.
Jest jeden warunek, ale nie dotyczy zwykłego użytkownika. Jeśli zmodyfikujesz samą aplikację i udostępnisz tę wersję przez sieć, musisz otworzyć swój kod. Używasz jej lokalnie do generowania plików? Jesteś czysty. Model głosu pod spodem ma osobną licencję Apache 2.0, również przyjazną komercji.
Ja używam tego komercyjnie i na produkcji, na tej stronie. Bez opłat i bez limitów.
Kiedy warto, a kiedy nie
Warto, jeśli:
- zależy Ci na prywatności, bo nagrania i teksty zostają u Ciebie,
- chcesz sklonować konkretny głos, swój albo lektora za zgodą,
- generujesz dużo audio i nie chcesz limitów,
- pracujesz w językach spoza krótkiej listy usług chmurowych.
Odpuść, jeśli:
- masz słaby sprzęt i zero cierpliwości - na starym komputerze bez akceleracji pójdzie, ale wolno,
- potrzebujesz od ręki gotowej biblioteki setek profesjonalnych głosów - tutaj klonujesz albo projektujesz głos sam.
Jak zacząć w 5 minut
- pobierz OmniVoice Studio z GitHuba (link pod artykułem),
- odpal i pobierz jeden model TTS pasujący do sprzętu - na Macu silnik omnivoice albo mlx-audio,
- wrzuć kilkusekundową próbkę głosu i zapisz ją jako profil,
- wpisz tekst, wybierz język, syntetyzuj.
Chcesz to zautomatyzować? Włącz lokalny serwer w ustawieniach. Dostajesz endpoint zgodny z OpenAI - wysyłasz tekst, odbierasz audio. Ja spinam go z Claude Code i generuję podcasty jednym poleceniem.
Podsumowanie
- OmniVoice Studio to najlepszy lokalny generator głosu, jaki testowałem - klonowanie, 646 języków, wszystko na Twoim komputerze,
- używam go komercyjnie i na produkcji - licencja AGPL na to pozwala, sprawdziłem,
- na Macu z Apple Silicon chodzi akcelerowany, bez walki ze sprzętem.
P.S. Ten wpis też dostanie wersję audio - moim sklonowanym głosem, zrobioną właśnie w OmniVoice. Zapętliło się ładnie.
Damian Ślimak. Twój Nawigator w chaosie AI.
