Wiadomość z donacji odczytana standardowym głosem robota jest w porządku. Ta sama wiadomość odczytana twoim własnym głosem to moment, o którym twoja społeczność mówi jeszcze tygodniami. Ten poradnik wyjaśnia, jak streamerzy klonują własny głos do TTS, co dzieje się z danymi twojego głosu i co powstrzymuje widzów przed tym, aby z twoich ust padały rzeczy, których nigdy byś nie powiedział.
Jedna rzecz na początek: TTS w ControlPlay jest w obecnej wersji beta włączany osobno dla każdego konta, a Own Voice, klon AI twojego własnego głosu, to oddzielna opcja dostępna wyłącznie na zaproszenie. Głosy z biblioteki działają bez niej.
Jak działa TTS z twoim własnym głosem
- Nagrywasz krótkie próbki. W kliencie ControlPlay przesyłasz nagrania własnego głosu: maksymalnie 25 próbek, każda do 10 MB, w popularnych formatach, takich jak MP3, WAV lub OGG.
- Powstaje model głosu AI. Próbki są jednorazowo przesyłane do dostawcy głosu, aby utworzyć twój model głosu. Nie ma kolejki treningowej; głos jest dostępny od razu po utworzeniu.
- Widzowie piszą, twój głos mówi. Widz przesyła wiadomość przez włączoną przez ciebie akcję w rozszerzeniu Twitch, używając dostępnych Coins. Po moderacji wiadomość jest odtwarzana twoim sklonowanym głosem.
Głos wybierasz osobno dla każdej akcji TTS, możesz więc oferować głosy z biblioteki i własny głos obok siebie, z różnymi liczbami Coins.
Czy przesyłanie własnego głosu jest bezpieczne?
Pytania, które naprawdę się liczą, dotyczą własności, przechowywania i usuwania. Oto jasna odpowiedź w przypadku ControlPlay:
- Tylko twój własny głos. Możesz sklonować wyłącznie siebie. Przed utworzeniem klonu klient wyświetla informacje o prywatności.
- Próbki nie są przechowywane. Twoje nagrania są przesyłane jednorazowo, aby utworzyć model głosu. Później przy generowaniu mowy wysyłane są tylko referencja głosu i tekst wiadomości.
- Możesz go usunąć. Usuń sklonowany głos w kliencie w dowolnym momencie; zostanie usunięty również u dostawcy głosu. Usunięcie konta ControlPlay usuwa go automatycznie.
Klonowanie kogoś innego to zupełnie inna historia. Celebryta ani inny streamer nigdy nie zgodził się na twój upload, a podszywanie się pod innych podlega wytycznym dla społeczności Twitcha. Zostaw klonowanie tam, gdzie jest jego miejsce: twój głos, twoja zgoda, twój kanał.
Co powstrzymuje widzów przed nadużywaniem twojego głosu?
Szczera obawa stojąca za każdym własnym głosem: obcy wpisuje slur, a twój własny głos go wypowiada. ControlPlay sprawdza każdą wiadomość, zanim powstanie jakiekolwiek audio: filtr słów wychwytuje znane wyrażenia i typowe triki obejścia, a następnie semantyczna kontrola AI czyta całą wiadomość pod kątem mowy nienawiści, nękania i gróźb. Wiadomości, które nie przejdą, nigdy nie są syntetyzowane, a w trybie blokowania Coins wracają do widza automatycznie.
Dodatkowo kontrolujesz codzienne przekleństwa, własne blokowane słowa i czasowe blokady pojedynczych widzów. Poradnik o moderacji TTS opisuje kompletny system. I żeby być precyzyjnym co do mechaniki: widzowie nigdy nie otrzymują dostępu do twojego prawdziwego mikrofonu. Przesyłają tekst; mówieniem zajmuje się twoja skonfigurowana, moderowana ścieżka.
Twój głos w Discordzie i czacie głosowym w grze
Wiadomość odtworzona sklonowanym głosem na wyjściu streamu to zwykły moment TTS. Skierowana przez skonfigurowany wirtualny mikrofon dociera do Discorda, TeamSpeaka lub kompatybilnego czatu głosowego w grze, więc członkowie twojej drużyny słyszą w środku meczu, jak „ty” reagujesz na czat. To, czy konkretny czat głosowy ją przechwyci, zależy od twojej konfiguracji audio, więc przetestuj to w prywatnej rozmowie, zanim wejdziesz na żywo.
Specjalna funkcja ControlPlay: wiadomości pisane przez widzów, wypowiadane twoim własnym sklonowanym głosem, moderowane przed odtworzeniem i możliwe do skierowania do czatu głosowego. Każdy z tych elementów istnieje gdzieś osobno; dopiero ich połączenie tworzy klipy.
Nagrywanie próbek, które brzmią jak ty
Model będzie tylko tak dobry, jak audio, które mu dostarczysz:
- Nagrywaj w cichym pomieszczeniu, bez muzyki, dźwięków gry i buczenia.
- Mów naturalnie, tak jak mówisz na streamie, a nie jak lektor wiadomości.
- Użyj kilku krótszych nagrań ze zróżnicowanymi zdaniami zamiast jednego monotonnego ujęcia.
- Pomiń nagrania, w których słychać inne głosy; model powinien słyszeć wyłącznie ciebie.
Jeśli pierwszy rezultat brzmi nie tak, usuń głos i zbuduj go od nowa z czystszych próbek.
Skonfiguruj swój własny głos TTS
- Załóż konto ControlPlay, połącz Twitch, zainstaluj klienta Windows i aktywuj rozszerzenie.
- Najpierw skonfiguruj TTS z głosem z biblioteki; poradnik konfiguracji Twitch TTS omawia głosy, routing i testy.
- Opcja Own Voice jest w obecnej wersji beta dostępna wyłącznie na zaproszenie; skontaktuj się z pomocą ControlPlay i zapytaj o dostęp.
- Po otrzymaniu zaproszenia nagraj próbki, zapoznaj się z informacjami o prywatności i utwórz swój głos.
- Skonfiguruj liczbę Coins, cooldown i moderację akcji, a potem przetestuj nieszkodliwą wiadomością z konta widza.
Zacznij od ustawień moderacji surowszych, niż wydaje ci się to potrzebne. Twój własny głos mówiący niewłaściwe rzeczy uderza mocniej, niż kiedykolwiek mógłby jakikolwiek głos robota.
