Сообщение с донатом, прочитанное стандартным голосом робота из библиотеки, воспринимается нормально. То же сообщение твоим собственным голосом становится моментом, который сообщество обсуждает ещё несколько недель. В этом руководстве разберём, как стримеры клонируют собственный голос для TTS, что происходит с данными твоего голоса и что мешает зрителям заставить тебя говорить то, чего ты никогда бы не сказал.
Одно уточнение сразу: в текущей бета-версии ControlPlay TTS включается отдельно для каждого аккаунта, а Own Voice, AI-клон твоего собственного голоса, остаётся отдельной опцией, доступной только по приглашению. Голоса из библиотеки работают и без неё.
Как работает TTS твоим собственным голосом
- Ты записываешь короткие образцы. В клиенте ControlPlay ты загружаешь записи своего голоса: до 25 образцов, каждый до 10 МБ, в распространённых форматах вроде MP3, WAV или OGG.
- Создаётся AI-модель голоса. Образцы один раз передаются провайдеру голосов для создания твоей голосовой модели. Очереди на обучение нет; голос доступен сразу после создания.
- Зрители пишут, твой голос говорит. Используя доступные Coins, зритель отправляет сообщение через действие, которое ты включил в расширении Twitch. После модерации сообщение воспроизводится твоим клонированным голосом.
Голос выбирается для каждого TTS-действия отдельно, поэтому голоса из библиотеки и свой собственный голос можно предлагать параллельно, с разным количеством Coins.
Безопасно ли загружать свой голос?
Здесь важны три вопроса: кому принадлежит голос, как он хранится и как удаляется. Вот прямой ответ для ControlPlay:
- Только твой собственный голос. Клонировать можно исключительно себя. Перед созданием клона клиент показывает информацию о конфиденциальности.
- Образцы не хранятся. Твои записи передаются один раз для создания голосовой модели. После этого при генерации речи передаются только референс голоса и текст сообщения.
- Голос можно удалить. Удали клонированный голос в клиенте в любой момент; он удаляется и у провайдера голосов. При удалении аккаунта ControlPlay голос исчезает автоматически.
С клонированием чужого голоса всё иначе. Знаменитость или другой стример никогда не давали согласия на загрузку своего голоса, а выдача себя за другого подпадает под правила сообщества Twitch. Пусть клонирование остаётся там, где ему место: твой голос, твоё согласие, твой канал.
Что мешает зрителям злоупотреблять твоим голосом?
Честный страх, стоящий за каждым собственным голосом: незнакомец печатает слур, и твой собственный голос его произносит. ControlPlay проверяет каждое сообщение до того, как появится хоть какой-то звук: фильтр слов ловит известные термины и привычные трюки обхода, затем семантическая ИИ-проверка читает всё сообщение на предмет ненависти, травли и угроз. Сообщения, не прошедшие проверку, никогда не синтезируются, а в режиме блокировки Coins автоматически возвращаются зрителю.
Дополнительно ты управляешь обычной ненормативной лексикой, собственными запрещёнными словами и тайм-аутами для отдельных зрителей. Полную систему описывает руководство по модерации TTS. И чтобы быть точным в механике: зрители никогда не получают доступ к твоему настоящему микрофону. Они отправляют текст, а озвучивает его настроенный тобой модерируемый конвейер.
Твой голос в Discord и игровом голосовом чате
Воспроизведённое на выходе стрима, сообщение клонированным голосом остаётся обычным TTS-моментом. Направленное через настроенный виртуальный микрофон, оно попадает в Discord, TeamSpeak или совместимый внутриигровой голосовой чат, и товарищи по команде посреди матча слышат, как «ты» реагируешь на чат. Подхватит ли конкретный голосовой чат этот звук, зависит от твоего аудиосетапа, поэтому проверь всё в приватном звонке до выхода в эфир.
Особенность ControlPlay: написанные зрителями реплики, произнесённые твоим собственным клонированным голосом, модерируемые до воспроизведения и с возможностью вывода в голосовой чат. Каждая часть по отдельности где-то существует; клипы рождаются из их сочетания.
Как записать образцы, которые звучат как ты
Модель может быть лишь настолько хороша, насколько хорош звук, который ты ей даёшь:
- Записывай в тихой комнате без музыки, звука игры и гула.
- Говори естественно, так, как разговариваешь на стриме, а не как диктор новостей.
- Используй несколько коротких записей с разнообразными фразами вместо одного монотонного дубля.
- Не бери записи, где слышны другие голоса; модель должна слышать только тебя.
Если первый результат звучит не так, удали голос и создай его заново из более чистых образцов.
Настрой свой собственный TTS-голос
- Создай аккаунт ControlPlay, подключи Twitch, установи клиент для Windows и активируй расширение.
- Сначала настрой TTS с голосом из библиотеки; руководство по настройке TTS на Twitch описывает голоса, маршрутизацию и тесты.
- Own Voice во время беты доступен только по приглашению; спроси о доступе в поддержке ControlPlay.
- После приглашения запиши образцы, прочитай информацию о конфиденциальности и создай свой голос.
- Настрой количество Coins, кулдаун и модерацию действия, затем проверь всё безобидным сообщением с аккаунта зрителя.
Начни с более строгих настроек модерации, чем кажется необходимым. Твой собственный голос, произносящий не то, бьёт больнее, чем любой голос робота.
