Un message de don lu par une voix de robot générique, ça passe. Le même message lu avec ta propre voix, c'est un moment dont ta communauté parle encore des semaines plus tard. Ce guide explique comment les streamers clonent leur propre voix pour le TTS, ce qui arrive à tes données vocales et ce qui empêche les spectateurs de te faire dire des choses que tu ne dirais jamais.
Une précision d'abord : le TTS de ControlPlay est activé compte par compte pendant la bêta actuelle, et Own Voice, le clone IA de ta propre voix, est une option distincte, accessible uniquement sur invitation. Les voix du catalogue fonctionnent sans elle.
Comment fonctionne le TTS avec ta propre voix
- Tu enregistres de courts échantillons. Dans le client ControlPlay, tu téléverses des extraits de ta propre voix : jusqu'à 25 échantillons, chacun jusqu'à 10 Mo, dans des formats courants comme MP3, WAV ou OGG.
- Un modèle vocal IA est créé. Les échantillons sont transmis une seule fois au fournisseur de voix pour créer ton modèle vocal. Il n'y a pas de file d'attente d'entraînement ; la voix est disponible juste après sa création.
- Les spectateurs écrivent, ta voix parle. Un spectateur envoie un message via l'action que tu as activée dans l'Extension Twitch, avec ses Coins disponibles. Après la modération, le message est lu avec ta voix clonée.
Tu choisis la voix pour chaque action TTS. Tu peux donc proposer des voix du catalogue et ta propre voix côte à côte, avec des montants en Coins différents.
Téléverser ta voix, est-ce sans risque ?
Les questions qui comptent sont la propriété, le stockage et la suppression. Voici la réponse claire pour ControlPlay :
- Uniquement ta propre voix. Tu ne peux cloner que toi-même. Le client affiche des informations de confidentialité avant la création du clone.
- Les échantillons ne sont pas conservés. Tes enregistrements sont transmis une seule fois pour créer le modèle vocal. Ensuite, la génération vocale n'envoie plus que la référence de la voix et le texte du message.
- Tu peux la supprimer. Retire ta voix clonée à tout moment dans le client ; elle est aussi supprimée chez le fournisseur de voix. La suppression de ton compte ControlPlay la retire automatiquement.
Cloner quelqu'un d'autre, c'est une autre histoire. Une célébrité ou un autre streamer n'a jamais consenti à ton téléversement, et l'usurpation d'identité relève des règles de la communauté de Twitch. Garde le clonage là où est sa place : ta voix, ton consentement, ta chaîne.
Qu'est-ce qui empêche les spectateurs d'abuser de ta voix ?
La crainte honnête derrière chaque voix personnalisée : un inconnu tape une insulte discriminatoire et ta propre voix la prononce. ControlPlay vérifie chaque message avant que le moindre audio existe : un filtre de mots attrape les termes connus et les astuces de contournement habituelles, puis un contrôle sémantique par IA lit le message complet pour détecter la haine, le harcèlement et les menaces. Les messages rejetés ne sont jamais synthétisés, et en mode Bloquer, les Coins du spectateur sont rendus automatiquement.
Tu contrôles en plus les jurons du quotidien, tes propres termes bloqués et les suspensions par spectateur. Le guide de modération du TTS couvre le système complet. Et pour être précis sur la mécanique : les spectateurs n'ont jamais accès à ton vrai microphone. Ils envoient du texte ; c'est ton système configuré et modéré qui parle.
Ta voix dans Discord et le chat vocal du jeu
Diffusé sur la sortie du stream, un message avec ta voix clonée est un moment TTS normal. Acheminé via le microphone virtuel configuré, il atteint Discord, TeamSpeak ou un chat vocal compatible dans le jeu. Tes coéquipiers entendent alors « toi » réagir au chat en pleine partie. Qu'un chat vocal précis le capte dépend de ton installation audio. Teste donc dans un appel privé avant de passer en live.
Spécificité de ControlPlay : des lignes écrites par les spectateurs, prononcées avec ta propre voix clonée, modérées avant la lecture et acheminables vers le chat vocal. Chaque élément existe quelque part ; c'est la combinaison qui fait naître les clips.
Enregistrer des échantillons qui sonnent comme toi
Le modèle ne sera jamais meilleur que l'audio que tu lui fournis :
- Enregistre dans une pièce calme, sans musique, son de jeu ni bourdonnement.
- Parle naturellement, comme tu parles en stream, pas comme un présentateur de journal.
- Utilise plusieurs extraits courts avec des phrases variées plutôt qu'une seule prise monotone.
- Écarte les extraits où d'autres voix apparaissent ; le modèle ne doit entendre que toi.
Si le premier résultat sonne faux, supprime la voix et recrée-la avec des échantillons plus propres.
Configurer ta voix TTS personnalisée
- Crée un compte ControlPlay, connecte Twitch, installe le client Windows et active l'Extension.
- Configure d'abord le TTS avec une voix du catalogue ; le guide de configuration du TTS sur Twitch couvre les voix, le routage et les tests.
- Own Voice est accessible uniquement sur invitation pendant la bêta ; contacte l'assistance ControlPlay pour demander l'accès.
- Après l'invitation, enregistre tes échantillons, consulte les informations de confidentialité et crée ta voix.
- Configure le montant en Coins, le cooldown et la modération de l'action, puis teste avec un message inoffensif depuis un compte spectateur.
Commence avec des réglages de modération plus stricts que ce que tu penses nécessaire. Ta propre voix qui dit la mauvaise chose frappe plus fort que n'importe quelle voix de robot.
