VoiceStudio : doubler une vidéo dans une autre langue, avec sa propre voix, sans cloud
Clonage, création de voix par description, doublage vidéo et livres audio en 646 langues : ce que fait VoiceStudio, comment se déroule un doublage de bout en bout, et en quoi il diffère de Voicebox.
Vous avez enregistré un tutoriel de vingt minutes en français. Pour le proposer en anglais, il y a trois options : le réenregistrer en entier, payer un doubleur, ou ajouter des sous-titres que la moitié des spectateurs ne liront pas. Ou bien une quatrième, plus récente : faire doubler la vidéo par une IA, avec votre propre voix, dans la langue cible.
VoiceStudio fait exactement ça, sur votre machine. C'est un studio vocal open source sous licence AGPL-3.0 qui regroupe le clonage de voix, la création de voix par description, le doublage vidéo, la narration de livres audio, la dictée et la transcription. Son moteur par défaut, basé sur OmniVoice de k2-fsa, couvre 646 langues. Le projet, lancé en avril 2026, a dépassé les 50 000 étoiles sur GitHub en six mois.
Ce qu'on trouve dans l'application
| Espace de travail | Ce qu'il fait |
|---|---|
| Voice cloning | Imite une voix à partir d'un enregistrement de référence |
| Voice design | Crée une voix à partir d'une description (« femme, jeune adulte, voix grave ») |
| Dubbing | Transcrit, traduit et redouble une vidéo en gardant le minutage |
| Stories et livres audio | Narration longue à plusieurs voix, traitement par lots |
| Dictée | Widget flottant et raccourci global |
| Transcription | Audio et vidéo, avec identification des intervenants |
| API et MCP | Accès local pour scripts et agents IA |
L'application est construite avec Electron, avec un backend Python qui fait tourner les modèles. Elle propose aussi une fonction de tatouage numérique (watermark) des audios générés, ce qui n'est pas un détail vu le sujet.
Installation
Le plus simple est de télécharger le paquet de votre système dans les releases GitHub : .dmg pour macOS, .exe pour Windows, .AppImage ou .deb pour Linux. Il existe aussi un script d'installation :
# macOS et Linux
curl -fsSL https://voicestudio.sh/install | sh# Windows
irm https://voicestudio.sh/install | iexUn réflexe avant d'exécuter un script téléchargé et passé directement au shell : l'ouvrir dans le navigateur et le lire. Celui-ci vérifie les sommes SHA-256 des fichiers qu'il télécharge, ce qui est bon signe, mais c'est à vous de le constater.
Le matériel détermine le confort d'utilisation :
| Matériel | Support |
|---|---|
| GPU NVIDIA (Windows, Linux) | Accélération CUDA |
| Mac Apple Silicon | Accélération Metal |
| Sans GPU dédié | Fonctionne sur CPU, plus lentement, environ 5 Go de disque |
| Windows sur ARM | Expérimental, CPU uniquement |
| Mac Intel | Interface seule, à connecter à un backend distant |
Les modèles se téléchargent à la demande, au premier usage de chaque fonction. Le modèle OmniVoice pèse à lui seul environ 2,3 Go. Prévoyez de la place si vous testez plusieurs moteurs.
Un doublage de bout en bout
C'est la fonction qui distingue VoiceStudio de ses concurrents. Derrière un bouton « Generate », le backend enchaîne une chaîne complète de traitements :
Vidéo source
│
├─ 1. Séparation → voix d'un côté, musique et bruitages de l'autre
├─ 2. Transcription → texte horodaté (WhisperX)
├─ 3. Diarisation → qui parle à quel moment
├─ 4. Clonage → une empreinte vocale par intervenant
├─ 5. Traduction → texte dans la langue cible (NLLB en local, ou un fournisseur)
├─ 6. Synthèse → chaque segment dit avec la voix clonée
├─ 7. Ajustement → le segment est calé sur la durée d'origine
└─ 8. Mixage → nouvelle voix + musique d'origine → exportLa séparation de l'étape 1 est ce qui rend le résultat crédible. Sans elle, on perdrait la musique et l'ambiance de la vidéo, ou on doublerait par-dessus la voix d'origine.
Dans l'interface, le déroulé est le suivant :
- Ouvrir Dub et déposer une vidéo ou un fichier audio, ou coller l'URL d'une vidéo.
- Attendre la préparation et la transcription.
- Choisir une ou plusieurs langues cibles, puis lancer la traduction.
- Relire la traduction. L'éditeur affiche chaque segment avec le texte source et le texte traduit côte à côte, et on peut modifier chaque traduction.
- Ajuster si besoin la voix et le minutage de chaque intervenant.
- Générer, écouter, comparer avec l'original, exporter.
L'étape 4 est celle qu'on a envie de sauter, et c'est une erreur. La traduction automatique se trompe sur le vocabulaire technique, les expressions et les noms propres. Une erreur dans un sous-titre se remarque à peine. Dite avec votre voix, elle sonne comme si vous l'aviez prononcée.
Le second piège est la longueur. Une phrase anglaise est souvent plus courte que sa version française, une phrase allemande souvent plus longue. VoiceStudio ajuste le débit pour tenir dans la durée du segment, mais une traduction trop longue donne une voix pressée. Raccourcir le texte traduit donne presque toujours un meilleur résultat que de laisser l'outil accélérer.
Les projets longs sont gérés proprement : une génération interrompue peut reprendre là où elle s'était arrêtée, sans tout recalculer.
Créer une voix qui n'existe pas
Le clonage imite une voix réelle. Le voice design fait l'inverse : on décrit la voix voulue et le modèle l'invente. Avec le moteur par défaut, la description combine des attributs prédéfinis, une valeur par catégorie :
| Catégorie | Valeurs possibles |
|---|---|
| Genre | male, female |
| Âge | child, teenager, young adult, middle-aged, elderly |
| Hauteur | very low pitch à very high pitch |
| Style | whisper |
| Accent (texte en anglais) | american, british, australian, indian… |
female, middle-aged, low pitch
male, elderly, low pitch, whisperD'autres moteurs, comme VoxCPM2 ou la variante VoiceDesign de Qwen3-TTS, acceptent une description en texte libre (« voix rauque, accent écossais »). Une fois enregistrée, la voix garde une identité stable : elle sonnera pareil d'une génération à l'autre.
Pour un narrateur de livre audio, un personnage de jeu ou la voix d'un tutoriel, c'est souvent la meilleure option. On obtient une voix unique, sans emprunter celle de personne, et sans aucune question de consentement à se poser.
Livres audio et narration à plusieurs voix
L'espace Stories découpe un texte long et attribue chaque passage à une voix : un narrateur, des personnages, un dialogue. La file de traitement par lots enchaîne les générations sans bloquer l'interface. On peut lancer un chapitre entier et continuer à travailler.
Pour la qualité, quelques réglages comptent plus que le choix du moteur :
- Un enregistrement de référence propre pour les voix clonées : dix à trente secondes, sans musique ni écho.
- Une ponctuation soignée. Les modèles s'en servent pour le rythme et les pauses. Une virgule manquante donne une phrase récitée d'une traite.
- Des chapitres raisonnables. Générer par chapitre permet de réécouter et de corriger une partie sans tout relancer.
Le moteur par défaut couvre la plupart des langues. Si une voix ne vous convient pas, d'autres moteurs comme IndexTTS 2.5, CosyVoice 3 ou VoxCPM2 sont disponibles : le catalogue en compte plus d'une quinzaine, et le meilleur dépend de la langue et de la voix. Le test reste le seul juge.
Dictée, transcription et agents IA
Comme Voicebox, VoiceStudio sert aussi d'entrée vocale. Un widget flottant et un raccourci global transcrivent la dictée, avec WhisperX par défaut et d'autres moteurs au choix (Faster-Whisper, Parakeet, Moonshine, sherpa-onnx pour la dictée en direct).
Le backend tourne sur le port 3900 et expose plusieurs interfaces :
| Interface | Adresse | Usage |
|---|---|---|
| HTTP compatible OpenAI | POST /v1/audio/transcriptions | Scripts, SDK existants |
| WebSocket | /v1/audio/transcriptions/stream | Texte partiel en direct |
| MCP Streamable HTTP | /mcp/ | Agents IA modernes |
| MCP stdio | python -m backend.mcp_shim | Clients qui ne parlent que stdio |
L'API de transcription reprend le format d'OpenAI. Un script qui utilisait l'API Whisper d'OpenAI peut donc basculer en local en changeant juste l'URL :
curl http://127.0.0.1:3900/v1/audio/transcriptions \
-F "file=@reunion.wav"Le serveur MCP expose une dizaine d'outils : generate_speech, clone_voice, design_voice, transcribe, list_voices… Un agent peut donc créer une voix, puis s'en servir pour lire un texte. Si le protocole vous est inconnu, le fonctionnement du Model Context Protocol explique comment un agent découvre et appelle ces outils.
L'application génère elle-même les fichiers de configuration pour Claude Code, Cursor et Codex dans l'onglet Integrations. Pour Codex CLI, ça donne :
[mcp_servers.voicestudio]
url = "http://127.0.0.1:3900/mcp/"
http_headers = { "X-OmniVoice-Client-Id" = "codex-cli" }L'en-tête X-OmniVoice-Client-Id permet d'associer une voix différente à chaque agent.
Un détail de sécurité bien pensé : les outils MCP qui lisent ou écrivent des fichiers sont limités à un dossier défini par OMNIVOICE_MCP_BASE_PATH. Sans ce réglage, un agent ne peut pas demander de transcrire /etc/passwd ou d'écrire n'importe où sur le disque. Les chemins sont refusés, avec une explication.
VoiceStudio ou Voicebox
Les deux projets sont nés la même année, avec le même discours : une alternative locale à ElevenLabs. Ils ne visent pourtant pas le même usage. J'ai présenté Voicebox, le studio de voix IA en local dans un article précédent.
| VoiceStudio | Voicebox | |
|---|---|---|
| Point fort | Production : doublage, livres audio, création de voix | Usage quotidien : dictée, voix pour les agents |
| Doublage vidéo | Oui, chaîne complète | Non |
| Création de voix par description | Oui | Non (voix prédéfinies) |
| Langues | 646 (moteur par défaut) | 23 |
| Dictée système | Widget et raccourci | Raccourci, collage automatique sur macOS |
| Application | Electron | Tauri, plus léger |
| Licence | AGPL-3.0 | MIT |
| Linux | Paquets .AppImage et .deb | Compilation depuis les sources |
Ma lecture : Voicebox est l'outil qu'on garde ouvert toute la journée, VoiceStudio celui qu'on ouvre pour produire. Si vous faites des vidéos, des podcasts ou des livres audio, VoiceStudio. Si vous voulez surtout dicter et entendre vos agents, Voicebox.
La licence compte aussi. L'AGPL impose de publier vos modifications si vous proposez une version modifiée de VoiceStudio comme service en ligne. Pour un usage personnel ou en interne, ça ne change rien. Pour intégrer le code dans un produit SaaS, c'est déterminant. Et les modèles ont leurs propres licences, parfois plus restrictives pour un usage commercial : le README demande de les vérifier.
Doubler la voix de quelqu'un d'autre
Doubler sa propre vidéo avec sa propre voix ne pose aucun problème. Le doublage vidéo rend pourtant très simple quelque chose qui ne l'est pas juridiquement : faire dire à une personne réelle, avec sa voix, des phrases qu'elle n'a jamais prononcées, dans une langue qu'elle ne parle peut-être pas.
Les règles sont les mêmes que pour tout clonage vocal : la voix est une donnée personnelle et un attribut de la personnalité, la publier sans consentement sous forme de contenu généré par IA est sanctionné en France, et l'AI Act européen impose de signaler un contenu audio ou vidéo qui imite une personne réelle. Le README de VoiceStudio le résume en une phrase : ne clonez une voix qu'avec l'autorisation de la personne.
En pratique, pour une vidéo doublée publiée en ligne :
- doublez votre voix, ou celle d'intervenants qui ont donné leur accord par écrit ;
- indiquez dans la description que la version est doublée par IA ;
- gardez la version originale accessible.
Les questions plus larges que pose l'IA générative dans l'éducation ou le droit sont abordées dans l'IA face à l'éducation, la santé et le droit, et le cadre des données personnelles dans le RGPD face à l'IA. Cette section est un résumé, pas un avis juridique.
Il y a cinq ans, doubler une vidéo dans une autre langue avec sa propre voix demandait un studio et un budget. Aujourd'hui, c'est un après-midi sur un PC avec une carte graphique, et le résultat est assez bon pour un tutoriel, un cours ou un podcast. VoiceStudio fait tourner toute cette chaîne en local, ce qui règle la question de la confidentialité. La relecture de la traduction et le consentement des voix utilisées restent votre travail, et aucun modèle ne les fera à votre place.