Voicebox : cloner une voix et dicter sans ElevenLabs, tout en local
Synthèse vocale, clonage à partir de quelques secondes d'audio, dictée système et voix pour vos agents IA via MCP : ce que fait Voicebox, comment l'utiliser, et ce que la loi dit du clonage de voix.
Pour faire lire un texte par une voix réaliste, la réponse par défaut s'appelle ElevenLabs. Pour dicter un message proprement dans n'importe quelle application, c'est WisprFlow ou la dictée de l'OS. Deux abonnements, deux clouds, et votre voix, celle que vous avez enregistrée pour la cloner, stockée sur des serveurs que vous ne contrôlez pas.
Voicebox regroupe les deux dans une seule application de bureau, open source sous licence MIT, qui tourne en local. Elle clone une voix à partir de quelques secondes d'audio, génère de la parole dans 23 langues avec sept moteurs de synthèse au choix, transcrit votre dictée avec Whisper, et donne une voix à vos agents IA via le protocole MCP. Les modèles, les échantillons vocaux et les enregistrements ne quittent jamais la machine.
Le projet est récent et a explosé sur GitHub : plus de 56 000 étoiles en 2026. Il est encore en version 0.x.
Ce que fait Voicebox
| Fonction | Ce qu'elle remplace | Sous le capot |
|---|---|---|
| Synthèse vocale et clonage | ElevenLabs | Qwen3-TTS, Chatterbox, Kokoro, LuxTTS, TADA… |
| Dictée système | WisprFlow, dictée macOS | Whisper (de Base à Large, et Turbo) |
| Réécriture de texte | Un LLM cloud | Qwen3 local (0,6 à 4 milliards de paramètres) |
| Voix des agents IA | Rien d'équivalent | Serveur MCP intégré et API REST |
| Montage audio | Un éditeur audio | Éditeur multipiste, effets Pedalboard |
L'application est construite avec Tauri (Rust côté natif, React côté interface) et un backend Python FastAPI qui fait tourner les modèles. L'interface elle-même est plus légère qu'une application Electron. Ce sont les modèles qui consomment, pas l'application.
Installation et matériel
Voicebox s'installe comme n'importe quelle application : un DMG pour macOS (Apple Silicon et Intel), un MSI pour Windows. Pour Linux, il n'y a pas encore de binaire précompilé : il faut compiler depuis les sources, ou lancer le backend avec docker compose up depuis le dépôt cloné.
Les modèles se téléchargent depuis l'application, à la demande. Le matériel fait toute la différence :
| Plateforme | Accélération |
|---|---|
| Mac Apple Silicon | MLX (Metal), le cas le plus confortable |
| Windows avec GPU NVIDIA | CUDA, téléchargé automatiquement par l'application |
| Windows, autre GPU | DirectML |
| Linux AMD | ROCm |
| Intel Arc | IPEX/XPU |
| N'importe quel CPU | Fonctionne, lentement pour les gros modèles |
Sans GPU, restez sur les petits moteurs : Kokoro (82 millions de paramètres) et LuxTTS tournent correctement sur CPU. Les modèles de clonage plus lourds comme Qwen3-TTS 1.7B ou TADA 3B réclament une carte graphique ou une puce Apple.
Cloner une voix
Le clonage est « zero-shot » : pas d'entraînement, pas d'attente. On crée un profil vocal, on y dépose un échantillon (fichier audio ou enregistrement direct dans l'application), et le moteur imite cette voix pour tout texte qu'on lui donne.
Quelques règles pour un bon résultat :
- Dix à trente secondes d'audio propre valent mieux que trois minutes bruitées. Pas de musique de fond, pas d'écho de pièce vide.
- Une voix naturelle et posée. Le modèle reproduit aussi le ton : un échantillon crié donne une voix qui crie.
- Plusieurs échantillons par profil améliorent la stabilité. Voicebox les accepte.
- Transcription exacte. Certains moteurs utilisent le texte de l'échantillon pour aligner la voix, et Voicebox peut le transcrire automatiquement avec Whisper.
Chaque moteur a son caractère, et on peut changer de moteur à chaque génération :
| Moteur | Langues | Point fort |
|---|---|---|
| Qwen3-TTS (0.6B / 1.7B) | 10, dont le français | Clonage multilingue de qualité, consignes de diction (« parle lentement ») |
| Chatterbox Multilingual | 23 | La couverture de langues la plus large |
| Chatterbox Turbo | Anglais | Rapide, comprend les balises d'émotion |
| Kokoro | 8 | Minuscule, rapide sur CPU, 50 voix prêtes à l'emploi |
| LuxTTS | Anglais | Léger, sortie 48 kHz, très rapide sur CPU |
| TADA (1B / 3B) | 10 | Cohérence sur de très longs passages |
| Qwen CustomVoice | 10 | Voix prédéfinies pilotées en langage naturel |
Pour du contenu en français, Qwen3-TTS est mon point de départ. Chatterbox Multilingual sert de second avis quand une voix sonne mal.
Les balises d'émotion ([laugh], [sigh], [whispering], [sarcastic]…) ne fonctionnent qu'avec Chatterbox Turbo, donc en anglais. Les autres moteurs les lisent comme du texte, ce qui donne des résultats involontairement comiques.
Les textes longs ne posent pas de problème : Voicebox découpe automatiquement aux fins de phrase, génère chaque morceau puis les enchaîne avec un fondu, jusqu'à 50 000 caractères. Un article de blog entier, ou un chapitre de livre, passe en une génération.
Dictée : l'autre moitié
Voicebox ne fait pas que parler, il écoute aussi. Un raccourci global permet de dicter n'importe où : on maintient la touche, on parle, on relâche. Whisper transcrit, et le LLM local peut nettoyer le texte au passage : les « euh », les répétitions, les phrases recommencées.
Une précision importante : le collage automatique dans le champ de texte actif ne fonctionne pour l'instant que sur macOS. Sous Windows et Linux, il est sur la feuille de route. En attendant, la transcription arrive dans l'application, et chaque enregistrement est conservé dans l'onglet Captures avec son audio d'origine. On peut le retranscrire avec un modèle Whisper plus gros ou le faire relire par le LLM.
Faire tourner Whisper et un LLM en local, c'est la même logique que faire tourner des LLM en local avec Ollama : rien ne sort de la machine, au prix de quelques gigaoctets de modèles et d'un GPU qui travaille.
Donner une voix à ses agents IA
C'est la fonctionnalité la plus originale. Voicebox embarque un serveur MCP qui expose quatre outils : voicebox_speak, voicebox_transcribe, voicebox_list_captures et voicebox_list_profiles. N'importe quel agent compatible peut alors vous parler avec la voix de votre choix.
Dans Claude Code, une commande suffit, avec Voicebox ouvert :
claude mcp add voicebox \
--transport http \
--url http://127.0.0.1:17493/mcp \
--header "X-Voicebox-Client-Id: claude-code"Pour Cursor, Windsurf ou VS Code, la configuration JSON équivalente :
{
"mcpServers": {
"voicebox": {
"url": "http://127.0.0.1:17493/mcp",
"headers": { "X-Voicebox-Client-Id": "cursor" }
}
}
}Dans Settings > MCP, on associe une voix à chaque client : une pour Claude Code, une autre pour Cursor. On sait qui parle sans regarder l'écran. Si le protocole lui-même vous est inconnu, l'explication du Model Context Protocol détaille comment un agent découvre et appelle des outils comme celui-ci.
Chaque prise de parole d'un agent affiche une pastille à l'écran avec le nom de la voix utilisée. Aucune voix ne parle en arrière-plan sans que vous le voyiez.
L'API REST
Pour tout ce qui ne parle pas MCP (scripts shell, CI locale, domotique), la même chose existe en HTTP :
# Faire parler une voix
curl -X POST http://127.0.0.1:17493/speak \
-H "Content-Type: application/json" \
-H "X-Voicebox-Client-Id: mon-script" \
-d '{"text": "Build terminé, tous les tests passent.", "profile": "Morgan"}'
# Générer un fichier audio
curl -X POST http://127.0.0.1:17493/generate \
-H "Content-Type: application/json" \
-d '{"text": "Bonjour à tous", "profile_id": "abc123", "language": "fr"}'
# Transcrire un enregistrement
curl -X POST http://127.0.0.1:17493/transcribe \
-F "audio=@reunion.wav" \
-F "model=whisper-turbo"La documentation complète de l'API est servie en local sur http://127.0.0.1:17493/docs.
Un usage que j'apprécie : brancher /speak sur l'événement de fin de tour de Claude Code. Quand l'agent a terminé une longue tâche, il le dit à voix haute, et on peut faire autre chose en attendant. La mécanique des hooks Claude Code et leurs cas d'usage s'y prête directement :
{
"hooks": {
"Stop": [
{
"hooks": [
{
"type": "command",
"command": "curl -s -X POST http://127.0.0.1:17493/speak -H 'Content-Type: application/json' -H 'X-Voicebox-Client-Id: claude-hook' -d '{\"text\": \"Tâche terminée.\"}'"
}
]
}
]
}
}Personnalités et montage
Deux fonctions complètent le tableau.
Les personnalités : on décrit en texte libre qui est une voix, comment elle parle, ce qui l'intéresse. Le LLM local peut alors proposer une réplique dans le personnage, ou réécrire votre texte dans son style avant de le lire. Pratique pour des personnages de jeu, des dialogues de fiction ou un assistant qui a un ton. Les agents y accèdent aussi via MCP avec l'option personality: true.
L'éditeur Stories : une timeline multipiste pour assembler plusieurs voix en dialogue ou en podcast, avec découpe et réglage de chaque clip. Huit effets audio (réverbération, écho, compression, filtres, changement de hauteur) s'appliquent après génération, avec des préréglages réutilisables.
Chaque génération garde un historique de versions : l'original est toujours conservé, et chaque effet ou nouvelle prise crée une version qui garde trace de sa source.
Ce que la loi dit du clonage de voix
Cloner sa propre voix ne pose aucun problème. Cloner celle de quelqu'un d'autre, c'est une autre affaire.
La voix est une donnée personnelle. Elle identifie une personne. Quand elle sert à reconnaître ou authentifier quelqu'un, c'est même une donnée biométrique au sens du RGPD. En droit français, la voix est aussi protégée comme un attribut de la personnalité, au même titre que l'image : on ne peut pas l'exploiter sans le consentement de la personne.
Les deepfakes sont encadrés. Depuis la loi SREN de 2024, publier un contenu généré par IA qui reproduit la voix ou l'image d'une personne sans son consentement est un délit, sauf s'il est évident ou clairement indiqué qu'il s'agit d'un contenu artificiel. Au niveau européen, l'AI Act impose d'indiquer qu'un contenu audio a été généré ou manipulé par IA quand il imite une personne réelle. Ces obligations de transparence s'appliquent depuis août 2026.
L'usage frauduleux est puni bien plus lourdement. Les arnaques au « président » ou au faux proche qui appelle en détresse utilisent exactement cette technologie. Usurper l'identité de quelqu'un reste un délit, quelle que soit la technique.
En pratique, la règle est simple : clonez votre voix, ou celle d'une personne qui vous a donné son accord explicite, de préférence par écrit. Et signalez qu'une voix est synthétique quand vous publiez le résultat. L'avantage du local, c'est qu'aucun échantillon n'est envoyé à un tiers, mais ça ne change rien à la question du consentement. Le RGPD face à l'IA détaille comment ces règles s'appliquent aux traitements par intelligence artificielle. Cette section est un résumé, pas un avis juridique.
Voicebox face aux services cloud
| Voicebox | ElevenLabs | WisprFlow | |
|---|---|---|---|
| Prix | Gratuit, open source | Abonnement selon le volume | Abonnement |
| Données vocales | Restent sur la machine | Envoyées au service | Envoyées au service |
| Synthèse et clonage | Oui, 7 moteurs | Oui, qualité de référence | Non |
| Dictée système | Oui (collage auto sur macOS seulement) | Non | Oui, multiplateforme |
| API et MCP | Oui, en local | API cloud | Non |
| Matériel requis | GPU ou Mac Apple Silicon conseillé | Aucun | Aucun |
| Maturité | Version 0.x | Produit établi | Produit établi |
Sur la qualité pure, ElevenLabs garde une longueur d'avance pour un rendu studio dans de nombreuses langues. Voicebox s'en approche selon le moteur et la langue, et l'écart se réduit à chaque nouveau modèle open source. Pour un podcast amateur, une narration de tutoriel, une voix pour ses agents ou de la dictée quotidienne, l'écart ne justifie plus un abonnement.
Voicebox montre où va la voix en IA : des modèles assez petits pour tenir sur un ordinateur portable, assez bons pour qu'on ne les distingue plus facilement d'un humain. Le premier point est une excellente nouvelle pour la vie privée. Le second impose une discipline : cloner sa propre voix, ou celle de quelqu'un qui a dit oui, et ne jamais faire passer une voix synthétique pour une vraie.