Hermes Agent + ElevenLabs : guide vocal complet
Branchez ElevenLabs sur votre Hermes Agent pour les réponses vocales Telegram. Où placer la clé API, comment choisir voice_id et quel modèle utiliser.

Votre voix gratuite suffit, jusqu'à ce qu'un vrai humain l'entende
Edge TTS est livré avec Hermes Agent et ne coûte rien. Il fonctionne, il propose plus de 400 voix dans des dizaines de langues, et si vous êtes le seul à entendre votre bot il est vraiment bien assez. Le jour où vous passez votre bot Telegram à un client, où vous le mettez dans un groupe ou l'utilisez pour enregistrer quelque chose qu'un humain va commenter, la voix par défaut se met soudain à sonner comme une voix par défaut. ElevenLabs est la solution la plus rapide, et c'est le fournisseur TTS payant le plus recherché pris en charge par Hermes.
Ce guide, c'est le câblage de bout en bout, un fichier de config à la fois. Ce que le plan gratuit couvre vraiment, où va la clé API, comment choisir un voice_id qui existera encore dans six mois, quel modèle définir pour le chat par rapport aux formats longs, et où sont les vrais compromis (hébergé aux États-Unis, tarif à l'usage, pas de mode hors-ligne). Pas de captures, pas de remplissage, juste les étapes et les chiffres.
Ce que le plan gratuit vous offre
ElevenLabs accorde à chaque compte 10 000 crédits par mois sur le plan gratuit. Multilingual v2 facture 1 crédit par caractère, soit environ 10 000 caractères, à peu près 1 500 mots parlés, ou dix à douze minutes d'audio fini à un rythme naturel. Les crédits ne se cumulent pas : le compteur repart à votre date de facturation et ce que vous n'avez pas utilisé disparaît.
Pour un Hermes Agent personnel qui répond à une poignée de notes vocales Telegram par jour, dix minutes suffisent souvent pour le mois entier. Pour un bot exposé au client, prévoyez le plan Creator ou au-dessus. Les dépassements sur Creator tournent autour de 0,30 $ par tranche de 1 000 caractères, et c'est le chiffre honnête à opposer à Edge TTS, qui est gratuit.
Deux subtilités du plan gratuit à annoncer d'entrée :
- Le plan gratuit autorise l'usage commercial, mais l'audio doit attribuer ElevenLabs. Pour un chat privé pas de souci. Pour un bot qui parle à vos clients payants, cette obligation est une raison de passer à un plan payant.
- Les voix preset par défaut (Rachel, Adam et compagnie) seront retirées fin 2026. Fixez un
voice_idde la Voice Library avant cette date, sinon votre bot cassera en silence au moment du basculement.
Étape 1 : installez l'extra TTS premium
Hermes embarque les fournisseurs TTS gratuits nativement. ElevenLabs vit derrière un extra tts-premium pour garder les dépendances légères si vous ne l'activez jamais :
pip install "hermes-agent[tts-premium]"
Si vous avez déjà installé l'extra messaging, lancez les deux ensemble pour éviter les allers-retours du résolveur :
pip install "hermes-agent[messaging,tts-premium]"
Étape 2 : mettez la clé API là où Hermes la lit
Créez une clé sur elevenlabs.io, dans Profile puis API Keys. La clé a la forme sk_... et c'est le seul identifiant dont ElevenLabs a besoin. Elle va dans ~/.hermes/.env :
ELEVENLABS_API_KEY=sk_votre_cle_ici
Deux choses à propos de ce chemin. D'abord, c'est bien ~/.hermes/.env, pas le .env du projet depuis lequel vous avez lancé Hermes : le gateway ne lit que le dossier de configuration. Ensuite, si vous préférez exporter la clé dans le shell, Hermes la trouvera aussi, mais le fichier .env est ce qui survit à un reboot sans que vous ayez à y penser.
Étape 3 : branchez le fournisseur dans config.yaml
Éditez ~/.hermes/config.yaml et réglez le bloc TTS :
tts:
provider: elevenlabs
voice_id: 21m00Tcm4TlvDq8ikWAM # Rachel (voix féminine par défaut)
model_id: eleven_multilingual_v2
Voilà tout le setup. Redémarrez le gateway :
hermes gateway restart
Depuis une session CLI, vérifiez :
hermes
> /voice on
> Dis "un deux trois, ElevenLabs est branché."
Vous devriez entendre la réponse dans la voix configurée. Si vous n'entendez rien, les deux causes habituelles sont une clé incorrecte (401 dans le log du gateway) et l'absence de ffmpeg sur la machine quand Hermes tente de convertir l'audio pour Telegram : voyez la section Telegram plus bas.
Étape 4 : choisissez un voice_id qui existera encore
Le voice_id est le seul levier qui décide de la voix de votre bot. Deux familles de voix, accessibles de la même façon :
- Voix preset - Rachel, Adam et les autres prénoms intégrés au plan gratuit. Coût zéro, fonctionnent d'emblée, mais, encore une fois : toute la liste des presets est retirée fin 2026. Ok pour un projet de week-end, mauvais choix pour tout ce que vous comptez faire tourner en 2027.
- Voix de la Voice Library - plus de 10 000 voix partagées par la communauté ElevenLabs et les voix que vous concevez. Parcourez la bibliothèque sur elevenlabs.io, cliquez sur Add Voice pour celles que vous aimez, et collez l'ID dans
voice_id. Ces voix perdurent et sont le bon choix en production.
Le workflow prudent : même pour un premier setup, choisissez deux voix de la Voice Library, ajoutez-les toutes les deux à votre compte et mettez la principale dans voice_id. Quand l'une sera dépréciée (les voix de la communauté vont et viennent), vous basculez sans stress.

Étape 5 : choisissez le modèle
Deux modèles comptent pour Hermes sur Telegram, et vous arbitrez entre eux sur la latence contre la qualité :
| Modèle | Coût | Latence | Meilleur pour |
|---|---|---|---|
eleven_multilingual_v2 |
1 crédit / caractère | Plus élevée, priorité qualité | Réponses longues, réponses aux notes vocales, chat multilingue |
eleven_flash_v2_5 |
0,5 crédit / caractère | Environ 75 ms jusqu'au premier octet | Réponses courtes de chat, conversation à faible latence |
Multilingual v2 est le défaut dans la config plus haut parce qu'il produit l'audio le plus expressif et couvre plus de 29 langues, ce qui compte si votre Hermes Agent répond en français la moitié du temps. Flash v2.5 l'emporte en chat court d'aller-retour où la réponse tient en une ou deux phrases et où chaque 100 ms se remarque.
Un défaut pragmatique : partez sur Multilingual v2, écoutez quelques vraies réponses de votre bot, et ne passez à Flash que si le silence après votre note vocale vous gêne réellement, vous ou la personne en face.
Étape 6 : l'avantage Opus sur Telegram
C'est la pièce que la plupart des guides sautent, et c'est la raison pour laquelle ElevenLabs colle mieux à Telegram que quasiment toute alternative.
Les bulles vocales Telegram doivent être encodées en Opus. Les moteurs TTS locaux comme NeuTTS produisent du WAV, donc Hermes doit invoquer ffmpeg à chaque réponse, et ce ré-encodage ajoute une latence qui se sent. ElevenLabs peut renvoyer de l'Opus nativement, donc les octets audio passent directement de la réponse API à la bulle vocale Telegram sans conversion.
Vous voulez quand même ffmpeg installé en filet :
sudo apt install ffmpeg # Linux
brew install ffmpeg # macOS
Mais avec ElevenLabs configuré, ffmpeg reste inactif sur le chemin heureux et les réponses vocales arrivent plus vite. Croisez avec le comparatif complet des fournisseurs TTS si vous pesez ça contre NeuTTS ou Piper à la même place.
Étape 7 : vérifiez la boucle entière
Depuis votre téléphone, envoyez une note vocale à votre bot Telegram :
- Appuyez et maintenez le bouton micro dans le chat, dites une question courte, relâchez
- Le bot transcrit avec Whisper
- L'agent traite le message
- ElevenLabs synthétise la réponse en Opus
- Hermes vous la renvoie en bulle vocale
La boucle entière doit boucler en quelques secondes pour une question courte, plus longtemps si des appels d'outils ou des requêtes MCP se déclenchent. Si aucun audio n'arrive, cherchez dans le log du gateway un 401 (mauvaise clé), un 429 (rate-limité par le plan gratuit) ou un voice_id not found (souvent une voix que vous n'avez pas ajoutée à votre compte avant de coller l'ID). Pour un balayage plus large, voyez le guide de la voix qui ne marche pas.
Les compromis honnêtes
ElevenLabs est le TTS qui sonne le mieux et que vous pouvez brancher sur Hermes aujourd'hui, et il n'est pas sans conséquences qu'il faut nommer :
- Tarif à l'usage. Vous payez au caractère et le plan gratuit est serré. Si votre bot pond des réponses longues à grande échelle, budgétez.
- Hébergé aux États-Unis, cloud uniquement. Chaque réponse fait un aller-retour vers ElevenLabs. Si votre agent doit tourner en air-gap ou vos données ne peuvent pas quitter votre juridiction, NeuTTS ou Piper sont la vraie réponse, pas ça.
- Verrouillage fournisseur sur la voix. Une voix clonée ou choisie dans la Voice Library vit à l'intérieur d'ElevenLabs. Si vous changez de fournisseur, vous reconstruisez l'identité.
- Coucher des voix preset. Les voix par défaut s'éteignent fin 2026. Passez à la Voice Library avant.
Pour la plupart des gens qui font tourner un Hermes Agent personnel sur Telegram, aucun de ces points n'est bloquant, et le saut de qualité s'entend tout de suite.

Passez le câblage : Hermify le livre pré-configuré
Le setup ci-dessus n'est pas difficile, mais ça reste quatre points de configuration, un redémarrage et une chasse au voice_id pour obtenir l'audio que vous voulez. Si vous préférez ne rien gérer de tout ça, Hermify fait tourner un Hermes Agent géré sur Telegram avec la couche TTS déjà provisionnée. Ajoutez votre clé ElevenLabs dans le tableau de bord, choisissez votre voice_id, et le changement s'applique à la prochaine réponse. Pas de SSH, pas de config.yaml, pas d'installation ffmpeg. Les fichiers de mémoire restent à vous quoi qu'il arrive.
Commencez avec Hermify et sautez direct à la partie amusante : le moment où votre bot répond dans une voix qui sonne comme la vôtre.
Sources
- Documentation de l'API Text-to-Speech d'ElevenLabs
- Comparaison des modèles ElevenLabs
- Documentation de la Voice Library d'ElevenLabs
- Tarifs ElevenLabs 2026 - Coda One
- Limites du plan gratuit ElevenLabs 2026 - AI Voice Review
- Tarifs ElevenLabs 2026 - Cekura
- Meilleures voix ElevenLabs 2026 - Cognitive Future
- Guide de l'API ElevenLabs 2026
Lancez votre propre agent Hermes
Apportez votre clé API, connectez Telegram et obtenez un agent IA auto-améliorant opérationnel en 60 secondes.
Commencer