Hermes Agent + ElevenLabs: guía completa de voz
Conecta ElevenLabs a tu Hermes Agent para respuestas de voz en Telegram. Dónde va la API key, cómo elegir voice_id y qué modelo usar.

Tu voz gratuita basta, hasta que la escuche alguien más
Edge TTS viene incluido con Hermes Agent y no cuesta nada. Funciona, ofrece más de 400 voces en decenas de idiomas y, si solo tú vas a escuchar a tu bot, es suficiente. En el momento en que le pasas tu bot de Telegram a un cliente, lo metes en un grupo o lo usas para grabar algo que un humano va a valorar, la voz por defecto suena, precisamente, a la voz por defecto. ElevenLabs es la solución más rápida y es el proveedor de TTS de pago más buscado que soporta Hermes.
Esta guía es el cableado completo, un archivo de configuración a la vez. Qué cubre realmente el plan gratuito, dónde va la API key, cómo elegir un voice_id que siga existiendo dentro de seis meses, qué modelo usar para chat frente a formato largo y dónde están los compromisos honestos (alojado en EE. UU., precio por uso, sin ruta offline). Sin capturas, sin relleno, solo pasos y números.
Qué te da el plan gratuito
ElevenLabs otorga a cada cuenta 10.000 créditos al mes en el plan gratuito. Multilingual v2 cobra 1 crédito por carácter, lo que equivale a unos 10.000 caracteres, alrededor de 1.500 palabras habladas o de diez a doce minutos de audio final a ritmo natural. Los créditos no se acumulan: el contador se reinicia en tu fecha de facturación y lo que no gastes se pierde.
Para un Hermes Agent personal que responde un puñado de notas de voz de Telegram al día, diez minutos suele ser el mes entero. Para un bot de cara al cliente, cuenta con el plan Creator o superior. Los excedentes en Creator rondan los 0,30 $ por cada 1.000 caracteres, y ese es el número honesto para compararlo con Edge TTS, que es gratis.
Dos matices del plan gratuito que conviene nombrar de entrada:
- El plan gratuito permite uso comercial, pero el audio debe atribuir a ElevenLabs. Para un chat privado no pasa nada. Para un bot que le habla a tus clientes de pago, esa obligación de atribución es una razón para pagar.
- Las voces predefinidas (Rachel, Adam y compañía) se retiran a finales de 2026. Fija un
voice_idde la Voice Library antes de esa fecha o tu bot se romperá en silencio cuando llegue el cambio.
Paso 1: instala el extra de TTS premium
Hermes trae de serie los proveedores gratuitos de TTS. ElevenLabs vive detrás del extra tts-premium para que las dependencias se mantengan ligeras si no lo activas:
pip install "hermes-agent[tts-premium]"
Si ya instalaste el extra de mensajería, lánzalos juntos para evitar líos con el resolver:
pip install "hermes-agent[messaging,tts-premium]"
Paso 2: pon la API key donde Hermes la lee
Crea una clave en elevenlabs.io, dentro de Profile y luego API Keys. La clave tiene forma sk_... y es la única credencial que ElevenLabs necesita. Va en ~/.hermes/.env:
ELEVENLABS_API_KEY=sk_tu_clave_aqui
Dos cosas sobre esa ruta. Primero, es ~/.hermes/.env, no el .env del proyecto desde el que lanzaste Hermes: el gateway solo lee el directorio de configuración. Segundo, si prefieres exportar la clave en el shell, Hermes también la recogerá, pero el archivo .env es lo que sobrevive a un reinicio sin que tengas que pensar en ello.
Paso 3: conecta el proveedor en config.yaml
Edita ~/.hermes/config.yaml y ajusta el bloque de TTS:
tts:
provider: elevenlabs
voice_id: 21m00Tcm4TlvDq8ikWAM # Rachel (voz femenina por defecto)
model_id: eleven_multilingual_v2
Eso es toda la configuración. Reinicia el gateway:
hermes gateway restart
Desde una sesión de CLI, verifica:
hermes
> /voice on
> Di "uno dos tres, ElevenLabs está conectado."
Deberías escuchar la respuesta en la voz configurada. Si no oyes nada, las dos causas habituales son una clave incorrecta (401 en el log del gateway) o que no haya ffmpeg en la máquina cuando Hermes intenta convertir el audio para Telegram: mira la sección de Telegram más abajo.
Paso 4: elige un voice_id que vaya a seguir existiendo
El voice_id es la única palanca que decide cómo suena tu bot. Dos familias de voces, ambas accesibles del mismo modo:
- Voces preset - Rachel, Adam y los demás nombres integrados en el plan gratuito. Coste cero, funcionan de inmediato, pero, insistimos: toda la lista de presets se retira a finales de 2026. Vale para un experimento de fin de semana, no vale para nada que quieras seguir ejecutando en 2027.
- Voces de la Voice Library - más de 10.000 voces compartidas por usuarios de ElevenLabs y voces que diseñes tú. Explora la biblioteca en elevenlabs.io, pulsa Add Voice en las que te gusten y pega el ID en
voice_id. Estas voces perduran y son la elección correcta para producción.
Un flujo seguro: incluso para un primer setup, elige dos voces de la Voice Library, añade ambas a tu cuenta y pon la principal en voice_id. Cuando una quede obsoleta (las voces de la comunidad van y vienen), la cambias sin urgencias.

Paso 5: elige el modelo
Dos modelos importan para Hermes en Telegram y decides entre ellos según latencia frente a calidad:
| Modelo | Coste | Latencia | Mejor para |
|---|---|---|---|
eleven_multilingual_v2 |
1 crédito / carácter | Mayor, prioriza calidad | Respuestas largas, contestar notas de voz, chat multilingüe |
eleven_flash_v2_5 |
0,5 créditos / carácter | Alrededor de 75 ms hasta el primer byte | Respuestas cortas de chat, conversación de baja latencia |
Multilingual v2 es el valor por defecto en la configuración anterior porque produce el audio más expresivo y cubre más de 29 idiomas, algo relevante si tu Hermes Agent responde en español la mitad del tiempo. Flash v2.5 gana en el chat corto de ida y vuelta, donde la respuesta son una o dos frases y cada 100 ms se nota.
Un valor por defecto pragmático: empieza con Multilingual v2, escucha unas cuantas respuestas reales de tu bot y solo pasa a Flash si la pausa después de tu nota de voz realmente te molesta a ti o a la persona al otro lado.
Paso 6: la ventaja Opus en Telegram
Esta es la pieza que la mayoría de guías se salta y es la razón por la que ElevenLabs encaja mejor con Telegram que casi cualquier alternativa.
Las burbujas de voz de Telegram deben codificarse en Opus. Los motores de TTS locales como NeuTTS producen WAV, así que Hermes tiene que invocar ffmpeg en cada respuesta, y esa recodificación añade una latencia que se percibe. ElevenLabs puede devolver Opus de forma nativa, así que los bytes del audio pasan directos de la respuesta de la API a la burbuja de voz de Telegram sin conversión.
Aun así conviene tener ffmpeg instalado como fallback:
sudo apt install ffmpeg # Linux
brew install ffmpeg # macOS
Pero con ElevenLabs configurado, ffmpeg se queda inactivo en el camino feliz y las respuestas de voz llegan más rápido. Contrasta con la comparación completa de proveedores de TTS si estás sopesando esto frente a NeuTTS o Piper para el mismo hueco.
Paso 7: comprueba el bucle completo
Desde tu móvil, envía una nota de voz a tu bot de Telegram:
- Mantén pulsado el botón del micro en el chat, dice una pregunta corta, suelta
- El bot transcribe con Whisper
- El agente procesa el mensaje
- ElevenLabs sintetiza la respuesta como Opus
- Hermes te la devuelve como burbuja de voz
El bucle entero debería completarse en unos segundos para una pregunta corta, más si se disparan llamadas a herramientas o consultas MCP. Si nunca llega audio, revisa el log del gateway en busca de 401 (clave incorrecta), 429 (limitado por el plan gratuito) o voice_id not found (normalmente una voz que no añadiste a tu cuenta antes de pegar el ID). Para un repaso de diagnóstico más amplio, consulta la guía de la voz que no funciona.
Los compromisos honestos
ElevenLabs es el TTS que mejor suena que puedes conectar a Hermes hoy, y no está exento de consecuencias que conviene nombrar:
- Precio por uso. Pagas por carácter y el plan gratuito es ajustado. Si tu bot escribe respuestas largas a escala, presupuéstalo.
- Alojado en EE. UU., solo en la nube. Cada respuesta hace ida y vuelta a ElevenLabs. Si tu agente debe correr aislado o tus datos no pueden salir de tu jurisdicción, NeuTTS o Piper son la respuesta honesta, no esto.
- Bloqueo de proveedor sobre la voz. Una voz clonada o elegida en la Voice Library vive dentro de ElevenLabs. Si cambias de proveedor, reconstruyes la identidad.
- Ocaso de las voces preset. Las voces por defecto se apagan a finales de 2026. Pásate a la Voice Library antes.
Para la mayoría de personas que ejecuta un Hermes Agent personal en Telegram, ninguno es un impedimento, y el salto de calidad se nota al instante.

Sáltate el cableado: Hermify lo trae preconfigurado
El setup de arriba no es difícil, pero siguen siendo cuatro puntos de configuración, un reinicio y una búsqueda de voice_id para conseguir el audio que quieres. Si prefieres no gestionar nada de eso, Hermify ejecuta un Hermes Agent gestionado en Telegram con la capa de TTS ya aprovisionada. Añade tu clave de ElevenLabs en el panel, elige tu voice_id y el cambio se aplica en la siguiente respuesta. Sin SSH, sin config.yaml, sin instalar ffmpeg. Los archivos de memoria siguen siendo tuyos igualmente.
Empieza con Hermify y salta directamente a la parte divertida: el momento en que tu bot responde con una voz que suena como si te perteneciera.
Fuentes
- Documentación de la API de Text-to-Speech de ElevenLabs
- Comparación de modelos de ElevenLabs
- Documentación de la Voice Library de ElevenLabs
- Precios de ElevenLabs 2026 - Coda One
- Límites del plan gratuito de ElevenLabs 2026 - AI Voice Review
- Precios de ElevenLabs 2026 - Cekura
- Mejores voces de ElevenLabs 2026 - Cognitive Future
- Guía de la API de ElevenLabs 2026
Lanza tu propio agente Hermes
Trae tu clave de API, conecta Telegram y ten un agente de IA que evoluciona solo activo en 60 segundos.
Empezar