Hermes Agent + ElevenLabs: guia completo de voz
Conecte o ElevenLabs ao seu Hermes Agent para respostas de voz no Telegram. Onde vai a chave da API, como escolher voice_id e qual modelo usar.

Sua voz gratuita basta, até que outra pessoa ouça
O Edge TTS já vem com o Hermes Agent e não custa nada. Funciona, oferece mais de 400 vozes em dezenas de idiomas e, se só você vai escutar seu bot, é o suficiente. No momento em que você entrega seu bot do Telegram a um cliente, coloca em um grupo ou grava algo que um humano vai reagir, a voz padrão soa, exatamente, como uma voz padrão. O ElevenLabs é o conserto mais rápido e é o provedor de TTS pago mais procurado que o Hermes suporta.
Este guia é o cabeamento ponta a ponta, um arquivo de configuração por vez. O que o plano gratuito realmente cobre, onde vai a API key, como escolher um voice_id que ainda vá existir daqui a seis meses, qual modelo definir para chat versus texto longo e onde estão os trade-offs honestos (hospedado nos EUA, cobrança por uso, sem caminho offline). Sem prints, sem enrolação, só os passos e os números.
O que o plano gratuito te dá
O ElevenLabs concede a cada conta 10.000 créditos por mês no plano gratuito. O Multilingual v2 cobra 1 crédito por caractere, ou seja, cerca de 10.000 caracteres, aproximadamente 1.500 palavras faladas ou de dez a doze minutos de áudio final em ritmo natural. Créditos não acumulam: o contador reinicia na sua data de faturamento e o que sobrar se perde.
Para um Hermes Agent pessoal que responde a algumas notas de voz por dia no Telegram, dez minutos costumam ser o mês inteiro. Para um bot voltado ao cliente, planeje o plano Creator ou superior. Excedentes no Creator ficam em torno de US$ 0,30 por 1.000 caracteres, e esse é o número honesto para comparar com o Edge TTS, que é grátis.
Dois detalhes do plano gratuito para nomear já de saída:
- O plano gratuito permite uso comercial, mas o áudio precisa atribuir o ElevenLabs. Para um chat privado tudo bem. Para um bot que fala com seus clientes pagos, essa obrigação de atribuição é motivo para pagar.
- As vozes preset (Rachel, Adam e companhia) serão descontinuadas no fim de 2026. Fixe um
voice_idda Voice Library antes disso ou seu bot vai quebrar em silêncio quando a virada acontecer.
Passo 1: instale o extra de TTS premium
O Hermes já traz os provedores gratuitos de TTS. O ElevenLabs vive atrás do extra tts-premium para que as dependências continuem enxutas caso você nunca o ligue:
pip install "hermes-agent[tts-premium]"
Se você já instalou o extra de mensageria, rode os dois juntos para evitar dor de cabeça no resolver:
pip install "hermes-agent[messaging,tts-premium]"
Passo 2: coloque a API key onde o Hermes lê
Crie uma chave no elevenlabs.io, em Profile e depois API Keys. A chave tem o formato sk_... e é a única credencial que o ElevenLabs precisa. Vai em ~/.hermes/.env:
ELEVENLABS_API_KEY=sk_sua_chave_aqui
Duas coisas sobre esse caminho. Primeiro, é ~/.hermes/.env, não o .env do projeto de onde você lançou o Hermes: o gateway lê só o diretório de configuração. Segundo, se você preferir exportar a chave no shell, o Hermes também vai captá-la, mas o arquivo .env é o que sobrevive a um reboot sem você ter que pensar nisso.
Passo 3: conecte o provedor no config.yaml
Edite ~/.hermes/config.yaml e ajuste o bloco de TTS:
tts:
provider: elevenlabs
voice_id: 21m00Tcm4TlvDq8ikWAM # Rachel (voz feminina padrão)
model_id: eleven_multilingual_v2
Essa é toda a configuração. Reinicie o gateway:
hermes gateway restart
De uma sessão da CLI, verifique:
hermes
> /voice on
> Diga "um dois três, o ElevenLabs está conectado."
Você deve ouvir a resposta na voz configurada. Se não ouvir nada, as duas causas mais comuns são chave errada (401 no log do gateway) e falta de ffmpeg na máquina quando o Hermes tenta converter áudio para o Telegram: veja a seção do Telegram mais abaixo.
Passo 4: escolha um voice_id que vá continuar existindo
O voice_id é a única alavanca que decide como seu bot soa. Duas famílias de vozes, ambas acessadas do mesmo jeito:
- Vozes preset - Rachel, Adam e os outros nomes que já vêm no plano gratuito. Custo zero, funcionam de imediato, mas, de novo: a lista inteira de presets será desativada no fim de 2026. Ok para um experimento de fim de semana, errado para qualquer coisa que você planeja rodar em 2027.
- Vozes da Voice Library - mais de 10.000 vozes compartilhadas por usuários do ElevenLabs e vozes que você mesmo desenha. Navegue pela biblioteca em elevenlabs.io, clique em Add Voice nas que gostar e cole o ID em
voice_id. Essas vozes persistem e são a escolha certa para produção.
O fluxo seguro: mesmo em um primeiro setup, escolha duas vozes da Voice Library, adicione as duas na sua conta e coloque a principal em voice_id. Quando uma for descontinuada (vozes da comunidade vão e vem), você troca sem correria.

Passo 5: escolha o modelo
Dois modelos importam para o Hermes no Telegram e você decide entre eles com base em latência versus qualidade:
| Modelo | Custo | Latência | Melhor para |
|---|---|---|---|
eleven_multilingual_v2 |
1 crédito / caractere | Maior, prioriza qualidade | Respostas longas, resposta a notas de voz, chat multilíngue |
eleven_flash_v2_5 |
0,5 crédito / caractere | Em torno de 75 ms até o primeiro byte | Respostas curtas de chat, conversa de baixa latência |
O Multilingual v2 é o padrão na configuração acima porque produz o áudio mais expressivo e cobre mais de 29 idiomas, o que importa se o seu Hermes Agent responde em português metade do tempo. O Flash v2.5 vence no chat curto de ida e volta, onde a resposta é uma frase ou duas e cada 100 ms se percebe.
Um padrão pragmático: comece no Multilingual v2, escute algumas respostas reais do seu bot e só passe para o Flash se a pausa depois da sua nota de voz realmente incomodar você ou a pessoa do outro lado.
Passo 6: a vantagem Opus no Telegram
Essa é a peça que a maior parte dos guias pula e é a razão de o ElevenLabs se encaixar melhor no Telegram do que quase qualquer alternativa.
As bolhas de voz do Telegram precisam ser codificadas em Opus. Motores de TTS locais como o NeuTTS produzem WAV, então o Hermes precisa chamar ffmpeg a cada resposta, e essa recodificação adiciona uma latência que dá para sentir. O ElevenLabs pode devolver Opus de forma nativa, então os bytes de áudio vão direto da resposta da API para a bolha de voz do Telegram, sem conversão.
Ainda assim vale ter o ffmpeg instalado como fallback:
sudo apt install ffmpeg # Linux
brew install ffmpeg # macOS
Mas com o ElevenLabs configurado, o ffmpeg fica ocioso no caminho feliz e as respostas de voz chegam mais rápido. Contraste com a comparação completa de provedores de TTS se estiver pesando isso contra NeuTTS ou Piper no mesmo lugar.
Passo 7: teste o loop inteiro
Do seu celular, envie uma nota de voz para o seu bot no Telegram:
- Segure o botão do microfone no chat, fale uma pergunta curta, solte
- O bot transcreve com o Whisper
- O agente processa a mensagem
- O ElevenLabs sintetiza a resposta como Opus
- O Hermes devolve como bolha de voz
O loop inteiro deve levar poucos segundos para uma pergunta curta, mais tempo se disparar chamadas de ferramentas ou consultas MCP. Se o áudio nunca chega, olhe o log do gateway atrás de 401 (chave errada), 429 (limitado pelo plano gratuito) ou voice_id not found (normalmente uma voz que você não adicionou à sua conta antes de colar o ID). Para uma varredura mais ampla, veja o guia de voz que não funciona.
Os trade-offs honestos
O ElevenLabs é o TTS que soa melhor que dá para conectar ao Hermes hoje, e não é isento de consequências que vale nomear:
- Cobrança por uso. Você paga por caractere e o plano gratuito é apertado. Se seu bot escreve respostas longas em escala, orçamento à vista.
- Hospedado nos EUA, só na nuvem. Cada resposta faz uma ida e volta ao ElevenLabs. Se seu agente precisa rodar em ambiente isolado ou seus dados não podem sair da sua jurisdição, NeuTTS ou Piper são a resposta honesta, não isso.
- Lock-in de fornecedor na voz. Uma voz clonada ou escolhida da Voice Library vive dentro do ElevenLabs. Se você trocar de provedor, reconstrói a identidade.
- Sunset das vozes preset. As vozes padrão se apagam no fim de 2026. Migre para a Voice Library antes.
Para a maior parte de quem roda um Hermes Agent pessoal no Telegram, nenhum desses é impeditivo, e o salto de qualidade é imediatamente audível.

Pule o cabeamento: a Hermify já entrega pré-configurado
O setup acima não é difícil, mas ainda são quatro pontos de configuração, um restart e uma caça ao voice_id para chegar no áudio que você quer. Se você preferir não gerenciar nada disso, a Hermify roda um Hermes Agent gerenciado no Telegram com a camada de TTS já provisionada. Adicione sua chave do ElevenLabs no painel, escolha seu voice_id, e a mudança vale na próxima resposta. Sem SSH, sem config.yaml, sem instalar ffmpeg. Os arquivos de memória continuam seus do mesmo jeito.
Comece com a Hermify e vá direto para a parte divertida: o momento em que seu bot responde com uma voz que soa como se fosse sua.
Fontes
- Documentação da API de Text-to-Speech do ElevenLabs
- Comparação de modelos do ElevenLabs
- Documentação da Voice Library do ElevenLabs
- Preços do ElevenLabs 2026 - Coda One
- Limites do plano gratuito do ElevenLabs 2026 - AI Voice Review
- Preços do ElevenLabs 2026 - Cekura
- Melhores vozes do ElevenLabs 2026 - Cognitive Future
- Guia da API do ElevenLabs 2026
Lance seu próprio agente Hermes
Traga sua chave de API, conecte o Telegram e tenha um agente de IA que evolui sozinho no ar em 60 segundos.
Começar agora