Torna al blog
VoiceTTSElevenLabsHermes

Hermes Agent + ElevenLabs: guida completa alla voce

Collega ElevenLabs al tuo Hermes Agent per le risposte vocali su Telegram. Dove va la chiave API, come scegliere voice_id e quale modello usare.

Di Hermify Team||8 min di lettura
Il logotipo ElevenLabs accanto a una forma d'onda audio verde su sfondo scuro, con l'etichetta ElevenLabs Voice Setup

La tua voce gratuita va bene, finché non ti sente qualcun altro

Edge TTS arriva insieme a Hermes Agent e non costa nulla. Funziona, offre più di 400 voci in decine di lingue e se sei l'unico ad ascoltare il tuo bot è davvero sufficiente. Nel momento in cui passi il tuo bot Telegram a un cliente, lo metti in una chat di gruppo o lo usi per registrare qualcosa a cui un umano reagirà, la voce di default suona esattamente come una voce di default. ElevenLabs è la soluzione più rapida ed è il provider TTS a pagamento più cercato tra quelli supportati da Hermes.

Questa guida è il cablaggio end-to-end, un file di configurazione alla volta. Cosa copre davvero il piano gratuito, dove va la chiave API, come scegliere una voice_id che esisterà ancora tra sei mesi, quale modello impostare per la chat rispetto ai testi lunghi e dove sono i compromessi onesti (ospitato negli USA, prezzo a consumo, nessun percorso offline). Niente screenshot, niente riempitivi, solo i passi e i numeri.

Cosa ti dà il piano gratuito

ElevenLabs assegna a ogni account 10.000 crediti al mese nel piano gratuito. Multilingual v2 fattura 1 credito per carattere, cioè circa 10.000 caratteri, all'incirca 1.500 parole parlate o da dieci a dodici minuti di audio finito a ritmo naturale. I crediti non si accumulano: il contatore si azzera nella tua data di fatturazione e quello che non hai usato sparisce.

Per un Hermes Agent personale che risponde a una manciata di note vocali Telegram al giorno, dieci minuti sono spesso l'intero mese. Per un bot rivolto al cliente, pianifica il piano Creator o superiore. Gli overage nel Creator sono intorno a 0,30 $ ogni 1.000 caratteri, ed è il numero onesto da mettere accanto a Edge TTS, che è gratis.

Due dettagli del piano gratuito da mettere subito in chiaro:

  • Il piano gratuito consente l'uso commerciale, ma l'audio deve attribuire ElevenLabs. In una chat privata va bene. Per un bot che parla ai tuoi clienti a pagamento, quell'obbligo di attribuzione è un motivo per pagare.
  • Le voci preset di default (Rachel, Adam e compagnia) verranno dismesse a fine 2026. Fissa una voice_id della Voice Library prima di quella data o il tuo bot si romperà in silenzio quando avverrà lo switch.

Passo 1: installa l'extra TTS premium

Hermes porta di serie i provider TTS gratuiti. ElevenLabs vive dietro l'extra tts-premium così le dipendenze restano leggere se non lo attivi mai:

pip install "hermes-agent[tts-premium]"

Se hai già installato l'extra messaging, lanciali insieme per evitare grattacapi al resolver:

pip install "hermes-agent[messaging,tts-premium]"

Passo 2: metti la chiave API dove Hermes la legge

Crea una chiave su elevenlabs.io, in Profile e poi API Keys. La chiave ha la forma sk_... ed è l'unica credenziale che ElevenLabs richiede. Va in ~/.hermes/.env:

ELEVENLABS_API_KEY=sk_la_tua_chiave_qui

Due cose su quel percorso. Primo: è ~/.hermes/.env, non il .env del progetto da cui hai lanciato Hermes - il gateway legge solo la directory di configurazione. Secondo: se preferisci esportare la chiave nella shell, Hermes la trova comunque, ma il file .env è quello che sopravvive a un reboot senza che tu debba pensarci.

Passo 3: collega il provider in config.yaml

Modifica ~/.hermes/config.yaml e imposta il blocco TTS:

tts:
  provider: elevenlabs
  voice_id: 21m00Tcm4TlvDq8ikWAM   # Rachel (voce femminile predefinita)
  model_id: eleven_multilingual_v2

Questa è tutta la configurazione. Riavvia il gateway:

hermes gateway restart

Da una sessione CLI verifica:

hermes
> /voice on
> Dì "uno due tre, ElevenLabs è collegato."

Dovresti sentire la risposta nella voce configurata. Se non senti nulla, le due cause tipiche sono una chiave sbagliata (401 nel log del gateway) e nessun ffmpeg sulla macchina quando Hermes prova a convertire l'audio per Telegram - vedi la sezione Telegram più avanti.

Passo 4: scegli una voice_id che continuerà a esistere

La voice_id è l'unica leva che decide come suona il tuo bot. Due famiglie di voci, accessibili nello stesso modo:

  • Voci preset - Rachel, Adam e gli altri nomi integrati nel piano gratuito. Costo zero, funzionano subito, ma, di nuovo: tutta la lista dei preset viene ritirata a fine 2026. Va bene per un esperimento del weekend, sbagliato per qualsiasi cosa tu intenda ancora eseguire nel 2027.
  • Voci della Voice Library - oltre 10.000 voci condivise dagli utenti ElevenLabs, più le voci che progetti tu. Sfoglia la libreria su elevenlabs.io, clicca Add Voice su quelle che ti piacciono e incolla l'ID in voice_id. Queste voci persistono e sono la scelta giusta per la produzione.

Il flusso sicuro: anche al primo setup, scegli due voci dalla Voice Library, aggiungile entrambe al tuo account e metti la principale in voice_id. Quando una viene dismessa (le voci della community vanno e vengono), sostituisci senza corse.

Un primo piano di una forma d'onda audio in verde su sfondo scuro, con picchi morbidi e luminosi che rappresentano l'audio parlato

Passo 5: scegli il modello

Per Hermes su Telegram contano due modelli e decidi tra loro in base a latenza vs qualità:

Modello Costo Latenza Migliore per
eleven_multilingual_v2 1 credito / carattere Più alta, priorità qualità Risposte lunghe, risposte a note vocali, chat multilingue
eleven_flash_v2_5 0,5 crediti / carattere Intorno ai 75 ms al primo byte Risposte brevi di chat, conversazione a bassa latenza

Multilingual v2 è il default nella configurazione sopra perché produce l'audio più espressivo e copre più di 29 lingue, cosa che conta se il tuo Hermes Agent risponde in italiano metà del tempo. Flash v2.5 vince nel botta e risposta breve, dove la risposta è di una o due frasi e ogni 100 ms si nota.

Un default pragmatico: parti da Multilingual v2, ascolta qualche risposta reale del tuo bot, e passa a Flash solo se la pausa dopo la tua nota vocale ti dà davvero fastidio, a te o alla persona dall'altra parte.

Passo 6: il vantaggio Opus su Telegram

Questo è il pezzo che la maggior parte delle guide salta ed è la ragione per cui ElevenLabs si adatta a Telegram meglio di quasi qualsiasi alternativa.

Le bolle vocali di Telegram devono essere codificate in Opus. I motori TTS locali come NeuTTS producono WAV, quindi Hermes deve invocare ffmpeg a ogni risposta, e questa ricodifica aggiunge una latenza che si sente. ElevenLabs può restituire Opus in modo nativo, così i byte audio vanno direttamente dalla risposta API alla bolla vocale di Telegram senza conversione.

Vuoi comunque ffmpeg installato come rete di sicurezza:

sudo apt install ffmpeg   # Linux
brew install ffmpeg        # macOS

Ma con ElevenLabs configurato, ffmpeg resta inattivo sul percorso felice e le risposte vocali arrivano più in fretta. Confronta con il paragone completo dei provider TTS se stai valutando questa scelta contro NeuTTS o Piper nello stesso slot.

Passo 7: verifica l'intero loop

Dal tuo telefono, invia una nota vocale al tuo bot Telegram:

  1. Tieni premuto il pulsante microfono nella chat, di' una domanda breve, rilascia
  2. Il bot trascrive con Whisper
  3. L'agente elabora il messaggio
  4. ElevenLabs sintetizza la risposta come Opus
  5. Hermes te la rimanda come bolla vocale

L'intero loop dovrebbe completarsi in pochi secondi per una domanda breve, di più se scatena chiamate a tool o interrogazioni MCP. Se l'audio non arriva mai, controlla il log del gateway cercando 401 (chiave sbagliata), 429 (limitato dal piano gratuito) o voice_id not found (di solito una voce che non hai aggiunto al tuo account prima di incollare l'ID). Per un giro di diagnosi più ampio, vedi la guida alla voce che non funziona.

I compromessi onesti

ElevenLabs è il TTS che suona meglio e che oggi puoi collegare a Hermes, e non è privo di conseguenze che vale la pena nominare:

  • Prezzo a consumo. Paghi per carattere e il piano gratuito è stretto. Se il tuo bot produce risposte lunghe su larga scala, fai il budget.
  • Ospitato negli USA, solo cloud. Ogni risposta fa avanti e indietro verso ElevenLabs. Se il tuo agente deve girare in ambiente isolato o i tuoi dati non possono lasciare la tua giurisdizione, NeuTTS o Piper sono la risposta onesta, non questo.
  • Lock-in del fornitore sulla voce. Una voce clonata o scelta dalla Voice Library vive dentro ElevenLabs. Se cambi provider, ricostruisci l'identità.
  • Sunset delle voci preset. Le voci di default si spengono a fine 2026. Passa alla Voice Library prima.

Per la maggior parte delle persone che fa girare un Hermes Agent personale su Telegram, nessuno di questi è un problema, e il salto di qualità si sente subito.

Una scena morbida e cinematografica di un telefono su una scrivania di legno che mostra una bolla vocale Telegram in riproduzione, con una debole forma d'onda verde sopra lo schermo

Salta il cablaggio: Hermify te lo consegna preconfigurato

Il setup qui sopra non è difficile, ma restano quattro punti di configurazione, un restart e una caccia al voice_id per ottenere l'audio che vuoi. Se preferisci non gestire nulla di tutto ciò, Hermify fa girare un Hermes Agent gestito su Telegram con il layer TTS già provisionato. Aggiungi la tua chiave ElevenLabs nella dashboard, scegli il tuo voice_id, e la modifica è attiva sulla risposta successiva. Niente SSH, niente config.yaml, niente installazione di ffmpeg. I file di memoria restano tuoi comunque.

Inizia con Hermify e salta dritto alla parte divertente: il momento in cui il tuo bot risponde con una voce che suona come se fosse tua.

Fonti

Avvia il tuo Hermes Agent

Porta la tua chiave API, collega Telegram e ottieni un agente IA che migliora da solo, online in 60 secondi.

Inizia ora