Torna al blog
AI AgentsPricingSelf-hosting

Quanto costa al mese un agente IA nel 2026?

Analisi reale del costo mensile di un agente IA self-hosted nel 2026: VPS, API del modello, voce e come cambia in base all'uso.

Di Hermify Team||8 min di lettura
Scrivania minimalista scura con un laptop, un caffè e il testo 'Costo mensile di un agente IA'

La risposta onesta è tra 6 e 80 dollari al mese, e quasi tutto è spesa di modello

Un agente IA personale in esecuzione 24/7 su una piccola VPS con una chiave OpenRouter o Anthropic costa di solito tra 6 dollari al mese nel caso più leggero e circa 80 dollari con un uso intenso. L'infrastruttura, in quel totale, è quasi un errore di arrotondamento: sono 4-8 dollari di VPS piccola ogni mese, indipendentemente da quanto parli con l'agente. Tutto quello che c'è sopra è spesa di modello, che scala con quanti token il modello legge e scrive per te.

Se stavi provando a ricostruire quel numero partendo da calcolatori che parlano di 200-10.000 dollari al mese, la confusione è comprensibile. Quei numeri descrivono agenti di call center enterprise che gestiscono decine di migliaia di conversazioni al mese, non l'assistente di una singola persona su Telegram. Questo post è la scomposizione del secondo caso: un solo operatore, un canale di messaggistica, i conti onesti.

Perché la bolletta si divide in due

Il costo mensile di un agente IA è la somma di due voci indipendenti:

  • Infrastruttura: un piccolo server Linux che resta online, tiene lo stato della conversazione e fa girare il gateway di messaggistica. Costo fisso.
  • Spesa di modello: chiamate a token verso il fornitore del modello (OpenRouter, Anthropic, OpenAI). Costo variabile, scala con l'uso.

Per un agente personale non conviene quasi mai far girare il modello sulla tua macchina. L'inferenza locale di un LLM richiede una GPU o 16-32 GB di RAM, e questo spinge la bolletta hardware sopra a quello che ti costerebbe il pay-per-token con un uso personale realistico. Il resto dell'articolo assume che il modello viva da un fornitore e che la tua VPS ci parli soltanto.

Questa separazione è ciò che rende il totale stimabile in modo onesto. Il fondo di infrastruttura si conosce in anticipo; la spesa di modello è una funzione del numero e della lunghezza dei tuoi messaggi.

Riga 1: Il fondo di infrastruttura

Un agente basato su API su Telegram, Signal o Slack ha bisogno di sorprendentemente poco hardware. La base minima è una o due vCPU, 1-2 GB di RAM e 20-40 GB di SSD. La maggior parte dei runtime, incluso Hermes Agent, gira comodamente in 2 GB di RAM.

Numeri mensili reali per il 2026 per quella configurazione:

  • Hetzner CX22 (2 vCPU, 4 GB di RAM, 40 GB NVMe): circa 3,79 euro al mese in UE, più o meno 4,59-4,99 dollari nelle regioni USA. Include 20 TB di traffico in uscita. È la raccomandazione di default nelle community self-hosting.
  • DigitalOcean Basic Droplet (1 vCPU, 1 GB di RAM): 6 dollari al mese, oppure circa 12 dollari al mese per la fascia 2 GB. Prezzi prevedibili e documentazione più pulita rispetto a Hetzner, a fronte di 2-4 volte il prezzo per la stessa configurazione.
  • Oracle Cloud Always Free ARM: 0 dollari al mese se il tuo account sopravvive alla reclaim policy. Free tier vero, attrito vero nell'approvazione dell'account.
  • Raspberry Pi 5 a casa: 80 dollari una tantum più 2-4 dollari al mese di elettricità per un uso 24/7. Più economica sul lungo periodo, meno affidabile se la tua connessione casalinga non è stabile.

Per una prima stima, usa 6 dollari al mese come fondo di infrastruttura. Da una Hetzner CX22 a un piccolo droplet DigitalOcean, tutto sta lì o sotto. Se vuoi i trade-off nel dettaglio, li abbiamo confrontati in VPS economiche per agenti IA.

Riga 2: La spesa di modello

È qui che la forbice si apre. I fornitori di modelli fatturano al milione di token in input (quello che il modello legge, compreso lo storico della conversazione che cresce) e al milione di token in output (quello che il modello scrive in risposta). Un token corrisponde più o meno a 4 caratteri di inglese, ovvero circa 0,75 parole.

Le tariffe che contano per un agente personale a metà 2026:

  • Claude Haiku 4.5: 1,00 dollaro per milione di token in input, 5,00 dollari per milione di token in output. Il cavallo di battaglia economico per la chat di tutti i giorni.
  • GPT-4o: circa 2,50 dollari per milione di token in input su OpenRouter, 10 dollari per milione in output. Si posiziona nella stessa fascia di prestazioni di Claude Sonnet.
  • Claude Sonnet 4.6: 3,00 dollari per milione in input, 15 dollari per milione in output. Usalo quando l'attività richiede davvero il ragionamento extra.
  • Gemini Flash: da 0,075 dollari per milione di token in input su OpenRouter. La più economica tra le opzioni mainstream, utile come livello di fallback.

Due cose superano ciò che chi inizia si aspetta:

  1. Ogni messaggio rigioca tutta la conversazione. Il modello non ha memoria propria. Ogni nuovo messaggio viene elaborato come se tutti i turni precedenti fossero anteposti all'input, quindi al turno 10 una singola risposta viene fatturata su circa 7 volte i token del turno 1 per lo stesso output. Per questo un agente logorroico che non taglia mai il contesto può sembrare caro anche quando ogni singolo messaggio è breve.
  2. I token in output costano 4-5 volte più di quelli in input. Un modello prolisso che scrive lunghi paragrafi per una domanda di una riga spende cinque volte quello che spende un modello asciutto per la stessa qualità di risposta.

Come si presenta tutto questo su bollette mensili reali

Assumi 4 caratteri per token, 750 token in una risposta breve tipica dell'assistente e un overhead di system prompt su qualche centinaio di token. Approssimazioni arrotondate e oneste per tre profili di uso con Claude Haiku 4.5 o un modello simile con input sotto il dollaro:

  • Uso leggero (circa 20 conversazioni al giorno, 6 turni ciascuna): tra 3 e 6 milioni di token al mese. Da 5 a 12 dollari al mese di spesa di modello.
  • Uso medio (circa 80 conversazioni al giorno, 8 turni ciascuna): tra 15 e 25 milioni di token al mese. Da 25 a 50 dollari al mese.
  • Uso intenso (circa 200 conversazioni al giorno, 10 turni ciascuna, con trascrizione vocale e TTS): 40-80 milioni di token al mese più audio. Da 60 a 150 dollari al mese.

Passare a Claude Sonnet 4.6 per tutto triplica più o meno questi numeri. Passare a Gemini Flash li dimezza più o meno. La scelta del modello è di gran lunga la leva più importante sul totale.

Riga opzionale: La voce

Se l'agente riceve messaggi vocali e risponde in voce, la bolletta cresce con altre due voci variabili: STT (voce in testo) per trascrivere l'audio in ingresso e TTS (testo in voce) per sintetizzare la risposta. Numeri con cui pianificare:

  • API Whisper di OpenAI: 0,006 dollari per minuto di audio in input. Un minuto al giorno resta sotto 0,20 dollari al mese; mezz'ora al giorno sono circa 5 dollari al mese.
  • ElevenLabs: prezzi a uso, si parte da 5 dollari al mese sul piano Starter, l'uso reale in produzione va tra 22 e 99 dollari al mese in base ai caratteri sintetizzati. Vedi Setup della voce ElevenLabs per Hermes Agent per i trade-off.
  • Alternative self-hosted: Whisper.cpp, faster-whisper, Piper o Edge TTS. Gratis a livello software, aggiungono qualche GB di RAM alle specifiche del tuo VPS se prendi quella strada.

Per la maggior parte degli operatori solisti, la voce aggiunge dai 10 ai 30 dollari al mese a una configurazione solo testo con un uso tipico.

Mettiamo tutto insieme: I tre profili

Sommando tutto, il costo mensile onesto di un agente IA personale che gira 24/7 nel 2026 è così:

  • Leggero (solo testo, modello economico, piccola VPS): da 10 a 20 dollari al mese. Infrastruttura 6, spesa di modello 5-12, voce 0.
  • Medio (mix di modelli, voce occasionale, piccola VPS): da 40 a 80 dollari al mese. Infrastruttura 6, spesa di modello 25-50, voce 10-25.
  • Intenso (modello di classe Sonnet, voce quotidiana, RAM con margine): da 100 a 200 dollari al mese. Infrastruttura 12, spesa di modello 60-150, voce 20-40.

Nella bolletta comanda la scelta del modello, non l'hosting. Un utente che passa da Sonnet-per-tutto a Haiku-in-chat-e-Sonnet-per-le-domande-difficili può dimezzare o più il totale mensile senza perdere il ragionamento di cui ha davvero bisogno.

La riga nascosta: Il tuo tempo

I numeri self-hosted qui sopra assumono che l'agente resti in piedi da solo. Nella pratica il primo mese costa in genere una serata di setup, e ogni aggiornamento di sistema o di runtime costa un'altra ora. Rate limit, chiavi API scadute o un container Docker che si riavvia in silenzio ogni notte (un problema comune di cui parliamo in Il container Docker di Hermes Agent continua a riavviarsi) costano ciascuno il proprio tempo di diagnosi.

Il modo equo per contabilizzarlo è per ora del tuo lavoro. Se badare a un agente self-hosted ti costa due ore al mese e il tuo tempo vale 50 dollari all'ora, sono 100 dollari al mese che stai pagando a te stesso in natura. Difficilmente compare in un foglio di calcolo, ma è il motivo per cui la maggior parte degli operatori solisti alla fine passa a un'opzione gestita.

L'alternativa gestita

Se preferisci non gestire la VPS, non tenere il conto OpenRouter o non tracciare niente di tutto questo: Hermify ospita un Hermes Agent gestito su Telegram con memoria persistente che resta tua. Sul piano di ingresso porti la tua chiave del modello (BYOK), così la spesa di modello continua a comparire sulla tua bolletta e resta sotto il tuo controllo, ma la riga di infrastruttura scompare del tutto. Per chi confronta i costi contro un equivalente di marca, abbiamo scomposto i nostri piani in Quanto costa Hermes Agent.

Questa è la conclusione onesta di qualsiasi articolo sul costo mensile: il fondo grezzo di infrastruttura di un agente self-hosted è basso, la spesa di modello è la stessa da entrambi i lati, e la variabile nascosta è quanta della tua attenzione la configurazione ti mangia. Fai i conti su tutte e tre le righe prima di scegliere.

Sources

Avvia il tuo Hermes Agent

Porta la tua chiave API, collega Telegram e ottieni un agente IA che migliora da solo, online in 60 secondi.

Inizia ora