Quanto custa por mês um agente de IA em 2026?
Decomposição real do custo mensal de um agente de IA auto-hospedado em 2026: VPS, API do modelo, voz e como o uso muda a conta.
A resposta honesta fica entre 6 e 80 dólares por mês, e quase tudo é gasto de modelo
Um agente de IA pessoal rodando 24/7 numa VPS pequena com uma chave da OpenRouter ou da Anthropic costuma custar entre 6 dólares por mês no caso mais leve e uns 80 dólares em uso pesado. A infraestrutura é quase um erro de arredondamento nessa conta: são de 4 a 8 dólares de VPS pequena por mês, não importa o quanto você conversa com o agente. Tudo acima desse piso é gasto de modelo, que escala com quantos tokens o modelo lê e escreve por você.
Se você estava tentando fazer engenharia reversa desse número a partir de calculadoras que falam de 200 a 10.000 dólares por mês, a confusão faz sentido. Esses números descrevem agentes corporativos de call center que atendem dezenas de milhares de conversas por mês, não o assistente de uma pessoa no Telegram. Este post é a decomposição do segundo caso: um operador solo, um canal de mensagens e as contas honestas.
Por que a conta se divide em duas
O custo mensal de um agente de IA é a soma de duas linhas independentes:
- Infraestrutura: um pequeno servidor Linux que fica online, guarda o estado da conversa e roda o gateway de mensagens. Custo fixo.
- Gasto de modelo: chamadas por token ao provedor do modelo (OpenRouter, Anthropic, OpenAI). Custo variável, escala com o uso.
Quase nunca vale a pena rodar o modelo na sua própria máquina para um agente pessoal. Inferência local de LLM precisa de GPU ou de 16 a 32 GB de RAM, o que empurra a conta de hardware para cima do que o pagamento por token custaria em uso pessoal realista. O restante do texto assume que o modelo mora num provedor e a sua VPS só conversa com ele.
Essa divisão é o que torna o total honestamente estimável. O piso de infraestrutura é previsível; o gasto de modelo é função do seu número de mensagens e do tamanho delas.
Linha 1: O piso de infraestrutura
Um agente por API no Telegram, Signal ou Slack precisa de surpreendentemente pouco hardware. A base mínima é de uma a duas vCPUs, 1 a 2 GB de RAM e 20 a 40 GB de SSD. A maioria dos runtimes, incluindo o Hermes Agent, roda confortavelmente com 2 GB de RAM.
Números mensais reais em 2026 para essa configuração:
- Hetzner CX22 (2 vCPUs, 4 GB de RAM, 40 GB NVMe): cerca de 3,79 euros por mês na UE, mais ou menos 4,59 a 4,99 dólares nas regiões dos EUA. Inclui 20 TB de tráfego de saída. É a recomendação padrão nas comunidades de auto-hospedagem.
- DigitalOcean Basic Droplet (1 vCPU, 1 GB de RAM): 6 dólares por mês, ou cerca de 12 dólares por mês na faixa de 2 GB. Preços previsíveis e documentação mais limpa que a da Hetzner, pagando de 2 a 4 vezes mais pela mesma configuração.
- Oracle Cloud Always Free ARM: 0 dólar por mês se a sua conta sobreviver à política de recuperação. Nível gratuito real, com fricção real na aprovação da conta.
- Raspberry Pi 5 em casa: 80 dólares de compra única mais 2 a 4 dólares por mês de energia elétrica para ficar 24/7 ligado. Mais barato no longo prazo, pior se a sua internet residencial não é estável.
Para uma primeira estimativa, use 6 dólares por mês como piso de infraestrutura. De uma Hetzner CX22 a um droplet pequeno da DigitalOcean, tudo cabe aí ou abaixo. Se você quer os prós e contras em detalhes, comparamos em VPS baratas para agentes de IA.
Linha 2: O gasto de modelo
Aqui a faixa se abre. Os provedores de modelo cobram por milhão de tokens de entrada (o que o modelo lê, incluindo o histórico da conversa que vai crescendo) e por milhão de tokens de saída (o que ele escreve de volta). Um token equivale a cerca de 4 caracteres em inglês, ou aproximadamente 0,75 de uma palavra.
As tarifas que importam para um agente pessoal em meados de 2026:
- Claude Haiku 4.5: 1,00 dólar por milhão de tokens de entrada e 5,00 dólares por milhão de tokens de saída. O cavalo de batalha barato para o chat do dia a dia.
- GPT-4o: cerca de 2,50 dólares por milhão de tokens de entrada na OpenRouter e 10 dólares por milhão de saída. Fica na mesma faixa de desempenho que o Claude Sonnet.
- Claude Sonnet 4.6: 3,00 dólares por milhão de tokens de entrada e 15 dólares por milhão de saída. Use quando a tarefa realmente pedir raciocínio extra.
- Gemini Flash: a partir de 0,075 dólar por milhão de tokens de entrada na OpenRouter. A mais barata entre as opções conhecidas, útil como camada de fallback.
Duas coisas surpreendem quem está começando:
- Cada mensagem reexecuta a conversa inteira. O modelo não tem memória própria. Cada nova mensagem é processada como se todos os turnos anteriores fossem prefixados à entrada, então no turno 10 uma única resposta é cobrada por cerca de 7 vezes os tokens do turno 1 para a mesma saída. Por isso um agente tagarela que nunca corta contexto pode parecer caro mesmo quando cada mensagem individual é curta.
- Os tokens de saída custam de 4 a 5 vezes mais que os de entrada. Um modelo verboso que escreve parágrafos longos para uma pergunta de uma linha gasta cinco vezes o que um mais direto gasta pela mesma qualidade de resposta.
Como isso aparece em faturas mensais reais
Assuma 4 caracteres por token, 750 tokens numa resposta curta típica do assistente e algumas centenas de tokens de sobrecarga no system prompt. Aproximações arredondadas e honestas para três perfis de uso usando Claude Haiku 4.5 ou um modelo semelhante de entrada abaixo do dólar:
- Uso leve (cerca de 20 conversas por dia, 6 turnos cada): entre 3 e 6 milhões de tokens por mês. De 5 a 12 dólares por mês de gasto de modelo.
- Uso médio (cerca de 80 conversas por dia, 8 turnos cada): entre 15 e 25 milhões de tokens por mês. De 25 a 50 dólares por mês.
- Uso pesado (cerca de 200 conversas por dia, 10 turnos cada, com transcrição de voz e TTS): de 40 a 80 milhões de tokens por mês mais o áudio. De 60 a 150 dólares por mês.
Trocar tudo para Claude Sonnet 4.6 triplica esses números, mais ou menos. Trocar para Gemini Flash mais ou menos os divide pela metade. A escolha do modelo é, de longe, a maior alavanca sobre o total.
Linha opcional: Voz
Se o agente recebe mensagens de voz e responde em voz, a conta cresce com mais duas linhas variáveis: STT (voz para texto) para transcrever o áudio de entrada e TTS (texto para voz) para sintetizar a resposta. Números para planejar:
- API Whisper da OpenAI: 0,006 dólar por minuto de áudio de entrada. Um minuto por dia fica abaixo de 0,20 dólar por mês; meia hora por dia é cerca de 5 dólares por mês.
- ElevenLabs: preço por uso, começa em 5 dólares por mês no plano Starter, e o uso real em produção fica entre 22 e 99 dólares por mês dependendo dos caracteres sintetizados. Veja Configuração de voz com ElevenLabs no Hermes Agent para os trade-offs.
- Alternativas auto-hospedadas: Whisper.cpp, faster-whisper, Piper ou Edge TTS. De graça no nível de software, adicionam alguns GB de RAM à sua VPS se você seguir esse caminho.
Para a maioria dos operadores solos, a voz adiciona de 10 a 30 dólares por mês a uma configuração só de texto em uso típico.
Juntando tudo: Os três perfis
Somando tudo o que veio acima, o custo mensal honesto de rodar um agente de IA pessoal 24/7 em 2026 fica assim:
- Leve (só texto, modelo barato, VPS pequena): de 10 a 20 dólares por mês. Infraestrutura 6, gasto de modelo 5 a 12, voz 0.
- Médio (mistura de modelos, voz ocasional, VPS pequena): de 40 a 80 dólares por mês. Infraestrutura 6, gasto de modelo 25 a 50, voz 10 a 25.
- Pesado (modelo classe Sonnet, voz diária, RAM com folga): de 100 a 200 dólares por mês. Infraestrutura 12, gasto de modelo 60 a 150, voz 20 a 40.
A conta é dominada pela escolha do modelo, não pela hospedagem. Um usuário que sai de Sonnet-para-tudo para Haiku-no-chat-e-Sonnet-nas-perguntas-difíceis consegue cortar o total mensal pela metade ou mais sem perder o raciocínio que ele realmente precisa.
A linha oculta: Seu tempo
Os números auto-hospedados acima assumem que o agente fica de pé sozinho. Na prática, o primeiro mês costuma custar uma tarde de configuração, e cada atualização de SO ou de runtime custa mais uma hora. Limites de taxa, chaves de API expiradas ou um contêiner Docker que reinicia em silêncio toda noite (problema comum que tratamos em Contêiner Docker do Hermes Agent reiniciando o tempo todo) custam o próprio tempo de diagnóstico.
O jeito justo de encaixar isso na conta é por hora do seu próprio trabalho. Se cuidar de um agente auto-hospedado te custa duas horas por mês e o seu tempo vale 50 dólares por hora, isso são 100 dólares por mês que você está pagando a si mesmo em espécie. Raramente aparece na planilha, mas é o motivo pelo qual a maioria dos operadores solos eventualmente migra para uma opção gerenciada.
A alternativa gerenciada
Se você prefere não cuidar da VPS, manter a conta da OpenRouter ou acompanhar qualquer coisa disso: a Hermify hospeda um Hermes Agent gerenciado no Telegram com memória persistente que continua sua. Você traz a sua própria chave de modelo (BYOK) no plano de entrada, então o gasto do modelo continua aparecendo na sua fatura e você continua controlando, mas a linha de infraestrutura desaparece inteira. Para quem pesquisa custo especificamente contra um equivalente com marca, decompomos os nossos próprios planos em Quanto custa o Hermes Agent.
Essa é a conclusão honesta de qualquer artigo sobre custo mensal: o piso bruto de infraestrutura de um agente auto-hospedado é barato, o gasto de modelo é o mesmo dos dois lados, e a variável escondida é quanto da sua atenção a configuração consome. Faça as contas nas três linhas antes de escolher.
Sources
Lance seu próprio agente Hermes
Traga sua chave de API, conecte o Telegram e tenha um agente de IA que evolui sozinho no ar em 60 segundos.
Começar agora