Voltar ao Blog
HermesOpenRouterPricingModels

Modelo mais barato da OpenRouter para Hermes Agent em 2026

A lista dos modelos da OpenRouter abaixo de 1 dólar por milhão de tokens em 2026, ordenados por cargas reais com ferramentas e custo mensal total.

Por Hermify Team||7 min de leitura
Um painel escuro listando os preços de modelos da OpenRouter ordenados do mais barato ao mais caro, com DeepSeek destacado no topo

A Pergunta por Trás da Pergunta

Se você já escolheu a OpenRouter como provedor, a próxima coisa que quer saber não é "qual é o melhor modelo". É "qual é o mais barato que ainda dá conta das cargas do Hermes Agent". É uma pergunta mais estreita, e em 2026 ela tem uma resposta bem mais clara do que há um ano.

O Hermes Agent é um runtime pesado em ferramentas. A cada turno ele entrega ao modelo um system prompt, uma longa lista de definições de ferramentas, o histórico recente do chat e quaisquer arquivos abertos. O lado de saída costuma ser pequeno, uma resposta curta e uma ou duas chamadas de ferramenta. Essa forma pesada na entrada é o que torna os modelos com desconto de cache tão úteis, e por isso "mais barato" aqui significa "mais barato dado como o Hermes conversa com o modelo", não o menor preço de tabela em uma página de marketing.

A Lista Sub-1 Dólar por Milhão de Tokens

Estes são os modelos disponíveis na OpenRouter em julho de 2026 que ficam abaixo de 1 dólar por milhão de tokens tanto na entrada quanto na saída. Os preços são o que a OpenRouter repassa do provedor de origem. Um modelo tecnicamente mais barato mas que não segue bem os esquemas de ferramenta ou perde chamadas de função sob carga não entra nesta lista, porque uma chamada quebrada no Hermes Agent significa que o turno inteiro desperdiça tokens e precisa ser refeito.

Modelo Entrada $/M Saída $/M Desconto de cache Notas
DeepSeek V4-Pro 0,435 0,87 Até ~99% (cache hit a $0,003625/M) Bom tool calling, contexto de 1M, pesos abertos
DeepSeek V4-Flash 0,14 0,28 Cache hit a $0,0028/M de entrada Variante mais rápida do DeepSeek, boa para tarefas auxiliares
GPT-4.1 Nano 0,10 0,40 Prompt caching na OpenAI upstream O mais fraco em seguir ferramentas do grupo
Gemini 2.5 Flash Lite 0,10 0,40 Sem desconto de cache explícito Rápido, tool calling tolerável
Llama 4 Scout (Groq / DeepInfra) 0,08 - 0,11 0,30 - 0,34 Sem desconto de cache Menor latência e camada gratuita generosa para testes

Duas coisas importam mais do que os preços de tabela quando você roda o Hermes Agent contra esses modelos.

Primeiro, o Hermes envia as mesmas definições de ferramenta em quase todo turno. Esse é exatamente o padrão para o qual um cache KV existe. No DeepSeek V4-Pro, um cache hit custa $0,003625 por milhão de tokens de entrada, cerca de 120x menos que um miss. Em uma semana real de uso do Hermes, os tokens de cache hit dominam e o custo efetivo por turno cai bem abaixo do número da capa.

Segundo, se um modelo retorna chamadas de ferramenta malformadas sob carga, o Hermes tenta de novo. Cada retry é um turno de entrada completo. Um modelo 20% mais barato que erra 10% das chamadas acaba mais caro do que aquele modelo "menos barato" que acerta de primeira. É por isso que o DeepSeek V4-Pro fica no topo desta lista mesmo com alguns modelos tendo preços de capa menores.

A Receita que a Maioria Realmente Quer

O padrão mais comum na comunidade da OpenRouter para uma implantação barata do Hermes é um split de dois modelos. Você aponta o Hermes para um modelo mais forte no loop principal de raciocínio e roteia tarefas auxiliares - compressão de contexto, títulos de chat, visão para texto, resumo de sessão - para algo mais barato.

No seu ~/.hermes/config.yaml, isso fica mais ou menos assim:

provider: openrouter
model: deepseek/deepseek-v4-pro
openrouter_api_key: sk-or-your-key-here

auxiliary_model:
  compression: openai/gpt-4.1-nano
  title_generation: openai/gpt-4.1-nano
  vision: google/gemini-2.5-flash-lite
  web_summary: openai/gpt-4.1-nano

O modelo principal fica com o raciocínio difícil e as chamadas de ferramenta. O modelo auxiliar cuida do que o Hermes faz em segundo plano, muito mais tolerante a um modelo fraco. Juntos, isso cobre cerca de 95% das interações no menor preço possível.

Se preferir primeiro o setup completo da OpenRouter, leia Como configurar o Hermes Agent com a OpenRouter. Este post assume que você já tem uma chave da OpenRouter e está escolhendo modelo.

Onde os Modelos Baratos Falham

O trade-off honesto nessa faixa é que modelos sub-1$ são fortes em cargas repetitivas orientadas por skills e mais fracos em raciocínio novo e difícil. O dia a dia do Hermes Agent - digests agendados via cron, resumos de RSS, gravações de memória, "me lembra amanhã", triagem no Telegram - é exatamente onde os modelos baratos se saem bem.

Onde os modelos baratos caem:

  • Depurações longas em vários passos, onde o modelo precisa manter muito estado e revisar o plano
  • Redação jurídica ou médica que pune pequenos erros factuais
  • Revisão de código em diffs não triviais, onde nuances semânticas importam
  • Qualquer tarefa em que estar 90% certo é pior do que estar 100% certo

Para esses casos, a resposta não é "comprar um modelo barato maior", é "rotear por tarefa". Deixe o DeepSeek V4-Pro (ou um sub-1$ similar) como seu padrão. Configure um fallback para Claude Sonnet ou GPT-4o para as skills que precisam. Você paga preços de topo na pequena parcela de turnos que exige qualidade de topo e preços baratos nos 95% que não exigem.

O post melhor provedor de modelos para Hermes Agent traz mais sobre o trade-off no nível de provedor. Este post é um nível mais estreito: dado que você já escolheu a OpenRouter, para qual modelo específico rotear.

O Que Isso Significa para sua Conta Mensal

Se você está auto-hospedando o Hermes e pagando o modelo direto na OpenRouter, a faixa sub-1$ é o que mantém a conta mensal realmente pequena. Um usuário diário com alguns crons e uma dúzia de trocas por dia, no DeepSeek V4-Pro com cache hits funcionando, normalmente fica em uma faixa baixa, de poucos dólares por mês. Uso pesado de voz ou de scraping da web sobe o número, mas não em uma ordem de grandeza.

Se você está no plano Starter da Hermify, o custo do modelo é bring-your-own-key na OpenRouter, então a escolha acima determina literalmente sua conta mensal. Escolher o DeepSeek V4-Pro como modelo principal e um nano para tarefas auxiliares é o que a maioria dos usuários Starter acaba adotando depois de uma semana ou duas de experimentação.

Se toda essa matemática de modelos é mais do que você quer pensar, ou se prefere uma linha única de custo previsível em vez de uma conta variável de API, aí faz sentido um plano gerenciado com a chave já incluída. O detalhamento completo está em quanto custa realmente rodar o Hermes Agent.

O Que Fazer Agora

Se você quer o caminho mais curto:

  1. Cadastre-se na OpenRouter e adicione um pequeno saldo de créditos.
  2. Defina model: deepseek/deepseek-v4-pro no seu ~/.hermes/config.yaml.
  3. Adicione um bloco de modelo auxiliar para compressão e títulos apontando para openai/gpt-4.1-nano.
  4. Rode o Hermes por uma semana e acompanhe o painel da OpenRouter. Você vai ver a fatia de cache hits subir rápido no modelo principal.

Se você quer pular o arquivo de configuração por completo, comece com a Hermify. Rodamos um Hermes Agent gerenciado no Telegram, você conecta sua chave da OpenRouter e o mesmo padrão DeepSeek + auxiliar vem por padrão. Você foca no que o agente faz, não na configuração que o mantém rodando.

Fontes

Lance seu próprio agente Hermes

Traga sua chave de API, conecte o Telegram e tenha um agente de IA que evolui sozinho no ar em 60 segundos.

Começar agora