Volver al Blog
HermesOpenRouterPricingModels

Modelo más barato de OpenRouter para Hermes Agent en 2026

La lista de modelos de OpenRouter por debajo de 1 dólar por millón de tokens en 2026, ordenados por cargas reales con herramientas y coste mensual.

Por Hermify Team||7 min de lectura
Un panel oscuro que lista los precios de modelos de OpenRouter ordenados de más barato a más caro, con DeepSeek destacado arriba

La Pregunta Detrás de la Pregunta

Si ya elegiste OpenRouter como proveedor, lo siguiente que quieres saber no es "cuál es el mejor modelo". Es "cuál es el más barato que aún gestiona bien las cargas de Hermes Agent". Es una pregunta más estrecha, y en 2026 tiene una respuesta mucho más clara que hace un año.

Hermes Agent es un runtime cargado de herramientas. En cada turno le pasa al modelo un system prompt, una larga lista de definiciones de herramientas, el historial reciente del chat y los archivos que haya abierto. La salida suele ser corta, una respuesta breve y una o dos llamadas a herramientas. Esa forma tan pesada en entrada es lo que hace tan útiles los modelos con descuento por caché, y por eso "más barato" aquí significa "más barato dado cómo habla Hermes con el modelo", no el precio de tarifa más pequeño en una página de marketing.

La Lista Sub-1 Dólar por Millón de Tokens

Estos son los modelos disponibles en OpenRouter en julio de 2026 que se sitúan por debajo de 1 dólar por millón de tokens tanto en entrada como en salida. Los precios son los que OpenRouter traslada desde el proveedor original. Un modelo técnicamente más barato pero que no respeta bien los esquemas de herramientas o pierde llamadas a funciones bajo carga no aparece aquí: una llamada a herramienta rota en Hermes Agent significa que el turno entero desperdicia tokens y hay que reintentar.

Modelo Entrada $/M Salida $/M Descuento por caché Notas
DeepSeek V4-Pro 0,435 0,87 Hasta ~99% (acierto de caché a 0,003625 $/M) Buen tool calling, contexto de 1M, pesos abiertos
DeepSeek V4-Flash 0,14 0,28 Acierto de caché a 0,0028 $/M de entrada La variante más rápida de DeepSeek, útil para tareas auxiliares
GPT-4.1 Nano 0,10 0,40 Caché de prompt en OpenAI upstream El más flojo siguiendo herramientas del grupo
Gemini 2.5 Flash Lite 0,10 0,40 Sin descuento explícito por caché Rápido, tool calling aceptable
Llama 4 Scout (Groq / DeepInfra) 0,08 - 0,11 0,30 - 0,34 Sin descuento por caché Latencia más rápida y capa gratuita generosa para pruebas

Hay dos cosas que importan más que los precios de tarifa cuando ejecutas Hermes Agent contra estos modelos.

Primero, Hermes manda las mismas definiciones de herramientas en casi cada turno. Ese es exactamente el patrón para el que existe un caché KV. En DeepSeek V4-Pro, un acierto de caché cuesta 0,003625 $ por millón de tokens de entrada, unas 120 veces menos que un fallo de caché. A lo largo de una semana real de uso de Hermes, los tokens de acierto de caché dominan y el coste efectivo por turno cae muy por debajo del número de portada.

Segundo, si un modelo devuelve llamadas a herramientas malformadas bajo carga, Hermes reintenta. Cada reintento es un turno de entrada nuevo completo. Un modelo un 20% más barato pero que falla el 10% de las llamadas a herramientas acaba saliendo más caro que uno "más caro" que acierta a la primera. Por eso DeepSeek V4-Pro está arriba en esta lista aunque haya modelos con precios de portada más bajos.

La Receta que la Mayoría Realmente Quiere

El patrón más común en la comunidad de OpenRouter para un despliegue de Hermes a bajo coste es un split de dos modelos. Apuntas Hermes a un modelo más fuerte para el bucle principal de razonamiento y enrutas las tareas auxiliares - compresión de contexto, títulos de chats, visión a texto, resumen de sesión - a algo más barato.

En tu ~/.hermes/config.yaml, eso queda más o menos así:

provider: openrouter
model: deepseek/deepseek-v4-pro
openrouter_api_key: sk-or-your-key-here

auxiliary_model:
  compression: openai/gpt-4.1-nano
  title_generation: openai/gpt-4.1-nano
  vision: google/gemini-2.5-flash-lite
  web_summary: openai/gpt-4.1-nano

El modelo principal se queda con el razonamiento duro y las llamadas a herramientas. El modelo auxiliar se ocupa de lo que Hermes hace en segundo plano, mucho más tolerante a un modelo más débil. Entre los dos cubres cerca del 95% de las interacciones al precio más ajustado posible.

Si prefieres primero el setup completo de OpenRouter, lee Cómo configurar Hermes Agent con OpenRouter. Este post asume que ya tienes una API key de OpenRouter y estás eligiendo modelo.

Dónde Fallan los Modelos Baratos

El compromiso honesto en este segmento es que los modelos sub-1$ son fuertes en cargas repetitivas guiadas por skills y más débiles en razonamiento nuevo y difícil. El trabajo diario de Hermes Agent - digests programados con cron, resúmenes de RSS, escrituras a memoria, "recuérdamelo mañana", triaje en Telegram - es exactamente donde los modelos baratos se defienden bien.

Donde los modelos baratos se caen:

  • Depuraciones largas y multi-paso donde el modelo tiene que sostener mucho estado y revisar el plan
  • Redacción legal o médica que penaliza el más mínimo error factual
  • Revisión de código de diffs no triviales donde importan matices semánticos sutiles
  • Cualquier tarea donde estar al 90% es peor que estar al 100%

Para esos casos, la respuesta no es "comprar un modelo barato más grande", es "enrutar por tarea". Deja DeepSeek V4-Pro (o un modelo sub-1$ similar) como tu opción por defecto. Configura un fallback a Claude Sonnet o GPT-4o para las skills específicas que lo necesiten. Pagas precios de gama alta en la pequeña porción de turnos que necesitan calidad de gama alta y precios baratos para el 95% restante.

El post mejor proveedor de modelos para Hermes Agent profundiza en el compromiso a nivel de proveedor. Este post es un nivel más estrecho: dado que ya elegiste OpenRouter, ¿a qué modelo concreto enrutar?

Qué Significa Esto para tu Factura Mensual

Si estás autohospedando Hermes y pagas el modelo directamente en OpenRouter, la franja sub-1$ es lo que mantiene la factura mensual realmente pequeña. Un usuario diario con unos pocos crons y una docena de idas y vueltas al día, con DeepSeek V4-Pro y los aciertos de caché funcionando, suele quedarse en un rango bajo, de pocos dólares al mes. Un uso intensivo de voz o scraping web sube la cifra, pero no en un orden de magnitud.

Si estás en el tier Starter de Hermify, el gasto de modelo es bring-your-own-key en OpenRouter, así que la elección de arriba determina literalmente tu factura mensual. Elegir DeepSeek V4-Pro como modelo principal y un nano para tareas auxiliares es lo que la mayoría de usuarios Starter acaban adoptando tras una semana o dos de experimentar.

Si toda esa matemática de modelos es más de lo que quieres pensar, o prefieres una línea de coste predecible en lugar de una factura de API variable, entonces tiene sentido un tier gestionado con clave incluida. El desglose completo está en cuánto cuesta realmente ejecutar Hermes Agent.

Qué Hacer Ahora

Si quieres el camino más corto:

  1. Regístrate en OpenRouter y añade un pequeño saldo de créditos.
  2. Configura model: deepseek/deepseek-v4-pro en tu ~/.hermes/config.yaml.
  3. Añade un bloque de modelo auxiliar para compresión y títulos apuntando a openai/gpt-4.1-nano.
  4. Ejecuta Hermes durante una semana y vigila el dashboard de OpenRouter. Verás cómo la proporción de aciertos de caché sube rápido en el modelo principal.

Si prefieres saltarte el archivo de configuración por completo, empieza con Hermify. Ejecutamos un Hermes Agent gestionado en Telegram, tú conectas tu clave de OpenRouter y el mismo patrón DeepSeek + auxiliar viene por defecto. Te concentras en lo que hace el agente, no en la configuración que lo mueve.

Fuentes

Lanza tu propio agente Hermes

Trae tu clave de API, conecta Telegram y ten un agente de IA que evoluciona solo activo en 60 segundos.

Empezar