Volver al Blog
AI AgentsPricingSelf-hosting

¿Cuánto cuesta al mes un agente de IA en 2026?

Desglose real del coste mensual de un agente de IA autoalojado en 2026: VPS, API del modelo, voz y cómo cambia la factura según el uso.

Por Hermify Team||9 min de lectura
Escritorio minimalista oscuro con un portátil, un café y el texto 'Coste mensual de un agente de IA'

La respuesta honesta es entre 6 y 80 dólares al mes, y casi todo es gasto de modelo

Un agente de IA personal funcionando 24/7 en una VPS pequeña con una clave de OpenRouter o Anthropic suele costar entre 6 dólares al mes en el caso más ligero y unos 80 dólares en uso intensivo. La infraestructura es casi un error de redondeo dentro de esa cifra: son entre 4 y 8 dólares de VPS pequeña cada mes independientemente de cuánto hables con el agente. Todo lo que quede por encima de ese suelo es gasto de modelo, que escala con la cantidad de tokens que el modelo lee y escribe por ti.

Si intentabas sacar la cuenta a partir de calculadoras que hablan de 200 a 10.000 dólares al mes, la confusión es real. Esas cifras describen agentes de call center empresariales que gestionan decenas de miles de conversaciones al mes, no el asistente de una sola persona en Telegram. Este artículo es el desglose del segundo caso: un solo operador, un canal de mensajería y las cuentas honestas.

Por qué la factura se parte en dos

El coste mensual de un agente de IA es la suma de dos líneas independientes:

  • Infraestructura: un pequeño servidor Linux que se mantiene online, guarda el estado de la conversación y ejecuta el gateway de mensajería. Coste fijo.
  • Gasto de modelo: llamadas por token al proveedor del modelo (OpenRouter, Anthropic, OpenAI). Coste variable, escala con el uso.

Casi nunca merece la pena correr el modelo en tu propia máquina para un agente personal. La inferencia local de un LLM necesita GPU o entre 16 y 32 GB de RAM, y eso empuja la factura de hardware por encima de lo que te costaría el pago por token con un uso personal realista. El resto del artículo asume que el modelo vive en un proveedor y tu VPS solo habla con él.

Esa división es lo que hace que el total sea honestamente estimable. El suelo de infraestructura es previsible; el gasto de modelo es una función del número de mensajes y su longitud.

Línea 1: El suelo de infraestructura

Un agente por API en Telegram, Signal o Slack necesita sorprendentemente poco hardware. La base mínima es de una a dos vCPU, entre 1 y 2 GB de RAM, y de 20 a 40 GB de SSD. La mayoría de runtimes, incluido Hermes Agent, funcionan cómodamente con 2 GB de RAM.

Cifras mensuales reales en 2026 para ese perfil:

  • Hetzner CX22 (2 vCPU, 4 GB RAM, 40 GB NVMe): unos 3,79 euros al mes en la UE, aproximadamente 4,59 a 4,99 dólares en las regiones de Estados Unidos. Incluye 20 TB de tráfico saliente. Es la recomendación por defecto en las comunidades de autoalojamiento.
  • DigitalOcean Basic Droplet (1 vCPU, 1 GB RAM): 6 dólares al mes, o unos 12 dólares al mes para 2 GB. Precios predecibles y documentación más clara que la de Hetzner, a cambio de pagar de 2 a 4 veces más por la misma configuración.
  • Oracle Cloud Always Free ARM: 0 dólares al mes si tu cuenta sobrevive a la política de reclamación. Nivel gratuito real, con fricción real en la aprobación de la cuenta.
  • Raspberry Pi 5 en casa: 80 dólares de una sola vez más unos 2 a 4 dólares al mes de electricidad para tenerla encendida 24/7. Más barata a largo plazo, peor si tu internet doméstico no es estable.

Como primera estimación, usa 6 dólares al mes como suelo de infraestructura. Desde una Hetzner CX22 hasta un droplet pequeño de DigitalOcean caben ahí o por debajo. Si quieres el detalle de los compromisos, los comparamos en VPS baratas para agentes de IA.

Línea 2: El gasto de modelo

Aquí es donde se abre el rango. Los proveedores de modelos cobran por millón de tokens de entrada (lo que el modelo lee, incluido el historial de la conversación que va creciendo) y por millón de tokens de salida (lo que escribe de vuelta). Un token equivale a unos 4 caracteres de inglés, o alrededor de 0,75 palabras.

Las tarifas que importan para un agente personal a mediados de 2026:

  • Claude Haiku 4.5: 1,00 dólar por millón de tokens de entrada y 5,00 dólares por millón de tokens de salida. El caballo de batalla barato para el chat del día a día.
  • GPT-4o: unos 2,50 dólares por millón de tokens de entrada en OpenRouter y 10 dólares por millón de salida. Se sitúa en la misma franja de rendimiento que Claude Sonnet.
  • Claude Sonnet 4.6: 3,00 dólares por millón de entrada, 15 dólares por millón de salida. Úsalo cuando la tarea realmente necesite razonamiento extra.
  • Gemini Flash: desde 0,075 dólares por millón de tokens de entrada en OpenRouter. La opción más barata de las populares, útil como capa de respaldo.

Dos cosas superan lo que la gente principiante espera:

  1. Cada mensaje reejecuta la conversación entera. El modelo no tiene memoria propia. Cada nuevo mensaje se procesa como si todos los turnos anteriores estuvieran prefijados a la entrada, así que en el turno 10 una sola respuesta se factura contra unos 7 veces los tokens del turno 1 por la misma salida. Por eso un agente charlatán que nunca recorta contexto puede parecer caro aunque cada mensaje individual sea corto.
  2. Los tokens de salida cuestan de 4 a 5 veces más que los de entrada. Un modelo verboso que escribe párrafos largos para una pregunta de una línea gasta cinco veces lo que uno más escueto para la misma calidad de respuesta.

Qué pinta tiene esto en facturas mensuales reales

Asume 4 caracteres por token, 750 tokens en una respuesta corta típica del asistente y unos cuantos cientos de tokens de sobrecarga en el system prompt. Aproximaciones redondeadas y honestas para tres perfiles de uso con Claude Haiku 4.5 o un modelo similar de entrada por debajo del dólar:

  • Uso ligero (unas 20 conversaciones al día, 6 turnos cada una): entre 3 y 6 millones de tokens al mes. De 5 a 12 dólares al mes de gasto de modelo.
  • Uso medio (unas 80 conversaciones al día, 8 turnos cada una): entre 15 y 25 millones de tokens al mes. De 25 a 50 dólares al mes.
  • Uso intensivo (unas 200 conversaciones al día, 10 turnos cada una, con transcripción de voz y TTS): de 40 a 80 millones de tokens al mes más audio. De 60 a 150 dólares al mes.

Si te pasas a Claude Sonnet 4.6 para todo, esas cifras se triplican aproximadamente. Si te pasas a Gemini Flash, se reducen a la mitad. La elección del modelo es, de lejos, la mayor palanca sobre el total.

Línea opcional: Voz

Si el agente recibe mensajes de voz y responde en voz, la factura crece con dos líneas variables más: STT (voz a texto) para transcribir el audio entrante y TTS (texto a voz) para sintetizar la respuesta. Cifras con las que planificar:

  • API Whisper de OpenAI: 0,006 dólares por minuto de audio entrante. Un minuto al día ronda los 0,20 dólares al mes; media hora al día son unos 5 dólares al mes.
  • ElevenLabs: precios por uso, arrancan en 5 dólares al mes con el plan Starter, y el uso real en producción cae entre 22 y 99 dólares al mes según los caracteres sintetizados. En Configuración de voz con ElevenLabs para Hermes Agent explicamos los compromisos.
  • Alternativas autoalojadas: Whisper.cpp, faster-whisper, Piper o Edge TTS. Gratis a nivel de software, añaden unos GB de RAM a las especificaciones de tu VPS si vas por ahí.

Para la mayoría de operadores individuales, la voz añade de 10 a 30 dólares al mes sobre una configuración solo de texto en uso típico.

Sumando todo: Los tres perfiles

Al agregar todo lo anterior, el coste mensual honesto de un agente de IA personal funcionando 24/7 en 2026 queda así:

  • Ligero (solo texto, modelo barato, VPS pequeña): de 10 a 20 dólares al mes. Infraestructura 6, gasto de modelo 5 a 12, voz 0.
  • Medio (mezcla de modelos, voz ocasional, VPS pequeña): de 40 a 80 dólares al mes. Infraestructura 6, gasto de modelo 25 a 50, voz 10 a 25.
  • Intensivo (modelo tipo Sonnet, voz diaria, RAM con margen): de 100 a 200 dólares al mes. Infraestructura 12, gasto de modelo 60 a 150, voz 20 a 40.

La factura la domina la elección del modelo, no el alojamiento. Un usuario que pasa de usar Sonnet para todo a usar Haiku para chat y Sonnet solo para preguntas duras puede recortar el total mensual a la mitad o más sin perder el razonamiento que realmente necesita.

La línea oculta: Tu tiempo

Las cifras autoalojadas de arriba suponen que el agente se mantiene en pie solo. En la práctica el primer mes suele costar una tarde de configuración, y cada actualización del sistema o del runtime cuesta otra hora. Los límites de tasa, las claves de API caducadas o un contenedor de Docker que se reinicia en silencio cada noche (un problema habitual que tratamos en El contenedor Docker de Hermes Agent se reinicia constantemente) cuestan su propio tiempo de diagnóstico.

La forma justa de meterlo en la cuenta es por hora de tu trabajo. Si mantener un agente autoalojado te cuesta dos horas al mes y tu tiempo vale 50 dólares la hora, son 100 dólares al mes que te estás pagando en especie. Rara vez aparece en una hoja de cálculo, pero es la razón por la que la mayoría de operadores individuales acaba pasándose a una opción gestionada.

La alternativa gestionada

Si prefieres no llevar la VPS, mantener la cuenta de OpenRouter ni hacer seguimiento de todo esto: Hermify aloja un Hermes Agent gestionado en Telegram con memoria persistente que sigue siendo tuya. Puedes traer tu propia clave de modelo (BYOK) en el nivel de entrada, así el gasto del modelo sigue apareciendo en tu factura y sigues controlándolo, pero la línea de infraestructura desaparece entera. Para quienes investigan el coste comparado con un equivalente de marca, desglosamos nuestros propios planes en Cuánto cuesta Hermes Agent.

Ese es el compromiso que aparece al final de cualquier artículo sobre coste mensual: el suelo de infraestructura de un agente autoalojado es barato, el gasto de modelo es el mismo en ambos casos, y la variable oculta es cuánto de tu atención consume la configuración. Haz los números de las tres líneas antes de elegir.

Sources

Lanza tu propio agente Hermes

Trae tu clave de API, conecta Telegram y ten un agente de IA que evoluciona solo activo en 60 segundos.

Empezar