Hermes 4 vs Hermes 3: qué cambió y cuál elegir
Una comparación concreta de las familias Hermes 4 y Hermes 3 de Nous Research, con una guía para elegir cuál ejecutar en Hermes Agent BYOK.
Qué cambió entre Hermes 3 y Hermes 4
Hermes 3, publicado por Nous Research en 2024, era una familia de fine-tunes completos de Llama 3.1 en 8B, 70B y 405B. Su foco era la alineación neutral y la capacidad de dirigirse: un asistente potente y sin censura que hacía lo que le pedías sin añadir opiniones propias. No razonaba paso a paso por defecto. Respondía.
Hermes 4, publicado en agosto de 2025, es otro animal. Sale en tres tamaños (14B sobre Qwen 3, 70B y 405B sobre Llama 3.1) y añade un modo de razonamiento híbrido en el que el modelo decide si pensar en trazas <think>...</think> antes de responder. El corpus de post-entrenamiento creció aproximadamente cincuenta veces: de unos 1M de muestras y 1,2B de tokens en Hermes 3 a unos 5M de muestras y 60B de tokens en Hermes 4, mezclando datos con y sin razonamiento. El entrenamiento corrió sobre 192 GPUs NVIDIA B200.
Después, en diciembre de 2025, Nous publicó Hermes 4.3 36B. Está basado en la arquitectura Seed-OSS-36B de ByteDance, extiende el contexto hasta 512K tokens y fue post-entrenado íntegramente sobre la red descentralizada Psyche de Nous. Casi iguala a Hermes 4 70B en evaluaciones con la mitad de parámetros.
Si ejecutas Hermes Agent con tu propia clave de OpenRouter o directa de Nous, la elección de modelo se ha vuelto realmente interesante. Esto es lo que cambia y cómo elegir.
La familia Hermes 4 de un vistazo
| Modelo | Base | Modo razonamiento | Mejor para |
|---|---|---|---|
| Hermes 4 14B | Qwen 3 14B | Sí | Inferencia local, dispositivos edge, borradores baratos |
| Hermes 4 70B | Llama 3.1 70B | Sí | Cargas BYOK ajustadas en coste que necesitan calidad real |
| Hermes 4 405B | Llama 3.1 405B | Sí | Razonamiento frontera: matemáticas, código, STEM difícil |
| Hermes 4.3 36B | Seed-OSS 36B | Sí | Trabajo con contexto de 512K, autohosting local en una GPU |
Las cuatro comparten el mismo truco de razonamiento híbrido: un solo conjunto de pesos, un interruptor. No hace falta mantener un modelo de "razonamiento" separado de otro "instruct".
Razonamiento híbrido: la función que más importa
En Hermes 3 recibías una respuesta directa. Rápida, competente, hecho.
En Hermes 4 puedes pedir cualquiera de las dos conductas sobre el mismo checkpoint. Con el modo razonamiento activo, el modelo emite un bloque <think>...</think> con su deliberación interna y luego una respuesta final. Con el modo apagado, responde directamente, como hacía Hermes 3.
Dos implicaciones para tu uso dentro de Hermes Agent:
- No necesitas dos slots de proveedor. Apunta BYOK a un único modelo Hermes 4 y cambia de modo por tarea mediante system prompt o convención de wrapper. Más barato y más simple que enrutar entre modelos de razonamiento y no razonamiento separados.
- Pagas por los tokens que el modelo dedicó a pensar. El modo razonamiento no es gratis. Un bloque
<think>largo puede doblar fácilmente el coste de salida de una pregunta difícil, así que déjalo apagado para resúmenes rutinarios o charla informal.
Si quieres ver mejor cómo se comporta un agente con razonamiento en el día a día, nuestro post sobre memoria y skills de Hermes Agent muestra cómo los archivos de memoria cambian sobre qué elige razonar el agente.
Benchmarks: lo que dicen realmente los números
En lo más alto, Hermes 4 405B en modo razonamiento reporta:
- MATH-500: 96,3
- AIME'24: 81,9
- GPQA Diamond: 70,5
- LiveCodeBench: 61,3
Son cifras competitivas con DeepSeek R1 671B y Qwen 3 235B, y en pesos abiertos. El titular del 96,3 en MATH-500 es real, pero trátalo como un techo para cierto tipo de preguntas, no como una promesa sobre cualquier prompt: en tareas sin razonamiento el mismo modelo se parece más a un Llama 3.1 405B bien ajustado que a un razonador de frontera.
Hermes 4 70B pierde varios puntos en los benchmarks duros de razonamiento a cambio de una inferencia unas seis veces más barata. Hermes 4 14B es el modelo tapado: es pequeño como para correr en una sola GPU de consumo y mantiene el razonamiento híbrido, algo raro a ese tamaño.
Hermes 4.3 36B es el más interesante de seguir. Nous reporta que casi iguala a Hermes 4 70B con la mitad de parámetros, gracias a la base Seed-OSS más grande y al post-entrenamiento distribuido sobre Psyche. Además tiene 512K de contexto, algo que el 70B no ofrece.
Cuál correr en Hermes Agent
Hermes Agent es agnóstico al modelo. Eliges en tu config.yaml o mediante la configuración de OpenRouter en Hermes Agent, y el arnés se encarga del resto. Regla práctica para usuarios BYOK:
- Resumen de contexto largo, memoria de chat larga, revisión de código sobre archivos grandes. Elige Hermes 4.3 36B. La ventana de 512K es el factor decisivo. Nada más en la familia compite ahí.
- Razonamiento duro: matemáticas, código novedoso, planificación agéntica de muchos pasos. Elige Hermes 4 405B en modo razonamiento. Apágalo en los turnos rutinarios y enciéndelo en los difíciles.
- Driver diario ajustado en coste. Elige Hermes 4 70B. Es el equilibrio por defecto. Buenas respuestas, precio razonable y sigue trayendo razonamiento híbrido si lo necesitas.
- Edge, local o ejecuciones sin conexión. Elige Hermes 4 14B, o Hermes 4.3 36B si tienes una GPU más potente. Los GGUFs de 14B corren cómodos en una sola tarjeta de gama media.
- Tienes un Hermes 3 funcionando y encaja con tu carga. No migres por migrar. Hermes 3 405B sigue siendo un asistente fuerte sin razonamiento. Cambia solo cuando necesites una de las cuatro capacidades de arriba.
Para una visión más amplia sobre elegir la capa de proveedor, mira nuestra comparativa de Hermes Agent hosting vs autoalojamiento. La elección de modelo es en gran medida ortogonal a dónde corres el agente.
Cómo cambiar de modelo en Hermes Agent
El cambio es un ajuste de config, no un rebuild. En ~/.hermes/config.yaml:
model:
provider: openrouter
name: nousresearch/hermes-4-405b
# Para acceso directo a Nous, usa:
# provider: nous
# name: hermes-4-405b
Reinicia el gateway:
hermes gateway restart
Para el modo razonamiento, la mayoría de modelos Hermes 4 aceptan una bandera reasoning: true o enable_thinking: true del lado del proveedor, o puedes envolver tu prompt con una directiva <think> explícita a nivel de system prompt. Consulta la documentación de tu proveedor antes de dar por hecho el comportamiento por defecto.
Si usas BYOK a través de un host gestionado, el cambio es aún más sencillo: cambia el string del modelo en tu panel y envía un mensaje nuevo. Sin reinicios ni rebuilds de imagen.
Conclusión
De Hermes 3 a Hermes 4 hay un salto mayor que lo que sugiere el número de versión. Pasas de un fuerte fine-tune de Llama 3.1 con capacidad de dirigirse a una familia con razonamiento híbrido, benchmarks frontera competitivos, un pipeline de entrenamiento distribuido (4.3) y una opción real de contexto largo. La migración es un cambio de config si ya usas Hermes Agent, y el ROI es mayor en cargas con razonamiento real, contexto largo o mezcla de ambos.
Elige el modelo más pequeño de la familia que responda bien a tu pregunta más difícil. Enciende el razonamiento solo cuando haga falta. Y no pierdas de vista los lanzamientos de la red Psyche: el patrón 4.3 (base más pequeña, más post-entrenamiento, ejecución descentralizada) es casi seguro la forma de los próximos Hermes.
Empieza con Hermify si prefieres que el cambio de modelo sea un desplegable en vez de un archivo de configuración, con un Hermes Agent corriendo en Telegram mientras decides.
Fuentes
Lanza tu propio agente Hermes
Trae tu clave de API, conecta Telegram y ten un agente de IA que evoluciona solo activo en 60 segundos.
Empezar