Volver al Blog
AI AgentsSelf-hostingHardware

AI Agent en Raspberry Pi (2026): guía honesta

¿Puede una Raspberry Pi alojar un AI agent 24/7? Techos de RAM, imágenes ARM64, desgaste de SD y cuándo un VPS de 5 € gana.

Por Hermify Team||9 min de lectura
Escena oscura de una Raspberry Pi 5 sobre un escritorio con el texto 'AI Agent on Raspberry Pi'

La pregunta no es si arranca, sino si aguanta encendida

Si has llegado aquí, casi seguro tienes una Raspberry Pi en una estantería y un plan para apuntarla a un AI agent personal. La buena noticia es que una Pi 5 con 4 GB o más de RAM ejecutará un runtime como Hermes Agent, OpenClaw o un pequeño bucle de Ollama sin quejarse. La mala es que la mayoría de los agentes alojados en Pi mueren por algo ajeno a la CPU: corrupción de la SD a las 3 de la mañana, un OOM kill por presión de memoria en medio de una transcripción de voz, o una imagen de Docker que nunca tuvo build ARM64.

Esta guía recorre las tres decisiones que realmente importan para un agente 24/7 en una Pi: qué placa y nivel de RAM elegir, cómo mantener viva la tarjeta, y qué hacer con la inferencia del modelo. También da la conclusión honesta que nadie que venda accesorios para Pi te va a decir: para mucha gente, un VPS de 5 €/mes acaba siendo más barato y más tranquilo que la Pi que ya tienes.

Pi 4 vs Pi 5: el salto de CPU es real, pero decide la RAM

La Pi 5 subió del Cortex-A72 de la Pi 4 al Cortex-A76, a 2,4 GHz frente a 1,5 GHz, con cachés más grandes y bastante más paralelismo a nivel de instrucción. Para un agente que sobre todo espera E/S de red hacia un modelo remoto, la diferencia de CPU se nota en un sitio: cómo de rápido responden el gateway de mensajería, el bucle de tools y cualquier trabajo local de audio tras una ráfaga de actividad. El arranque en frío de la Pi 5 es notablemente más ágil que el de la Pi 4 para cualquier cosa basada en Docker o Node.

Lo que fuerza la decisión de compra es la RAM, no el reloj. Niveles realistas para un stack de agente en 2026 que habla con un LLM alojado:

  • Pi 4, 2 GB: demasiado justo. Runtime más gateway de mensajería más una llamada a Chromium se cae bajo presión de memoria.
  • Pi 4, 4 GB: funciona para un único agente hablando con un modelo remoto, sin Whisper local ni herramienta de navegador. Espera desactivar el swap y ser cuidadoso con los procesos concurrentes.
  • Pi 5, 4 GB: el suelo sensato. Cómodo para un runtime tipo Hermes Agent con 1 o 2 canales de mensajería y memoria persistente. Hacer STT local con faster-whisper es posible pero doloroso.
  • Pi 5, 8 GB: el punto dulce práctico para quien quiere margen, alguna herramienta de navegador headless ocasional o un modelo local pequeño. Los benchmarks de la comunidad para inferencia local lo respaldan: la Pi 5 de 8 GB maneja TinyLlama 1.1B a unos 18 tokens/seg y Llama 3.2 3B a unos 9 tokens/seg solo con CPU.
  • Pi 5, 16 GB: solo si planeas correr modelos locales de clase 7 B. Un 7 B cuantizado a Q4_K_M cabe en unos 5 GB de RAM, así que querrás margen.

Sea cual sea el nivel que elijas, no te saltes un cooler activo en la Pi 5. El throttling térmico sostenido convierte un ágil A76 a 2,4 GHz en algo peor que una Pi 4 a los pocos minutos de una carga real.

Disponibilidad de imágenes ARM64: verifica antes de comprometerte

Casi todo runtime de agente serio publica imagen ARM64 en 2026, pero aún hay trampas. Antes de comprometerte, comprueba tres cosas en el runtime que planeas usar:

  • El manifest de la imagen de contenedor incluye linux/arm64/v8. Ejecuta docker manifest inspect <imagen> y busca la entrada ARM, o usa un pull multi-arch.
  • La imagen se construyó recientemente. Algunos proyectos publican una tag ARM una vez y se olvidan, y luego divergen en silencio del build AMD64 durante meses.
  • Las dependencias opcionales de las que dependes (ffmpeg, sox, Chromium, Playwright) funcionan en ARM. La descarga del navegador integrado de Playwright, en particular, no siempre se resuelve en ARM Linux y acabas instalando Chromium por apt.

Si vas a usar Hermes Agent, la imagen oficial de Docker es multi-arch y funciona en ARM. Para un recorrido completo por la vía Docker con build ARM64, nuestra guía de despliegue con Docker cubre el layout de la imagen, y el post de troubleshooting cuando el contenedor se reinicia merece la pena antes de tu primera prueba de 24 horas, porque la mayoría de fallos en Pi caen en los mismos cubos de OOM kill y permisos de volumen.

La tarjeta SD es la pieza que te va a matar el uptime

La Pi corre un sistema operativo que loguea todo, y un AI agent añade un directorio de memoria que escribe continuamente: estado de conversación, ficheros de memoria por usuario, transcripciones, historial de tareas programadas. Ese patrón de escrituras pequeñas continuas es exactamente lo que desgasta una microSD de consumo. En operación 24/7, no es cuestión de si la tarjeta falla, sino de cuándo.

Tres mitigaciones, por orden de impacto:

  1. Arranca desde NVMe o SSD USB, no desde la SD. La Pi 5 soporta NVMe vía HAT, y la Pi 4 arranca desde SSD USB de fábrica en los firmwares recientes. El rendimiento en escrituras aleatorias es un orden de magnitud mejor y el desgaste, drásticamente más amable. Es la mayor mejora individual de fiabilidad que puedes hacer.
  2. Si tienes que usar SD, compra una tarjeta high-endurance. SanDisk MAX Endurance, Samsung PRO Endurance y Transcend High Endurance están específicamente pensadas para escrituras continuas. Una tarjeta de consumo estándar en un setup con muchas escrituras puede degradarse en meses.
  3. Mueve el directorio de memoria y cualquier base SQLite fuera del medio de arranque. Conecta un SSD USB pequeño y móntalo en la ruta de datos del runtime. Activa Log2Ram para que los journals de systemd vivan en RAM y solo se vuelquen a disco periódicamente. Configura tmpfs para /tmp y /var/tmp.

Independientemente del almacenamiento que elijas, mantén un backup automatizado del directorio de memoria a algo fuera de la Pi. Una SD muerta en un cajón es una cosa; una SD muerta que tenía seis meses de contexto de tu agente es otra.

Modelo local o remoto: decide antes de comprar

La bifurcación más grande es si el modelo corre en la Pi o en otro sitio.

Modelo remoto (recomendado para la mayoría de uso personal): la Pi ejecuta el runtime, el gateway de mensajería, los ficheros de memoria y el bucle de tools. Las llamadas al modelo van a OpenAI, Anthropic o OpenRouter por HTTPS. La huella total de RAM está cómodamente por debajo de 1 GB. Esto es lo que también hace un VPS de 5 €/mes, así que si tomas esta vía, la única ventaja de la Pi sobre el VPS es que vive en tu casa.

Modelo local en la Pi: todo corre offline. Estás limitado a modelos pequeños (grosso modo 1 B a 3 B parámetros a velocidad conversacional en una Pi 5 8 GB) con una calidad que va por detrás de un modelo alojado moderno por un margen amplio. La Pi 5 de 16 GB con arranque NVMe puede meter un 7 B cuantizado en servicio, pero notarás cada segundo de la mayor latencia. Para un hobby o un setup privacy-first con expectativas modestas, sirve. Para un asistente de trabajo que realmente ahorre tiempo, normalmente no.

Para voz aplica la misma bifurcación: la latencia de STT en la nube (Deepgram, Whisper API) le sacará segundos por turno a faster-whisper local en una Pi 5. Si la baja latencia en voz importa, la Pi es la forma equivocada de hardware, independientemente de la RAM.

La comparación honesta de coste

Si ya tienes la Pi, la electricidad para tener una Pi 5 24/7 son unos 3 W en idle, lo que sale a unos 7 u 8 € al año a 0,30 €/kWh. Barato. Pero la ecuación total de coste para alojar un agente es Pi + SD high-endurance (o HAT NVMe + SSD NVMe) + PSU + caja + cooler activo, y una vez sumas todo eso estás a menudo a pocos euros de un año de hosting VPS de gama baja.

Concretamente:

Ruta Inicial Mensual
Pi 5 8 GB + HAT NVMe + NVMe 256 GB + cooler + PSU + caja ~180 € ~0,60 € electricidad
Netcup VPS 500 (2 vCore ARM, 4 GB RAM, 128 GB NVMe) 0 € ~5,00 €
Hetzner CX22 (2 vCPU x86, 4 GB RAM, 40 GB NVMe) 0 € ~3,79 €

La Pi alcanza el punto de equilibrio frente a un VPS de 5 €/mes hacia el tercer año, y solo si nada de la Pi falla. Un único reemplazo de SD o un cambio de PSU reinicia el reloj. La comparativa de VPS baratos revisa las specs exactas de las opciones de 5 €/mes, y el desglose de costes de Hermes pone la factura del modelo en contexto.

La Pi gana en tres ejes que un VPS no puede igualar: está físicamente en tu casa, casi no consume, y es realmente privada en el sentido de que ningún proveedor cloud tiene el disco. Esas son razones reales. "Más barato" normalmente no.

Cuándo la Pi es la elección correcta

  • Ya la tienes y por lo demás está en reposo.
  • Quieres el agente físicamente en tu red doméstica para herramientas solo-LAN (Home Assistant, acceso local a ficheros, coordinadores Zigbee).
  • Optimizas privacidad sobre rendimiento y aceptas la brecha de calidad del modelo local.
  • Disfrutas el setup como proyecto. Es una razón válida y esta guía no te va a disuadir.

Cuándo saltarte la Pi por completo

  • Aún no la tienes y estás calculando desde cero.
  • Quieres voz de baja latencia.
  • Quieres correr un modelo serio con calidad de hosted (cualquier 7 B o más a velocidad real).
  • No quieres pensar en desgaste de SD, throttling térmico ni disponibilidad de imágenes ARM.

Para ese último caso existe el hosting gestionado, precisamente porque la tarde de domingo de dimensionar, endurecer y niñear no es divertida para todo el mundo. Empieza con Hermify y sáltate la decisión de hardware por completo. Ejecuta un Hermes Agent gestionado en Telegram, con memoria persistente que sigue siendo tuya, y no hay placa que enfriar ni SD que reemplazar.

Recomendación

Si ya tienes una Pi 5 con 4 GB o más y un HAT NVMe, ponle encima un agente respaldado por API y disfruta de la factura de luz. Si estás partiendo de cero, compra un VPS ARM de 5 €/mes. Si quieres que el agente funcione y punto, sin conversación de hardware, usa un host gestionado.

La Pi es un ordenador precioso. Para la mayoría, no es la forma más barata ni más tranquila de mantener un AI agent online.

Sources

Lanza tu propio agente Hermes

Trae tu clave de API, conecta Telegram y ten un agente de IA que evoluciona solo activo en 60 segundos.

Empezar