Hermes Agent vs Letta: Plataforma de memória ou runtime?
Hermes Agent e Letta (antes MemGPT) estão nos extremos opostos do espectro de memória de agentes. Como escolher entre eles em 2026.
Duas apostas sobre como um agente deveria lembrar
Se você pesquisou "hermes agent vs letta", provavelmente já sabe que os dois projetos estão na categoria de "agente de IA com memória". O que é menos óbvio é que eles fazem apostas opostas sobre o que essa memória deveria ser. Letta, antes MemGPT, dá ao agente um sistema de memória em camadas inspirado em sistema operacional, com mais de 23.000 estrelas no GitHub: núcleo, histórico e arquivo que o modelo gerencia ativamente por meio de chamadas de função. O Hermes Agent, da Nous Research, mantém um snapshot pequeno e curado presente em todo turno e nunca pede que o modelo vá recuperá-lo.
A divergência filosófica importa porque molda o produto todo. Letta é uma plataforma que você encaixa no seu próprio código para construir agentes ricos em memória. Hermes é um runtime que você instala uma vez e com o qual conversa pelo Telegram, Signal, Discord ou Slack. Este post explica os dois, onde de fato está a fronteira de decisão e quando faz sentido um híbrido.
O que o Letta faz de verdade
Letta é o descendente direto do paper MemGPT do Sky Computing Lab da UC Berkeley. Ele roda como um processo servidor que gerencia o estado do agente em um banco PostgreSQL, exposto via API REST na porta 8283 com SDKs oficiais em Python e TypeScript. Existe também um Agent Development Environment para inspecionar graficamente o que o agente sabe a cada momento.
O modelo de memória é a razão de ser do projeto. Cada agente Letta tem três camadas:
- Core memory: um bloco pequeno que permanece na janela de contexto a cada turno, funcionando como RAM de trabalho. Persona, perfil do usuário, contexto crítico.
- Recall memory: o histórico completo da conversa armazenado no banco. O agente pesquisa nas próprias mensagens passadas em vez de depender da janela do LLM.
- Archival memory: um banco vetorial para armazenamento de longo prazo. O agente escreve observações e as recupera depois por busca semântica, escalando até tamanho ilimitado.
O agente decide quando ler e escrever nas três chamando funções de gerenciamento de memória dentro do próprio loop de raciocínio. Essa é a promessa do "self-managing": o LLM atua como seu próprio controlador de memória. Quando precisa de contexto, consulta. Quando aprende algo que vale a pena guardar, insere.
Letta é bastante portável. O Agent File Format aberto (.af) permite mover um agente inteiro, memória e tudo, entre frameworks e hosts. Em maio de 2026 o time lançou o Letta Code, um agente de programação memory-first que compete diretamente com outros assistentes de código. O repositório principal letta-ai/letta passou de 23.000 estrelas com 2.400 forks.
O que o Letta não é: um produto pronto para o usuário final. É um backend. Você embute o SDK em um serviço Python ou TypeScript, decide qual interface ou canal de mensagens o usuário vê e cuida do cluster PostgreSQL onde os agentes vivem.
O que o Hermes Agent faz de verdade
O Hermes Agent é um agente de IA open source da Nous Research, lançado em 25 de fevereiro de 2026, agora na versão v0.14.0. Diferente do Letta, não é uma biblioteca que você importa: é um runtime que você instala. Você aponta para um provedor de modelos com a sua própria chave e ele roda como um processo de longa duração com quem você fala pelo Telegram, WhatsApp, Discord, Slack, Signal ou uma CLI local, tudo por trás de um único gateway.
O sistema de memória é propositalmente oposto na forma:
- MEMORY.md e USER.md são arquivos de texto simples que o agente curó sobre você. Ficam em
~/.hermes/memories/e são injetados no prompt do sistema no início de cada sessão, presentes desde o primeiro token. - Busca SQLite em sessões com FTS5 indexa cada conversa, então o agente pode consultar o que vocês discutiram na quinta passada.
- Skills, arquivos markdown que o agente cria e ajusta sozinho depois de tarefas complexas (normalmente cinco ou mais chamadas de ferramenta).
- Provedores externos de memória como camada de plugins: Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover e Supermemory podem ser adicionados se você quiser grafos de conhecimento, busca semântica ou modelagem de usuário entre sessões em cima dos arquivos base.
Cobrimos a arquitetura de memória base no post Hermes Agent memory and skills. A decisão de design que importa: o snapshot curado está sempre presente, não é recuperado. Não há chamada de função de memória, nem salto de busca vetorial, nem risco de o LLM esquecer de consultar. Se está no arquivo, está no prompt.
Hermes traz seis backends de terminal (local, Docker, SSH, Daytona, Singularity, Modal) e é licenciado sob MIT. Um VPS europeu pequeno fica em torno de cinco euros por mês. O custo marginal é o seu provedor de modelo, não o runtime.
A fronteira de decisão
Um enquadramento útil: Letta é para agentes que você constrói com memória em camadas autogerenciada e Hermes é para um agente que você roda com memória curada sempre presente.
| Pergunta | Letta | Hermes Agent |
|---|---|---|
| Abstração principal | Plataforma de memória com SDK e API REST | Runtime de agente com quem você fala em apps de mensagem |
| Modelo de memória | Core + recall + archival, o agente recupera | Arquivos curados sempre presentes + provedores externos opcionais |
| Onde a memória vive | PostgreSQL gerenciado pelo Letta Server | Arquivos markdown simples que você possui em disco |
| Interface para usuário final | Você constrói | Telegram, WhatsApp, Discord, Slack, Signal, CLI, já inclusos |
| Deploy | Letta Server + PostgreSQL, self-hosted ou Letta Cloud | Processo local, Docker ou um VPS pequeno |
| Portabilidade | Agent File Format (.af) entre frameworks |
Copiar o diretório ~/.hermes/ |
| Ecossistema de linguagens | SDKs em Python e TypeScript | Runtime Python com skills em markdown |
| Melhor em | Construir produtos de IA próprios ricos em memória | Assistência pessoal, recall, rascunhos, critério |
| Latência de recuperação | Busca vetorial ou SQL por consulta | Zero para o bloco curado, sempre no prompt |
| Licença | Apache 2.0 | MIT |
Se você começa a importar Letta num serviço e depois reconstrói bots do Telegram, cron e notas de voz em cima dele, esse é o sinal de que está recriando o que o Hermes já traz de fábrica. Se começa a jogar centenas de megabytes de contexto histórico recuperável no Hermes e a rodar busca vetorial por cima, esse é o sinal de que uma plataforma de memória em camadas encaixaria melhor.
Quando o Letta vence
Letta é a resposta certa quando:
- Você está construindo um produto de IA, não rodando um agente para si mesmo. Suporte ao cliente, um assistente de pesquisa de nicho, um copiloto para o seu SaaS. O modelo de memória precisa escalar por usuário numa superfície de aplicação grande.
- Precisa de memória de arquivo em escala. Milhões de interações por usuário, busca semântica sobre anos de histórico, políticas formais de retenção.
- Seu time consegue operar PostgreSQL e expor o SDK a partir de um serviço que vocês controlam de ponta a ponta.
- Você quer controle programático explícito do que o agente insere, recupera e esquece: uma trilha auditável das operações de memória, não comportamento implícito escondido em prompt.
- Você se importa com portabilidade entre frameworks. O formato
.afé real e funciona.
Essa é a categoria de plataforma de memória. Letta e seus pares (Mem0, Zep) dominam. A cobertura na comparação Mem0 vs Letta da Vectorize, no round-up de frameworks de memória 2026 da Atlan e no panorama 2026 da innobu reflete a maturidade do espaço.
Quando o Hermes vence
Hermes é a resposta certa quando:
- O agente é seu, não o do seu produto. Um assistente pessoal que conhece seu estilo, seus projetos, seus contatos.
- Você quer latência de recuperação zero para a memória que importa. Se está em
MEMORY.md, o modelo vê antes de começar a raciocinar. Sem consulta perdida, sem chamada esquecida. - Você quer a interface como uma superfície de chat que já usa, não uma UI para construir. Telegram é o canal gerenciado principal; Signal, Discord, Slack, WhatsApp e CLI ficam disponíveis nas instalações self-hosted.
- Você quer ler o que seu agente sabe.
MEMORY.mdé um arquivo de texto simples, não uma linha em banco vetorial. Auditar o que o agente acredita sobre você leva 30 segundos. - Você aceita o limite do curado. O Hermes mantém o snapshot sempre presente pequeno de propósito. Não é lugar para despejar tudo que você já disse.
Essa é a categoria de agente pessoal. Digests diários no seu tom. Recall rápido sobre seus projetos em curso. Curadoria de leitura e journaling. Comparamos Hermes com outras opções de assistente pessoal em Hermes Agent vs ChatGPT, Claude e Gemini, e com ferramentas de workflow em Hermes Agent vs n8n.
Se é isso que você quer, Comece com a Hermify e pule a instalação: nós rodamos um Hermes Agent gerenciado no Telegram com memória que continua sua, no ar em cerca de um minuto.
Curado sempre presente vs em camadas autogerenciado
A divergência filosófica real merece nome. Letta aposta que mais memória é melhor desde que o agente decida quando buscar. Hermes aposta que menos memória é melhor desde que esteja sempre presente.
As duas apostas se sustentam. No modelo Letta, um agente com memória de arquivo consegue lembrar uma interação de um ano atrás porque foi explicitamente buscá-la. No modelo Hermes, o agente talvez não tenha esse detalhe antigo, mas as coisas sobre você que de fato importam, seu nome, seus projetos, suas preferências, estão garantidas sem depender de uma chamada de recuperação que pode falhar ou alucinar.
Na prática, modelos pesados em recuperação adicionam latência e modos de falha. Toda busca é uma chance do LLM pular a chamada, formular mal a consulta ou interpretar mal as linhas devolvidas. A memória curada sempre presente não tem essa superfície de falha para o que carrega, mas também tem um teto. Você tem um conjunto de trabalho pequeno e de alto sinal, não um arquivo indexável.
O híbrido honesto
Os dois não se excluem. Um setup avançado razoável:
- Hermes carrega a relação. Seu agente pessoal vive no Telegram ou outro mensageiro, sustenta seus
USER.mdeMEMORY.mdcurados e gerencia skills e jobs cron. - Letta cuida do arquivo em escala. Quando o Hermes precisar buscar em cinco anos de journaling ou em centenas de notas de reunião, delega para um serviço Letta self-hosted. Letta devolve os fragmentos recuperados e o Hermes costura na resposta.
O Hermes traz plugins de provedores externos de memória exatamente para isso. Honcho, Mem0, Hindsight e outros encaixam como backends de recuperação. Letta preencheria o mesmo espaço: trazer memória em camadas só quando você realmente precisar. O caminho inverso (construir um bot do Telegram, um scheduler e um sistema de skills em cima do Letta) é mais duro.
Como escolher
- Se o problema é "Estou construindo um produto de IA e os usuários precisam de memória rica autogerenciada numa superfície ampla", escolha Letta.
- Se o problema é "Quero uma IA persistente única que me conhece e age por mim em apps de mensagem", escolha Hermes.
- Se o problema é "Quero um agente pessoal estilo Hermes mas preciso de um arquivo sério para uma carga específica", rode Hermes como porta da frente e chame um serviço Letta para esse arquivo.
Forçar qualquer um dos dois a fazer o trabalho do outro é o modo de falha. Letta não é um agente pessoal pronto para apps de mensagem. Hermes não é uma plataforma de memória para um produto multi-tenant. Uma vez que você aceita que cada um está otimizado para um cliente diferente, a escolha fica fácil.
Fontes
- letta-ai/letta no GitHub
- Walkthrough da arquitetura de memória do Letta - SurePrompts
- Mem0 vs Letta (MemGPT) - Vectorize
- Melhores frameworks de memória de agentes de IA 2026 - Atlan
- Agent Memory 2026: Mem0, Letta, Zep, Hermes, OpenClaude comparados - innobu
- NousResearch/hermes-agent no GitHub
- Documentação de memória persistente do Hermes Agent
Lance seu próprio agente Hermes
Traga sua chave de API, conecte o Telegram e tenha um agente de IA que evolui sozinho no ar em 60 segundos.
Começar agora