Hermes Agent vs Letta: piattaforma di memoria o runtime?
Hermes Agent e Letta (ex MemGPT) stanno agli estremi opposti dello spettro della memoria degli agenti. Come scegliere tra i due nel 2026.
Due scommesse su come un agente dovrebbe ricordare
Se hai cercato "hermes agent vs letta", probabilmente sai già che entrambi i progetti vivono nella categoria "agente IA con memoria". Meno ovvio è che fanno scommesse opposte su cosa dovrebbe essere quella memoria. Letta, ex MemGPT, dà all'agente una memoria a livelli ispirata a un sistema operativo con oltre 23.000 stelle su GitHub alle spalle: core, recall e archival, che il modello gestisce attivamente tramite chiamate di funzione. Hermes Agent, di Nous Research, tiene un piccolo estratto curato presente a ogni turno e non chiede mai al modello di andarlo a recuperare.
La divergenza filosofica conta perché plasma tutto il prodotto. Letta è una piattaforma che innesti nel tuo codice per costruire agenti ricchi di memoria. Hermes è un runtime che installi una volta e con cui parli su Telegram, Signal, Discord o Slack. Questo articolo attraversa entrambi, mostra dove sta davvero la frontiera decisionale e quando ha senso un ibrido.
Cosa fa davvero Letta
Letta è il discendente diretto del paper MemGPT dello Sky Computing Lab di UC Berkeley. Gira come processo server che gestisce lo stato dell'agente in un database PostgreSQL, esposto tramite un'API REST sulla porta 8283 con SDK ufficiali Python e TypeScript. C'è anche un Agent Development Environment per ispezionare graficamente ciò che l'agente sa in un dato momento.
Il modello di memoria è il senso stesso del progetto. Ogni agente Letta ha tre livelli:
- Core memory: un blocco piccolo che resta nella finestra di contesto a ogni turno, funziona come RAM di lavoro. Persona, profilo utente, contesto critico.
- Recall memory: la cronologia completa della conversazione salvata in database. L'agente cerca nei propri messaggi passati invece di dipendere dalla finestra del LLM.
- Archival memory: un database vettoriale per l'archiviazione a lungo termine. L'agente scrive osservazioni e le recupera dopo con ricerca semantica, scalando a dimensioni illimitate.
L'agente decide quando leggere e scrivere in tutti e tre chiamando funzioni di gestione della memoria dentro il proprio loop di ragionamento. È la promessa del "self-managing": il LLM fa da controller della propria memoria. Quando gli serve contesto, interroga. Quando impara qualcosa che vale la pena tenere, lo inserisce.
Letta è molto portabile. L'Agent File Format aperto (.af) rende un agente intero, memoria inclusa, spostabile tra framework e host. A maggio 2026 il team ha lanciato Letta Code, un agente di coding memory-first che sfida direttamente altri assistenti di codice. Il repository principale letta-ai/letta ha superato le 23.000 stelle e i 2.400 fork.
Quello che Letta non è: un prodotto finito per l'utente finale. È un backend. Incorpori l'SDK in un servizio Python o TypeScript, decidi quale interfaccia o canale di messaggistica vede l'utente e gestisci il cluster PostgreSQL su cui vivono gli agenti.
Cosa fa davvero Hermes Agent
Hermes Agent è un agente IA open source di Nous Research, rilasciato il 25 febbraio 2026, oggi alla versione v0.14.0. A differenza di Letta, non è una libreria da importare: è un runtime da installare. Lo colleghi a un provider di modelli con la tua chiave e gira come processo di lunga durata con cui parli su Telegram, WhatsApp, Discord, Slack, Signal o una CLI locale, tutto dietro un unico gateway.
Il sistema di memoria ha volutamente la forma opposta:
- MEMORY.md e USER.md sono file di testo semplici che l'agente curó su di te. Vivono in
~/.hermes/memories/e vengono iniettati nel prompt di sistema all'inizio di ogni sessione, presenti dal primo token. - La ricerca SQLite sulle sessioni con FTS5 indicizza ogni conversazione, quindi l'agente può ripescare quello di cui avete parlato giovedì scorso.
- Le skill sono file markdown che l'agente crea e corregge da solo dopo task complessi (in genere cinque o più chiamate di tool).
- I provider di memoria esterni formano uno strato a plugin: Honcho, OpenViking, Mem0, Hindsight, Holographic, RetainDB, ByteRover e Supermemory si aggiungono se vuoi grafi di conoscenza, ricerca semantica o modellazione dell'utente tra sessioni sopra i file base.
Abbiamo raccontato l'architettura di memoria nativa nel post Hermes Agent memory and skills. La scelta di design che conta: l'estratto curato è sempre presente, non recuperato. Nessuna chiamata di funzione mémoire, nessun salto di ricerca vettoriale, nessun rischio che il LLM dimentichi di interrogare. Se è nel file, è nel prompt.
Hermes porta con sé sei backend di terminale (local, Docker, SSH, Daytona, Singularity, Modal) ed è sotto licenza MIT. Un piccolo VPS europeo costa attorno ai cinque euro al mese. Il costo marginale è il provider del modello, non il runtime.
La frontiera decisionale
Un inquadramento utile: Letta è per agenti che costruisci con memoria a livelli autogestita, Hermes è per un agente che fai girare con memoria curata sempre presente.
| Domanda | Letta | Hermes Agent |
|---|---|---|
| Astrazione principale | Piattaforma di memoria con SDK e API REST | Runtime di agente con cui parli su app di messaggistica |
| Modello di memoria | Core + recall + archival, l'agente recupera | File curati sempre presenti + provider esterni opzionali |
| Dove vive la memoria | PostgreSQL gestito da Letta Server | File markdown semplici che possiedi su disco |
| Interfaccia per l'utente finale | La costruisci tu | Telegram, WhatsApp, Discord, Slack, Signal, CLI, integrati |
| Deployment | Letta Server + PostgreSQL, self-hosted o Letta Cloud | Processo locale, Docker o un VPS piccolo |
| Portabilità | Agent File Format (.af) tra framework |
Copiare la directory ~/.hermes/ |
| Ecosistema di linguaggi | SDK Python e TypeScript | Runtime Python con skill in markdown |
| Punto forte | Costruire prodotti IA propri ricchi di memoria | Assistenza personale, recall, bozze, giudizio |
| Latenza di recupero | Ricerca vettoriale o SQL per ogni query | Zero per il blocco curato, sempre nel prompt |
| Licenza | Apache 2.0 | MIT |
Se ti trovi a importare Letta in un servizio e poi a ricostruirci sopra bot Telegram, cron e note vocali, quel segnale ti dice che stai ricreando ciò che Hermes fornisce d'ufficio. Se ti trovi a spingere centinaia di megabyte di contesto storico recuperabile dentro Hermes e ci fai girare ricerca vettoriale, quel segnale dice che una piattaforma di memoria a livelli calzerebbe meglio.
Quando vince Letta
Letta è la risposta giusta quando:
- Stai costruendo un prodotto IA, non facendo girare un agente per te. Supporto clienti, un assistente di ricerca di dominio, un copilota per il tuo SaaS. Il modello di memoria deve scalare per utente su una superficie applicativa ampia.
- Ti serve memoria d'archivio su larga scala. Milioni di interazioni per utente, ricerca semantica su anni di storico, policy di retention formali.
- Il tuo team sa gestire PostgreSQL ed esporre l'SDK da un servizio che controllate end-to-end.
- Vuoi controllo programmatico esplicito su cosa l'agente inserisce, recupera e dimentica: una traccia auditabile delle operazioni di memoria, non un comportamento implicito nascosto in un prompt.
- Ti importa la portabilità tra framework. Il formato
.afè reale e funziona.
Questa è la categoria piattaforma di memoria. Letta e i suoi pari (Mem0, Zep) la dominano. La copertura nel confronto Mem0 vs Letta di Vectorize, nella panoramica 2026 dei framework di memoria di Atlan e nella visione 2026 di innobu riflette la maturità dello spazio.
Quando vince Hermes
Hermes è la risposta giusta quando:
- L'agente è tuo, non del tuo prodotto. Un assistente personale che conosce il tuo stile, i tuoi progetti, i tuoi contatti.
- Vuoi latenza di recupero zero per la memoria che conta. Se è in
MEMORY.md, il modello la vede prima di iniziare a ragionare. Nessuna query mancata, nessuna chiamata dimenticata. - Vuoi che l'interfaccia sia una superficie di chat che già usi, non una UI da costruire. Telegram è il canale gestito principale; Signal, Discord, Slack, WhatsApp e CLI sono disponibili nei setup self-hosted.
- Vuoi leggere quello che il tuo agente sa.
MEMORY.mdè un file di testo, non una riga in un database vettoriale. Verificare cosa l'agente crede di te richiede 30 secondi. - Accetti il limite del curato. Hermes tiene volutamente piccolo l'estratto sempre presente. Non è il posto dove buttare tutto quello che hai mai detto.
Questa è la categoria agente personale. Digest quotidiani nel tuo tono. Recall veloce sui tuoi progetti in corso. Curatela di letture e journaling. Abbiamo confrontato Hermes con altre opzioni di assistente personale in Hermes Agent vs ChatGPT, Claude e Gemini e con strumenti di workflow in Hermes Agent vs n8n.
Se è questo che vuoi, Inizia con Hermify e salta l'installazione: gestiamo un Hermes Agent su Telegram con memoria che resta tua, attivo in circa un minuto.
Curato sempre presente vs a livelli autogestito
Il vero disaccordo filosofico merita di essere nominato. Letta scommette che più memoria è meglio finché l'agente può decidere quando andarsela a prendere. Hermes scommette che meno memoria è meglio finché resta sempre presente.
Entrambe le scommesse reggono. Nel modello Letta un agente con memoria d'archivio può ricordarsi di un'interazione di un anno fa perché è andato esplicitamente a cercarla. Nel modello Hermes forse l'agente non ha quel dettaglio antico, ma le cose che di te contano davvero, il tuo nome, i tuoi progetti, le tue preferenze, sono garantite senza dipendere da una chiamata di recupero che può fallire o allucinare.
In pratica, i modelli molto orientati al recupero aggiungono latenza e modalità di errore. Ogni ricerca è un'occasione perché il LLM salti la chiamata, formuli male la query o interpreti male le righe restituite. La memoria curata sempre presente non ha questa superficie di errore per ciò che contiene, ma ha anche un tetto. Ottieni un piccolo set di lavoro ad alto segnale, non un archivio indicizzabile.
L'ibrido onesto
I due non si escludono. Un setup avanzato ragionevole:
- Hermes porta la relazione. Il tuo agente personale vive in Telegram o in un altro messenger, tiene i tuoi
USER.mdeMEMORY.mdcurati e gestisce skill e job cron. - Letta gestisce l'archivio in scala. Quando Hermes deve cercare in cinque anni di journaling o in centinaia di note di riunione, delega a un servizio Letta self-hosted. Letta restituisce i frammenti recuperati e Hermes li intreccia nella risposta.
Hermes porta plugin di provider di memoria esterni proprio per questo. Honcho, Mem0, Hindsight e altri si inseriscono come backend di recupero. Letta occuperebbe lo stesso slot: portare la memoria a livelli solo quando ti serve davvero. La direzione inversa (costruire un bot Telegram, uno scheduler e un sistema di skill sopra Letta) è più dura.
Come scegliere
- Se il problema è "Sto costruendo un prodotto IA e gli utenti hanno bisogno di una memoria ricca autogestita su una superficie ampia", scegli Letta.
- Se il problema è "Voglio una IA persistente unica che mi conosca e agisca al posto mio nelle app di messaggistica", scegli Hermes.
- Se il problema è "Voglio un agente personale in stile Hermes ma mi serve un archivio serio per un carico specifico", fai girare Hermes come porta d'ingresso e chiama un servizio Letta per quell'archivio.
Forzare uno dei due a fare il lavoro dell'altro è la modalità di errore. Letta non è un agente personale finito per app di messaggistica. Hermes non è una piattaforma di memoria per un prodotto multi-tenant. Accettato che ciascuno è ottimizzato per un cliente diverso, la scelta diventa facile.
Fonti
- letta-ai/letta su GitHub
- Walkthrough dell'architettura di memoria di Letta - SurePrompts
- Mem0 vs Letta (MemGPT) - Vectorize
- Migliori framework di memoria per agenti IA 2026 - Atlan
- Agent Memory 2026: Mem0, Letta, Zep, Hermes, OpenClaude a confronto - innobu
- NousResearch/hermes-agent su GitHub
- Documentazione della memoria persistente di Hermes Agent
Avvia il tuo Hermes Agent
Porta la tua chiave API, collega Telegram e ottieni un agente IA che migliora da solo, online in 60 secondi.
Inizia ora