Letta (原 MemGPT) - 具备操作系统级分层记忆与状态机架构的智能体框架

厂商: letta-ai

Letta(原名 MemGPT)是由加州大学伯克利分校团队开源的顶级智能体记忆架构,首创类操作系统的分层虚拟内存管理,赋予 Agent 跨会话终身记忆与自我修饰的个性化演进能力。

访问仓库

官网预览
Letta (原 MemGPT) - 具备操作系统级分层记忆与状态机架构的智能体框架

技术规格与项目参数

GitHub 仓库letta-ai/letta
Star 关注度★ 24.5k
Fork 衍生数2.6k forks
主要开发语言Python
开源协议Apache-2.0
所属技术领域AGENTS
aiai-agentsllmllm-agent
4.8综合评分
功能
4.9
文档
4.8
活跃度
4.9
易用
4.7

快速启动与部署指引

$ bash pip install letta

评测正文

Letta(letta-ai/letta,原名 MemGPT)是由加州大学伯克利分校(UC Berkeley)AI 研究团队 Charles Packer 等人发起的开源状态机智能体框架。在传统的大模型对话与智能体交互中,Agent 的记忆完全受限于模型的固定上下文窗口(Context Window),一旦对话轮次超出限制,早期的关键信息就会被截断遗忘。Letta 创造性地从现代计算机操作系统的虚拟内存管理(Virtual Memory Paging)中汲取灵感,打破了这一根本性限制。

在架构设计层面,Letta 将大模型的上下文窗口视为计算机的“主内存(RAM)”,而将外部向量数据库与持久化存储视为“硬盘(Disk Storage)”。Letta 将智能体的记忆分层划分为:
1. 核心工作内存(Core Memory):常驻在上下文中的人设角色(Persona)与用户画像(Human Profile),Agent 拥有专门的内部函数可以自主读写和编辑这部分内容;
2. 召回记忆(Recall Memory):按时间序列记录的完整历史对话事件流;
3. 归档记忆(Archival Memory):支持语义检索的大容量外部知识库。

在智能体自主演进与技能(Agent Skills)层面,Letta 赋予了智能体“自我反思与记忆自修饰”的能力。当用户在交流中透露了新的偏好或事实时,Agent 会自主决定调用内部函数将信息写入核心人设或归档到长期存储中;而在面对复杂任务时,Agent 会自主发起内存分页换入(Memory Swapping)与语义搜索,真正实现了具有终身连续性与个性化演进能力的下一代自主智能体。

项目来源

Letta(MemGPT)的诞生标志着智能体从‘无状态对话程序(Stateless Bot)’向‘具备持久心智(Stateful Mind)’的重大飞跃。在传统的 RAG 方案中,模型只是被动地接收检索注入的片段,无法主动调整自己的长期认知,更无法随着与用户的长期交互形成鲜明持久的个性。

加州大学伯克利分校的研究团队从计算机体系结构中找到解法:CPU 不需要把全硬盘的数据都装进内存,而是依靠虚拟内存分页机制按需调度。同理,LLM 只需要在上下文(RAM)中保留最核心的记忆指令和当前工作态,其余的历史数据则通过 Agent 自主调用的内存读写工具在后台动态调度。这一范式彻底颠覆了智能体记忆工程的设计格局。

在状态机设计上,Letta 赋予了 Agent 完全掌控自身认知状态的主动权。智能体不再是被动的文本生成器,而是一个能够通过系统级中断(Interrupts)与内存控制原语管理自身工作记忆的自主计算实体。

应用场景

在终身个性化 AI 助手场景中,Agent 能够跨越数月、数年的数百次对话,牢记用户的饮食喜好、家庭成员、职业背景与代码习惯,并在适当时机主动引用。

在企业级复杂销售与客户支持(CRM)中,智能体能够为每一个客户维护独立的核心画像块,在每一次交互中自动更新客户预算、决策链角色与关注重点。

在长周期复杂软件工程协作中,Agent 能够持续跟踪整个系统的架构演进历史、遗留技术决策背后的原因,并在数周后的新功能开发中保持设计一致性。

在沉浸式 NPC 与角色扮演游戏中,虚拟角色拥有符合设定的自传体记忆(Episodic Memory),会根据玩家的过往互动自主演化好感度与行为模式。

快速上手

通过 pip 安装 Letta 完整包:

bash
pip install letta

在终端中快速启动本地 Letta 服务端与图形化开发环境(ADE):

bash
# 配置 API Key
export OPENAI_API_KEY="your-key"

# 启动 Letta 服务端
letta server

在 Python 代码中创建具备持久记忆的智能体并进行跨会话交互:

python
from letta import create_client

# 1. 连接本地 Letta 客户端
client = create_client()

# 2. 创建一个具备核心记忆块的持久化 Agent
agent_state = client.create_agent(
    name="personal_mentor",
    memory={
        "persona": "你是一位耐心的 AI 架构导师,善于用操作系统概念解释复杂算法。",
        "human": "用户是一名正在深入学习大模型记忆架构的资深工程师。"
    }
)

# 3. 与智能体对话,观察其自主更新核心记忆
response = client.user_message(
    agent_id=agent_state.id,
    message="你好!顺便记录一下,我最近主要在用 Rust 开发高性能中间件。"
)

print("Agent 回复:", response.messages[-1].text)

# 4. 再次查询智能体的当前核心记忆块,可以看到其自主写入了 Rust 技能画像
updated_memory = client.get_agent_memory(agent_id=agent_state.id)
print("当前核心记忆 (Human):", updated_memory.core_memory.human)

在后台控制台(Letta ADE)中,开发者可以直接查看并手动编辑 Agent 的三个分层记忆库,为智能体注入预设的档案知识。

实用性评估

在架构先进性与工程解耦方面,Letta 从 MemGPT 升级为 Letta 后,重构为标准的服务端/客户端(Server-Client)架构,支持将 Agent 状态持久化到 PostgreSQL 数据库中,原生支持多租户高并发访问与云端集群部署。

在模型依赖考量方面,由于 Letta 依赖智能体自主调用内部内存管理函数(如 core_memory_appendarchival_memory_search),对模型的函数调用准确度与指令遵循能力有较高要求。推荐配合 GPT-4o、Claude 3.7 或经过专项微调的开源权重使用以达到最佳记忆自修饰效果。

在上下文管理优化上,Letta 内置了智能上下文压缩(Context Summarization)机制,当召回对话流接近上限时,自动在后台触发无损语义摘要,防止上下文溢出。

实际应用案例

Letta(MemGPT)在 GitHub 已斩获超 24,500 Star,成为全球最负盛名的智能体记忆与长上下文架构开源项目,加州大学伯克利分校原班团队已获得顶级风投支持成立独立商业公司全力推进。

包括医疗长期看护 Agent、智能家庭机器人大脑与新一代社交伴侣应用均在底层采用了 Letta 的分层记忆状态机作为核心认知引擎。

在一家智慧养老陪伴机器人的实际应用中,基于 Letta 构建的陪护 Agent 成功维持了超过 6 个月的长期连续记忆,老人的满意度与情感依恋度相比无记忆机器人提升了 3 倍以上。

核心技术优势

  • 首创类操作系统的分层虚拟内存管理,彻底突破大模型固定上下文窗口限制
  • 三大分层记忆体系(核心人设内存、召回时序流、归档语义知识库)协同运作
  • 赋予智能体自主‘自修饰记忆(Self-Editing Memory)’函数,实现个性化终身演进
  • 提供完整的开发者 Server 服务端、Web 控制台与多语言 Client SDK 支持

考量与局限

  • 生产环境落地需合理规划 GPU 显存与计算并发资源。

常见问题与技术问答 (FAQ)

Letta (原 MemGPT) - 具备操作系统级分层记忆与状态机架构的智能体框架 是什么?主要解决什么问题?

Letta (原 MemGPT) - 具备操作系统级分层记忆与状态机架构的智能体框架 是基于 Python 开发的知名开源 AI 项目(采用 Apache-2.0 开源协议)。Letta(原名 MemGPT)是由加州大学伯克利分校团队开源的顶级智能体记忆架构,首创类操作系统的分层虚拟内存管理,赋予 Agent 跨会话终身记忆与自我修饰的个性化演进能力。。Letta(MemGPT)的诞生标志着智能体从‘无状态对话程序(Stateless Bot)’向‘具备持久心智(Stateful Mind)’的重大飞跃。在传统的 RAG 方案中,模型只是被动地接收检索注入的片段,无法主动调整自己的长期认知,更无法随着与用户的长期交互形成鲜明持久的个性。 加州大学伯克利分校的研究团队从计算机体系结构中找到解法:CPU 不需要把全硬盘的数据都装进内存,而是依靠虚拟内存分页机制按需调度。同理,LLM 只需要在上下文(RAM)中保留最核心的记忆指令和当前工作态,其余的历史数据则通过 Agent 自主调用的内存读写工具在后台动态调度。这一范式彻底颠覆了智能体记忆工程的设计格局。 在状态机设计上,Letta 赋予了 Agent 完全掌控自身认知状态的主动权。智能体不再是被动的文本生成器,而是一个能够通过系统级中断(Interrupts)与内存控制原语管理自身工作记忆的自主计算实体。

如何快速安装与本地部署 Letta (原 MemGPT) - 具备操作系统级分层记忆与状态机架构的智能体框架?

通过 pip 安装 Letta 完整包:

bash
pip install letta

在终端中快速启动本地 Letta 服务端与图形化开发环境(ADE):

bash
# 配置 API Key
export OPENAI_API_KEY="your-key"

# 启动 Letta 服务端
letta server

在 Python 代码中创建具备持久记忆的智能体并进行跨会话交互:

python
from letta import create_client

# 1. 连接本地 Letta 客户端
client = create_client()

# 2. 创建一个具备核心记忆块的持久化 Agent
agent_state = client.create_agent(
    name="personal_mentor",
    memory={
        "persona": "你是一位耐心的 AI 架构导师,善于用操作系统概念解释复杂算法。",
        "human": "用户是一名正在深入学习大模型记忆架构的资深工程师。"
    }
)

# 3. 与智能体对话,观察其自主更新核心记忆
response = client.user_message(
    agent_id=agent_state.id,
    message="你好!顺便记录一下,我最近主要在用 Rust 开发高性能中间件。"
)

print("Agent 回复:", response.messages[-1].text)

# 4. 再次查询智能体的当前核心记忆块,可以看到其自主写入了 Rust 技能画像
updated_memory = client.get_agent_memory(agent_id=agent_state.id)
print("当前核心记忆 (Human):", updated_memory.core_memory.human)

在后台控制台(Letta ADE)中,开发者可以直接查看并手动编辑 Agent 的三个分层记忆库,为智能体注入预设的档案知识。

Letta (原 MemGPT) - 具备操作系统级分层记忆与状态机架构的智能体框架 的核心优势与适用场景有哪些?

Letta (原 MemGPT) - 具备操作系统级分层记忆与状态机架构的智能体框架 适合用于 终身伴随型个性化 AI 助理、长周期多会话客户关系 Agent、复杂长期技术项目协作伙伴、跨会话角色扮演与虚拟伴侣。其综合评分为 4.8/5 分,具备开箱即用、社区活跃、架构设计轻量等优势,能够无缝集成到现有的 AI 工作流中。

使用 Letta (原 MemGPT) - 具备操作系统级分层记忆与状态机架构的智能体框架 时有哪些技术考量与局限性?

在架构先进性与工程解耦方面,Letta 从 MemGPT 升级为 Letta 后,重构为标准的服务端/客户端(Server-Client)架构,支持将 Agent 状态持久化到 PostgreSQL 数据库中,原生支持多租户高并发访问与云端集群部署。 在模型依赖考量方面,由于 Letta 依赖智能体自主调用内部内存管理函数(如 core_memory_appendarchival_memory_search),对模型的函数调用准确度与指令遵循能力有较高要求。推荐配合 GPT-4o、Claude 3.7 或经过专项微调的开源权重使用以达到最佳记忆自修饰效果。 在上下文管理优化上,Letta 内置了智能上下文压缩(Context Summarization)机制,当召回对话流接近上限时,自动在后台触发无损语义摘要,防止上下文溢出。