把上下文管理从单次会话扩展到跨会话的持久化知识体系,按"个体尺度(用户记忆)与群体尺度(知识库)"两条线索展开——让 Agent 既能"懂你",也能成为"领域专家"。
同一问题的两个尺度——用户记忆(个体)与知识库(群体)共用向量检索、知识压缩等底层技术,同面信息冲突、知识过期、检索不准三大难题。
记忆提取三规则——选择性、抽象化、结构化;评估采用"基础回忆 → 多会话检索 → 主动服务"三层次框架。
四种存储格式是粒度递进——Simple Notes → Advanced JSON Cards;生产上"关键且少量用 Cards、大量非关键用 Notes"混合使用。
混合检索比任何单一策略稳健——稠密 + 稀疏 + 重排序;但把原始案例直接放进知识库远远不够,必须在索引阶段提炼、抽象、结构化。
知识更新是双轨机制——事件触发的增量更新(PR 式 Proposer-Reviewer 异源互审)+ 周期触发的全量整理;检索必须按调用者权限过滤。
双层记忆架构落地"主动服务"——Advanced JSON Cards 常驻概览 + 上下文感知检索按需取细节。
| 案例 / 数据 | 要点 |
|---|---|
| 订机票例子 | 从对话提取"靠窗座位、素食、MileagePlus 12345678",演示选择性/抽象化/结构化三规则 |
| 黑猫白猫计数 | 100 案例(90 黑/10 白)受 top-k 截断致错误结论——需索引阶段预生成统计摘要 |
| Mem0 v3 | LoCoMo 71.4 → 92.5(+21.1);LongMemEval 67.8 → 94.4(+26.6) |
| Anthropic Contextual Retrieval | 检索失败率 ↓49%;加 BM25 与重排序后 ↓67%;每百万文档 token 成本约 1 美元 |
| LoCoMo 基准 | 平均约 300 轮、最多 35 个会话的超长多轮对话 |