
LLM 本质无状态——参数在训练后固定每次请求独立。所谓的记忆本质是把历史信息拼接到输入中利用注意力机制假装有记忆。但这个假装的关键局限是上下文窗口有限。需要一套完整的记忆管理体系。一、三种记忆类型长期记忆本身有三种截然不同的类型Agent Memory ├── Working Memory当前对话 └── Long-term Memory ├── Semantic事实—— 用户喜欢简洁风格 ├── Episodic经历—— 上周投诉了配送慢 └── Procedural怎么做—— 退款流程先检查再确认Semantic Memory存事实型信息通常用向量数据库按 user_id 隔离。Episodic Memory存发生在特定时间点的具体事件需要记录发生时间和关联对话 ID。Procedural Memory存操作规则可以直接固化为 System Prompt 或 Skill。银行项目实测加入三层记忆架构后用户满意度提升 23%平均对话轮次减少 2.1 轮。二、完整工程链路写入原始对话 → Fact Extraction → 结构化 → 去重 → 冲突判断 → 写入存储 检索过滤 → 召回 → 重排序 → 注入 Prompt写入链路每轮对话结束后判断什么值得记住。提取后不是直接写入——先检查重复。今天说我爱吃辣明天说我胃不好不能吃辣这不是追加是冲突。检索链路先按 user_id 过滤再语义召回 top-k最后用 relevance 分数重排序。治理问题去重过期清理、冲突合并删除纠错、来源追踪、置信度管理、权限隔离。三、冲突处理与遗忘机制用户信息变化→语义去重判断 UPDATE 而非追加。TTL 机制清理时效性信息。艾宾浩斯遗忘曲线长期未检索的记忆每天衰减 5%低于阈值软删除。评估基准 LOCOMO 的四维度检索准确率 71%→87%、冲突检出率 92%、隐私隔离 0 泄露、有效记忆率 45%→78%。四、三篇论文Generative Agents2023重要性评分反思机制。当累积分数超过 150 分触发高阶抽象。检索三维评分α×语义 β×时间 γ×重要性。MemGPT2023LLM 通过函数调用自主管理记忆类比 OS 虚拟内存。上下文不够了就主动调用 memory_send_to_swap。Mem02024ADD/UPDATE/DELETE/NOOP 四操作。语义去重 0.85 判为更新。实测准确率提升 26%、p95 延迟降低 91%、token 节省 90%。五、Memory vs RAG面试高频题。RAG 是技术手段Memory 是产品职责。判断身份看数据归属不看检索手段。维度RAGMemory本质检索增强生成的技术范式用户私有长期上下文的产品能力数据来源外部知识库用户交互历史数据归属全局共享用户私有读写方向通常只读双向读写类比RAG 是图书馆Memory 是日记本。六、主流产品实现产品实现本质ChatGPT Memory服务端存储自动提取偏好纯 MemoryClaude Code Memorymemory/*.md dreaming 晋升纯 Memory全三层Cursor 项目索引代码库语义检索纯 RAGWorkBuddy SkillSKILL.md 文件系统程序性记忆工程化