多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

Hindsight:当 agent 记忆开始形成信念

Hindsight:当 agent 记忆开始形成信念 Hindsight当 agent 记忆开始形成信念上期的 CLM-8B 一天涨了两百星。今天点开 hindsight我的 agent 全跑在自托管小服务器上最缺能攒经验的记忆这期拆开看。#仓库周增 ⭐一句话1vectorize-io/hindsight17,365本期主角给 agent 装一套会学习的记忆2paperclipai/paperclip12,941上上期主角多 agent 公司还在涨3debpalash/VoiceStudio12,722全本地开源的 ElevenLabs 替代支持 646 种语言4stablyai/orca6,242并行 agent 舰队的开发环境5rohitg00/ai-engineering-from-scratch5,830AI 工程从零到上线的教程仓Cloudflare 的 security-audit-skill 一周 3,311多阶段安全审计加机器可读结论值得单独一期先记进索引。一周 17,365 星总星数 43,056这个叫 Hindsight 的仓库登上了本期 GitHub 周榜第一。它由 Vectorize.io 开源MIT 协议去年 10 月底建仓十一个月做到这个体量。官方的说法是「会学习的 agent 记忆」这篇拆三件事它怎么组织记忆四路召回比单路向量搜索强在哪以及它的代价和坑写在哪里。它是什么Hindsight 是一个独立的 agent 记忆服务PythonMIT存储用 PostgreSQL 加 pgvector部署时内嵌一个叫 pg0 的实例一条 docker 命令就能起。它解决的问题很具体多数 agent 的记忆是「把对话日志做语义搜索再把结果塞回上下文」短会话能用时间一长就散架。论文里的对照数字是全上下文基线在 LongMemEval 上只有 39.0%海量上下文硬塞并不等于记得住。官方横幅repo hindsight-docs/static/img使用路径短得反常。服务起在 8888 端口后客户端只有三个操作retain 写入recall 查询reflect 深度推理。已有 agent 想接入还有条捷径装 hindsight-litellm 后用 wrap_openai 包一层现有的 OpenAI 客户端每次调用前后自动完成记忆的存取代码改动两行。底层支持 25 家以上模型供应商连 ChatGPT Plus、Claude Pro 这类订阅也能当后端不用单独申请 API key。每个 memory bank 自带一个 MCP 端点Claude Code、Cursor 这类工具直接指过去就能用。三个操作与四层记忆网络官方架构图为什么有意思记忆分四层事实和体验分开存Hindsight 把记忆拆成四种结构。world facts 存客观事实experiences 存 agent 自己的经历两类分开之后agent 才能区分「世界如此」和「我经历过什么」。再往上是 observations后台进程把相关的散事实固化成带证据引用的信念每条保留原文引文和支持次数新证据到来时做的是加强、削弱或延伸不直接覆盖。最顶层 mental model 是某个常驻问题的现成答案比如「这位用户的偏好是什么」读它是一次数据库查询不触发 LLMagent 开机即带一页已经归纳好的结论。这套结构还有个对中文用户实际的细节实体保留原文张伟不会被转写成 Zhang Wei。四路召回并行结果融合重排查询时四条检索路同时跑语义向量、BM25 关键词、实体图谱遍历、时间范围过滤。各路结果用倒数排名融合再过一遍交叉编码器重排最后按 token 预算裁剪交付。第三方实测里这套机制各自接住了单路向量的典型失误关键词路捞回精确人名图谱路把「API 路由任务」和「REST 架构决策」两条不相邻的记忆连着浮出时间路答对了「昨天分配了什么」。单靠余弦相似度的方案这三种场景至少漏两种。分数敢让第三方复现LongMemEval 榜上 Hindsight 报 94.6%对照图里 GPT-4o 直接喂全上下文是 60.2%Zep 71.2%SuperMemory 85.92%。同赛道厂商榜单几乎全是自报这里的特别之处在 README 脚注数字由弗吉尼亚理工 Sanghani 中心和华盛顿邮报独立复现过。也有反向信号Mem0 五月自报 94.4%单次检索约六千八百 token只有全上下文方案的四分之一。分数是移动靶精度和成本一起动选型时两个数都得看。边界与局限写路径贵。每 retain 一条记忆都要过一遍 LLM 抽取、实体归一、图谱更新、多索引写入高频生产场景的账单会累积。reflect 依赖模型的 tool calling 能力随手选的本地小模型可能在这层静默失败。错误记忆撤不回。issue #3509 是个真实事故用户八月中旬留存了五条「Gramps 已通过 KeePass 可用」的错误事实之后 recall 和 reflect 一直把它们当真话召回现有的治理手段只能追加修正没有按条删除。评测方 Tessera 的批评也在这一点上LongMemEval 测会话内召回不测几个月的信念一致性系统可以榜一同时被一条永不撤回的坏观察污染。另有两个值得知道的问题openclaw 插件重载后 auto-retain 静默失效#4828抽取的实体错归属需要额外上下文消歧#2551。实操层面有三个前人踩过的坑。bank 冷启动薄演示前先灌种子记忆retain 的 context 参数要写具体值「task assignment」比「data」召回质量明显高系统提示里要明确命令模型使用召回结果否则它倾向自己编。版本节奏周更v0.10.2 是 9 月 29 日发的API 还在动。总的来说它值得现在就自托管把玩、读懂记忆分层设计生产托付之前先算清写路径的 LLM 账单等按条治理#3509落地。对谁有价值给 agent 产品做长期记忆的后端现在就值得深读四路召回加证据化观察是目前最完整的公开实现。自托管玩家顺手一条 docker 命令、内嵌 Postgres、MIT数据不出自己机器。想让 Claude Code 或 Cursor 跨会话记住项目上下文的人官方 coding-agents 包会从 git 历史自动建 bank零配置接进十来种 CLI。高频写入的生产 agent 建议再等等账单和记忆治理两笔账都还没翻篇。只做简单个性化比如记住用户偏好深色模式mem0 一类的单路语义搜索够用四路召回在这里是杀鸡用牛刀。数据截至 2026-09-30来源有 GitHub API、仓库 README 与 issues#3509/#4828/#2551、vectorize.io 博客、Tessera 与 Groundy 评测、dev.to 实测仓库 https://github.com/vectorize-io/hindsight
返回列表