大连理工大学与东京大学联手打造的“主动型AI助手“

发布时间:2026/7/25 23:49:00
大连理工大学与东京大学联手打造的“主动型AI助手“ 这项研究由大连理工大学、Alaya Lab和东京大学联合完成以预印本形式发布于2026年7月13日论文编号为arXiv:2607.11523。有兴趣深入钻研的读者可以通过该编号在arXiv平台查阅完整论文。你有没有这样的经历正在厨房忙着做饭却突然忘了自己把盐放在哪里或者拿着螺丝刀修东西却意识到自己其实需要扳手又或者一个重要的任务做到一半被别的事情打断之后完全忘记。这些日常小困扰大多数情况下都只能靠自己解决因为你身边的助手——不管是手机上的语音助手还是智能音箱——都在等着你开口发问而不是主动帮你留意这些细节。来自大连理工大学、Alaya Lab和东京大学的研究团队觉得这种等你发问才回答的助手模式实在太被动了。他们想打造一种新型助手能像一个贴心的生活秘书一样通过持续观察你正在经历的一切在合适的时机主动开口提醒、纠错或建议——而不是等你问了才说。这个系统被命名为Vinci2是他们早前研究成果Vinci的升级版。整个项目包含两大核心成果一个叫EgoServe的评测基准以及一个叫EgoMemo的智能代理模型。一、为什么等你发问的助手已经不够用了把助手比作一个跟在你身边的秘书现有的大多数AI助手只能算是接待员——你走过去说我需要帮助他才开始工作。研究团队把这种模式叫做被动范式用大白话说就是你不问我不答。这种模式的问题在于很多时候你甚至不知道自己需要帮助比如你根本没意识到自己正在用错误的方式削洋葱或者你已经好几天每晚熬夜刷手机这个习惯正在影响你的健康。现有的另一类尝试稍微进步了一些叫做半主动范式。这类系统会在你一开始就告诉它我要做红烧排骨帮我盯着步骤之后自动监控你的操作并在关键节点给出提示。但问题是这种系统的视野非常局限——它只能根据你最初给的任务指令行动而且只能看到当下这一刻的画面完全不理解你这两天、这几个月的行为规律也没有能力判断这个时候打扰你是否合适。研究团队提出的第三种范式才是他们真正想做的事情完全主动的助手。这种助手就像一个跟了你多年的老朋友对你的习惯、偏好、当前状态都了如指掌。它不需要你给出任何指令就能自己判断现在这个情况我应不应该说话、说什么、怎么说。这才是Vinci2想要实现的目标。二、先把考试题设计好——EgoServe评测基准的诞生在你着手打造一个聪明的系统之前你首先得有办法衡量它到底有多聪明。研究团队发现现有的所有视频理解测试题要么是给你一段剪好的视频片段问你这段视频讲了什么要么是让你在固定任务框架下评价系统的反应没有任何一套测试题是专门用来考察AI在连续观察你的日常生活时能不能在正确的时刻主动帮你这件事的。于是他们自己设计了这套考试——EgoServe。EgoServe的底层素材来自三个现实场景的第一视角视频数据集。第一个是EgoLife记录了真实参与者连续多天的日常生活从早上起床到晚上睡觉时长跨越几天甚至更长研究团队从中选取了三位参与者前五天的录像。第二个是HoloAssist记录的是有人指导下的实际操作任务比如组装设备、配置电子产品这些视频标注了每个操作步骤、错误点和教练的纠正时机一共挑选了191段验证视频。第三个是CaptainCook4D专门记录了人们按照食谱烹饪的过程其中既有正确操作也有刻意设置的错误操作覆盖24种菜谱选取了87段有明确错误标注的视频。这三个数据来源合在一起覆盖了从几分钟到好几天的不同时间尺度为EgoServe提供了丰富多样的现实场景基础整个基准总计超过3000条服务实例视频总时长约128小时。EgoServe把助手能提供的帮助分成了四个层次每个层次对应不同的时间跨度就像是不同记忆深度的考题。最浅的一层叫即时服务助手只需要看清当下发生了什么就能行动比如你正在徒手搓刀刃它立刻提醒你注意安全或者你在用一把不合适的工具它建议你换一个更顺手的。这类服务考察的是对当前画面的快速感知能力。稍深一层叫短期服务需要助手记住过去几分钟内发生的事情。比如它看到你刚才把盐放进了锅里但你现在又拿起盐罐准备再加它就该提醒你不要放重了又比如你刚完成了一道工序它可以顺势提示你下一步该做什么或者你中途犯了个操作错误它帮你纠正回来。再深一层叫情节服务需要助手记住几十分钟甚至几个小时前的事情。比如你之前开始了一个任务但还没做完就去做别的事了等你空下来它提醒你那个没完成的事情或者你现在的处境让之前某件事变得重要它帮你把那件事从记忆里调出来。最深的一层叫长期服务需要助手跨越多天甚至多个活动场景进行推断。比如它发现你连续好几天每次开会都忘了带笔记本于是主动建议你养成一个新习惯或者它把你今天的情况和三天前发生的某件事联系起来给你一个有背景依据的提醒。在这四个时间层次之内EgoServe又把具体的服务细化成了十个子类别分别是安全提醒、工具建议、错误纠正、资源提示、步骤引导、任务提醒、记忆回溯、习惯指导、日常优化和跨日关联。这十类服务覆盖了人在日常生活和操作任务中最常见的需求场景构成了一套相当全面的考卷。EgoServe评测一个AI助手的好坏从两个维度来看。第一个维度是时间精准度助手提供帮助的时机是否准确它不能太早事情还没发生也不能太晚已经无法挽回必须在一个合理的时间窗口内出现而且提供的是正确类别的服务。第二个维度是内容质量助手说的话是否真的有用、是否贴合当时的情境这部分由大型语言模型担任评判官对生成的回应打1到5分。三、给AI装上一个三层记忆系统——EgoMemo的设计原理解决了怎么考试的问题之后研究团队着手设计能通过这套考试的AI助手这就是EgoMemo。它最大的特点是完全不需要专门训练而是通过精巧的记忆结构和信息检索机制来实现主动帮助。把EgoMemo的工作方式比作一个经验丰富的私人管家这位管家随时跟着你用三本不同粒度的记事本记录你的生活随时翻阅这些记录来判断是否该主动上前说话。第一本记事本记录的是最细致的细节。每隔一小段时间管家就把这段时间里发生的一切用文字描述出来标注好时间并且保存几张关键的画面截图。对EgoMemo来说这些文字描述是通过一个视觉语言模型自动生成的针对每一小段视频比如30秒一段产生详细的文字描述记录下你的手在做什么、你看到了什么、周围有什么物品形成所谓的片段级描述库。第二本记事本是中等粒度的。每隔几分钟管家会回顾一下最近这段时间的细节记录把它们压缩成一段连贯的活动描述比如这个人过去五分钟一直在准备食材已经切好了洋葱和胡萝卜。这些活动级摘要既保留了足够多的有用信息又大幅减少了需要处理的文字量让助手能对最近的行为有个整体把握。第三本记事本记录的是最宏观的视角。每隔更长的时间比如一个小时管家会再把活动摘要进一步浓缩形成对整个时间段的高层次描述比如今天上午这个人在厨房待了两个小时烹饪、清洁交替进行期间还接了两个电话。这些会话级摘要帮助助手理解用户在更长时间尺度上的行为模式。光有这三层文字记录还不够因为有些信息用文字很难描述清楚比如某个物品长什么样、放在什么位置。于是EgoMemo还维护了一个视觉画面档案把每段视频的关键截图转化成机器能理解的数字向量可以理解为每张图片的数字指纹存档备查。当助手需要找和这张图片长得差不多的过去场景时就能通过比对数字指纹快速定位。除了这些记忆之外EgoMemo还同步维护着一张不断成长的关系网络图。每次生成新的文字描述时系统会自动提取出里面出现的人物、物品、地点以及它们之间的关系把这些信息添加到一张语义关系图中。比如刀放在厨房台面上、盐罐在橱柜第二层、张三昨天提到过要开会——这些零散的知识点都被组织成一张相互关联的知识网络方便助手在需要时快速找到相关联的信息。四、判断该不该开口以及如何找到相关记忆每当一段新的视频片段到来EgoMemo的推理部分就开始工作。它先看一眼最新的画面描述结合最近的活动摘要自问一个问题当前这个情况我需不需要主动说点什么如果答案是不需要就继续静默观察如果答案是需要就进入下一个阶段——决定去哪里找支撑这个判断的背景信息。这里的关键挑战在于仅凭当下这一刻的观察助手往往无法给出高质量的建议。就像一个新来的管家看到你在翻抽屉不知道你是在找钥匙还是找胶带更不知道你今天之前有没有用过这个抽屉里的东西。但一个跟了你多年的老管家会立刻想起你早上出门前把备用钥匙放进了这个抽屉。这种历史背景就是需要从记忆中检索的信息。EgoMemo通过三条并行的检索通道来找这些背景信息。第一条是文字相似度检索它把当前的问题转化成一个搜索关键词在三层文字记忆里找出最相关的段落——无论是几分钟前的细节描述还是几个小时前的活动摘要都在检索范围之内。第二条是关系图检索它从问题中提取出关键的实体词比如钥匙、抽屉在关系图中找到这些词节点再顺着图上的连线扩展到相邻的相关信息这样即使问题用的词和原来记录用的词不完全一样也能找到语义上相关的内容。第三条是图像相似度检索它把文字描述先转化成视觉特征描述再用这个描述去比对视觉档案里所有截图的数字指纹找出画面上最相似的历史时刻。检索结束后三条通道的结果被汇聚起来但这里还有个难题关系图检索和图像检索返回的只是一些片段的索引编号而不是可以直接阅读的文字。为了让推理部分能正常使用这些信息EgoMemo增加了一个描述重建步骤——把检索到的图片和原始文字片段一起喂给视觉语言模型让它用流畅的文字重新描述在这段检索到的历史时刻里发生了什么。这个步骤就像是让管家不仅找到了那页记录还把它翻译成了一段说得清楚的话消除了各种代词混用和视觉细节缺失的问题。最后当下画面的描述、三条通道检索到的背景信息、以及重建后的历史叙述全部汇聚给推理模块由它做出最终判断要不要开口以及说什么。整个流程既可以在主动模式下运行助手自己判断是否该说也可以在被动模式下运行用户主动发问助手去检索历史背景来回答——两种模式共用同一套架构不需要做任何修改。五、系统有多聪明——用数据说话研究团队在EgoServe上测试了EgoMemo同时也拿当下最强的几个商用大模型做了对比包括OpenAI的GPT-5-mini和Qwen3-VL-Plus。对比结果清楚地展示了主动帮助这件事有多难。Qwen3-VL-Plus直接在情节级和长期级服务上接近全军覆没——因为它根本没有历史记忆可供调用遇到需要回忆几小时前甚至几天前信息的情况完全束手无策。GPT-5-mini情况稍好整体得分4.7在即时安全提醒和步骤引导这类只需要看当前画面的任务上表现还算过得去但在长期服务上同样几乎全部交白卷。EgoMemo的整体F1得分达到了8.0几乎是GPT-5-mini的两倍。最显著的提升出现在那些需要跨时间记忆的服务类别上跨日关联得分从两个基准的0分提升到了4.9日常优化得分达到了11.8而基准模型在这个类别上同样是0分。在情节级服务上EgoMemo在记忆回溯和任务提醒两个子类都取得了非零得分而至少有一个基准模型在其中一类上得了0分。对于成功匹配到正确时间窗口的预测内容质量评分平均为2.8分满分5分整体质量处于合理水平。研究团队还做了一组拆解实验把EgoMemo的各个组件一个一个拿掉看会发生什么。把三层时间记忆系统简化成只有一层细节记录整体得分从8.0降到7.0跨日关联得分从4.9跌到1.9日常优化得分从11.8减半到5.7证明分层记忆对跨时间推理至关重要。把描述重建步骤去掉整体降到6.6记忆回溯和跨日关联都跌到0分说明原始检索结果如果不经过重建处理推理模块根本无法利用。去掉图像档案整体从8.0降到6.9主要影响跨日关联和日常优化这两类需要识别重复出现的视觉场景的任务。去掉关系图检索整体降到6.5跨日关联直接归零说明关系图是连接跨时间语义关联的核心机制。去掉文字相似度检索整体降到6.8跨日关联降到2.1这是找到时间上相关内容的主要渠道。三条检索通道缺一不可共同构成了互补的证据体系。六、能力迁移——在其他测试场景同样表现出色一套专门为主动助手设计的系统能不能在其他更通用的视频理解任务上也发挥作用研究团队把EgoMemo放到了另外五个已有的测试基准上验证。在ESTP-Bench这个考察视频流中主动问答能力的基准上EgoMemo在需要显式背景信息支撑的任务上达到了27.6分超过了包括EyeWO在内的有监督训练模型EyeWO得23.6分而且EgoMemo完全不需要训练数据这一点相当值得注意。在OVO-Bench这个考察实时视频理解能力的基准上EgoMemo的实时感知得分达到75.15超过了GPT-4o64.46和LLaVA-OneVision64.02。这背后的原因是EgoMemo通过多层摘要对视频进行了系统性的理解和索引而不仅仅是逐帧处理画面。在离线的第一视角视频问答任务上EgoMemo在EgoSchema这个需要长时间跨度推理的基准上得到74.8分比此前最好的EgoThinker高出7.2分在QAEgo4D这个情节记忆查询任务上也达到68.0同样领先。在EgoTaskQA这个更依赖短片段内精细动作理解的任务上EgoMemo得60.9与EgoThinker的64.4接近差距来自这个任务的特性——它更需要直接感知当下画面而不是调用历史记忆。从检索效率角度看研究团队也做了横向比较。VideoAgent每处理一分钟视频需要67.25秒Video-RAG需要20.81秒EgoMemo只需要13.11秒比VideoAgent快5.1倍比Video-RAG快1.6倍。EgoMemo在构建记忆的阶段确实需要较长时间平均每分钟视频77.33秒但由于记忆构建和推理检索是异步进行的这部分时间不会加到每次查询的延迟上。七、数据是怎么制作出来的——标注流程的设计制作EgoServe的标注数据本身也是一项不小的工程因为标注主动帮助比标注普通视频内容难得多。你不仅要知道视频里发生了什么还要判断哪个时刻应该触发哪类服务以及助手该说什么。研究团队采用了半自动化的流程。对于HoloAssist他们把视频中已有的人工标注包括步骤边界、错误标记、教练纠正按时间顺序整理成结构化文档然后用特定的提示词引导Gemini大模型把这些结构化标注转化为主动服务实例——比如教练的纠正动作自然对应错误纠正服务步骤转换点对应步骤引导服务。对于EgoLife研究团队把每小时的人工标注整理后送入Gemini针对即时、短期和情节级服务让模型直接从当前时间段内生成候选服务实例。但对于需要跨越多天的长期服务他们设计了一个滚动积累的策略先让模型从第一天的记录中提取潜在的长期事件线索把这些线索携带到下一天的处理过程中再结合新的观察生成候选触发点——这样就模拟了助手跨天积累记忆、识别行为规律的过程。对于CaptainCook4D研究团队直接利用现有的食谱步骤标注和错误标签生成工具建议、步骤引导和错误纠正三类服务实例。所有自动生成的候选标注最后都经过了人工核查。两名标注员共同观看对应视频片段讨论并决定是否接受该候选条目。他们会拒掉三类问题标注没有实际帮助价值的比如把用户已经在屏幕上看到的信息再说一遍、触发时间窗口与实际视频内容不对应的以及仅凭对话音频而非视觉观察生成的。最终从4038个初始候选条目中有3437条通过了人工核查整体通过率85.1%。不同服务类别的通过率有所差异安全提醒最高实际上因为重新分类还从195条增加到了241条跨日关联满额保留而资源提示类最低69.8%反映了从视觉画面中判断刚才用了什么资源这件事本身的困难。说到底Vinci2这项研究做的事情可以用一句话来概括它试图把AI助手从你来问我才回答的被动接线员升级为我全程陪着你、在合适的时候主动开口的贴心伙伴。为了做到这件事研究团队首先制定了一套全面的考卷EgoServe明确定义了什么叫在正确的时机提供正确的帮助并且把帮助分成了从即时到跨日的四个时间层次然后设计了一套记忆和检索架构EgoMemo让AI能像真正有记忆的助手一样把当下观察和历史积累结合起来做判断。这项研究目前仍存在一些明显的局限性。EgoMemo在把视频转化为文字描述时会不可避免地丢失一些难以言说的视觉细节它依赖名称匹配来识别同一个实体当两个物品外观相似但名称不同时容易出错自动标注流程也可能对某些更容易生成的服务类别有偏向。研究团队也坦承整体得分仍处于中等水平说明主动助手这个问题远比看起来复杂——同时找对时机、判对类别、生成有用的回应三件事加在一起的难度相当高。对于普通用户来说这项研究意味着未来的智能设备有可能变得更加懂你——不是你说什么它理解什么而是它看着你的日常在你最需要的时候主动说一句恰到好处的话。这一天什么时候会真正到来或许值得持续关注。QAQ1EgoMemo需要提前训练才能使用吗AEgoMemo完全不需要专门训练它是一个开箱即用的系统通过实时构建记忆结构和检索历史信息来工作。这意味着它可以直接应用于新的场景不依赖特定任务的训练数据这也是它能在多个不同类型的测试基准上都取得不错表现的重要原因。Q2EgoServe和已有的视频理解测试有什么本质区别AEgoServe最核心的区别在于它考察的是主动干预而非被动回答。现有测试大多是给你一段视频然后问你问题而EgoServe要求AI自己判断什么时候该说话、说什么类型的话并且评估时机是否准确。这是一个从问答能力到情境判断能力的根本性转变。Q3EgoMemo的三条检索通道分别解决什么问题A三条通道各有分工。文字相似度检索负责找语义相近的历史描述适合处理能用语言清晰表达的信息关系图检索负责找语义上相关联但用词不同的信息比如刀和切割工具之间的关联图像档案检索负责找视觉上相似的历史画面弥补文字描述无法捕捉的视觉细节。三者互补缺任何一个都会影响特定类别任务的表现。