大连理工大学与东京大学联手打造的“主动型AI助手“
这项研究由大连理工大学、Alaya Lab和东京大学联合完成,以预印本形式发布于2026年7月13日,论文编号为arXiv:2607.11523。有兴趣深入钻研的读者可以通过该编号在arXiv平台查阅完整论文。
你有没有这样的经历:正在厨房忙着做饭,却突然忘了自己把盐放在哪里;或者拿着螺丝刀修东西,却意识到自己其实需要扳手;又或者一个重要的任务做到一半,被别的事情打断之后完全忘记。这些日常小困扰,大多数情况下都只能靠自己解决,因为你身边的助手——不管是手机上的语音助手还是智能音箱——都在等着你开口发问,而不是主动帮你留意这些细节。
来自大连理工大学、Alaya Lab和东京大学的研究团队觉得,这种"等你发问才回答"的助手模式实在太被动了。他们想打造一种新型助手,能像一个贴心的生活秘书一样,通过持续观察你正在经历的一切,在合适的时机主动开口提醒、纠错或建议——而不是等你问了才说。这个系统被命名为Vinci2,是他们早前研究成果Vinci的升级版。整个项目包含两大核心成果:一个叫EgoServe的评测基准,以及一个叫EgoMemo的智能代理模型。
一、为什么"等你发问"的助手已经不够用了
把助手比作一个跟在你身边的秘书,现有的大多数AI助手只能算是"接待员"——你走过去说"我需要帮助",他才开始工作。研究团队把这种模式叫做"被动范式",用大白话说就是:你不问,我不答。这种模式的问题在于,很多时候你甚至不知道自己需要帮助,比如你根本没意识到自己正在用错误的方式削洋葱,或者你已经好几天每晚熬夜刷手机这个习惯正在影响你的健康。
现有的另一类尝试稍微进步了一些,叫做"半主动范式"。这类系统会在你一开始就告诉它"我要做红烧排骨,帮我盯着步骤"之后,自动监控你的操作并在关键节点给出提示。但问题是,这种系统的视野非常局限——它只能根据你最初给的任务指令行动,而且只能看到当下这一刻的画面,完全不理解你这两天、这几个月的行为规律,也没有能力判断"这个时候打扰你是否合适"。
研究团队提出的第三种范式,才是他们真正想做的事情:完全主动的助手。这种助手就像一个跟了你多年的老朋友,对你的习惯、偏好、当前状态都了如指掌。它不需要你给出任何指令,就能自己判断"现在这个情况,我应不应该说话、说什么、怎么说"。这才是Vinci2想要实现的目标。
二、先把"考试题"设计好——EgoServe评测基准的诞生
在你着手打造一个聪明的系统之前,你首先得有办法衡量它到底有多聪明。研究团队发现,现有的所有视频理解测试题,要么是给你一段剪好的视频片段问你"这段视频讲了什么",要么是让你在固定任务框架下评价系统的反应,没有任何一套测试题是专门用来考察"AI在连续观察你的日常生活时,能不能在正确的时刻主动帮你"这件事的。于是他们自己设计了这套考试——EgoServe。
EgoServe的底层素材来自三个现实场景的第一视角视频数据集。第一个是EgoLife,记录了真实参与者连续多天的日常生活,从早上起床到晚上睡觉,时长跨越几天甚至更长,研究团队从中选取了三位参与者前五天的录像。第二个是HoloAssist,记录的是有人指导下的实际操作任务,比如组装设备、配置电子产品,这些视频标注了每个操作步骤、错误点和教练的纠正时机,一共挑选了191段验证视频。第三个是CaptainCook4D,专门记录了人们按照食谱烹饪的过程,其中既有正确操作也有刻意设置的错误操作,覆盖24种菜谱,选取了87段有明确错误标注的视频。
这三个数据来源合在一起,覆盖了从几分钟到好几天的不同时间尺度,为EgoServe提供了丰富多样的现实场景基础,整个基准总计超过3000条服务实例,视频总时长约128小时。
EgoServe把助手能提供的帮助分成了四个层次,每个层次对应不同的时间跨度,就像是不同"记忆深度"的考题。最浅的一层叫即时服务,助手只需要看清当下发生了什么就能行动,比如你正在徒手搓刀刃,它立刻提醒你注意安全,或者你在用一把不合适的工具,它建议你换一个更顺手的。这类服务考察的是对当前画面的快速感知能力。
稍深一层叫短期服务,需要助手记住过去几分钟内发生的事情。比如它看到你刚才把盐放进了锅里,但你现在又拿起盐罐准备再加,它就该提醒你不要放重了;又比如你刚完成了一道工序,它可以顺势提示你下一步该做什么;或者你中途犯了个操作错误,它帮你纠正回来。
再深一层叫情节服务,需要助手记住几十分钟甚至几个小时前的事情。比如你之前开始了一个任务但还没做完就去做别的事了,等你空下来,它提醒你那个没完成的事情;或者你现在的处境让之前某件事变得重要,它帮你把那件事从记忆里调出来。
最深的一层叫长期服务,需要助手跨越多天甚至多个活动场景进行推断。比如它发现你连续好几天每次开会都忘了带笔记本,于是主动建议你养成一个新习惯;或者它把你今天的情况和三天前发生的某件事联系起来,给你一个有背景依据的提醒。
在这四个时间层次之内,EgoServe又把具体的服务细化成了十个子类别,分别是安全提醒、工具建议、错误纠正、资源提示、步骤引导、任务提醒、记忆回溯、习惯指导、日常优化和跨日关联。这十类服务覆盖了人在日常生活和操作任务中最常见的需求场景,构成了一套相当全面的考卷。
EgoServe评测一个AI助手的好坏,从两个维度来看。第一个维度是时间精准度:助手提供帮助的时机是否准确?它不能太早(事情还没发生),也不能太晚(已经无法挽回),必须在一个合理的时间窗口内出现,而且提供的是正确类别的服务。第二个维度是内容质量:助手说的话是否真的有用、是否贴合当时的情境?这部分由大型语言模型担任评判官,对生成的回应打1到5分。
三、给AI装上一个"三层记忆系统"——EgoMemo的设计原理
解决了"怎么考试"的问题之后,研究团队着手设计能通过这套考试的AI助手,这就是EgoMemo。它最大的特点是完全不需要专门训练,而是通过精巧的记忆结构和信息检索机制来实现主动帮助。
把EgoMemo的工作方式比作一个经验丰富的私人管家,这位管家随时跟着你,用三本不同粒度的记事本记录你的生活,随时翻阅这些记录来判断是否该主动上前说话。
第一本记事本记录的是最细致的细节。每隔一小段时间,管家就把这段时间里发生的一切用文字描述出来,标注好时间,并且保存几张关键的画面截图。对EgoMemo来说,这些文字描述是通过一个视觉语言模型自动生成的,针对每一小段视频(比如30秒一段)产生详细的文字描述,记录下你的手在做什么、你看到了什么、周围有什么物品,形成所谓的片段级描述库。
第二本记事本是中等粒度的。每隔几分钟,管家会回顾一下最近这段时间的细节记录,把它们压缩成一段连贯的活动描述,比如"这个人过去五分钟一直在准备食材,已经切好了洋葱和胡萝卜"。这些活动级摘要既保留了足够多的有用信息,又大幅减少了需要处理的文字量,让助手能对最近的行为有个整体把握。
第三本记事本记录的是最宏观的视角。每隔更长的时间(比如一个小时),管家会再把活动摘要进一步浓缩,形成对整个时间段的高层次描述,比如"今天上午这个人在厨房待了两个小时,烹饪、清洁交替进行,期间还接了两个电话"。这些会话级摘要帮助助手理解用户在更长时间尺度上的行为模式。
光有这三层文字记录还不够,因为有些信息用文字很难描述清楚,比如某个物品长什么样、放在什么位置。于是EgoMemo还维护了一个视觉画面档案,把每段视频的关键截图转化成机器能理解的数字向量(可以理解为每张图片的"数字指纹"),存档备查。当助手需要找"和这张图片长得差不多的过去场景"时,就能通过比对数字指纹快速定位。
除了这些记忆之外,EgoMemo还同步维护着一张不断成长的关系网络图。每次生成新的文字描述时,系统会自动提取出里面出现的人物、物品、地点,以及它们之间的关系,把这些信息添加到一张语义关系图中。比如"刀放在厨房台面上"、"盐罐在橱柜第二层"、"张三昨天提到过要开会"——这些零散的知识点都被组织成一张相互关联的知识网络,方便助手在需要时快速找到相关联的信息。
四、判断该不该开口,以及如何找到相关记忆
每当一段新的视频片段到来,EgoMemo的推理部分就开始工作。它先看一眼最新的画面描述,结合最近的活动摘要,自问一个问题:"当前这个情况,我需不需要主动说点什么?"如果答案是不需要,就继续静默观察;如果答案是需要,就进入下一个阶段——决定去哪里找支撑这个判断的背景信息。
这里的关键挑战在于,仅凭当下这一刻的观察,助手往往无法给出高质量的建议。就像一个新来的管家看到你在翻抽屉,不知道你是在找钥匙还是找胶带,更不知道你今天之前有没有用过这个抽屉里的东西。但一个跟了你多年的老管家,会立刻想起你早上出门前把备用钥匙放进了这个抽屉。这种"历史背景"就是需要从记忆中检索的信息。
EgoMemo通过三条并行的检索通道来找这些背景信息。第一条是文字相似度检索,它把当前的问题转化成一个搜索关键词,在三层文字记忆里找出最相关的段落——无论是几分钟前的细节描述,还是几个小时前的活动摘要,都在检索范围之内。第二条是关系图检索,它从问题中提取出关键的实体词(比如"钥匙"、"抽屉"),在关系图中找到这些词节点,再顺着图上的连线扩展到相邻的相关信息,这样即使问题用的词和原来记录用的词不完全一样,也能找到语义上相关的内容。第三条是图像相似度检索,它把文字描述先转化成视觉特征描述,再用这个描述去比对视觉档案里所有截图的数字指纹,找出画面上最相似的历史时刻。
检索结束后,三条通道的结果被汇聚起来,但这里还有个难题:关系图检索和图像检索返回的只是一些片段的索引编号,而不是可以直接阅读的文字。为了让推理部分能正常使用这些信息,EgoMemo增加了一个"描述重建"步骤——把检索到的图片和原始文字片段一起喂给视觉语言模型,让它用流畅的文字重新描述"在这段检索到的历史时刻里,发生了什么"。这个步骤就像是让管家不仅找到了那页记录,还把它翻译成了一段说得清楚的话,消除了各种代词混用和视觉细节缺失的问题。
最后,当下画面的描述、三条通道检索到的背景信息、以及重建后的历史叙述,全部汇聚给推理模块,由它做出最终判断:要不要开口,以及说什么。整个流程既可以在主动模式下运行(助手自己判断是否该说),也可以在被动模式下运行(用户主动发问,助手去检索历史背景来回答)——两种模式共用同一套架构,不需要做任何修改。
五、系统有多聪明——用数据说话
研究团队在EgoServe上测试了EgoMemo,同时也拿当下最强的几个商用大模型做了对比,包括OpenAI的GPT-5-mini和Qwen3-VL-Plus。
对比结果清楚地展示了主动帮助这件事有多难。Qwen3-VL-Plus直接在情节级和长期级服务上接近全军覆没——因为它根本没有历史记忆可供调用,遇到需要回忆几小时前甚至几天前信息的情况,完全束手无策。GPT-5-mini情况稍好,整体得分4.7,在即时安全提醒和步骤引导这类只需要看当前画面的任务上表现还算过得去,但在长期服务上同样几乎全部交白卷。
EgoMemo的整体F1得分达到了8.0,几乎是GPT-5-mini的两倍。最显著的提升出现在那些需要跨时间记忆的服务类别上:跨日关联得分从两个基准的0分提升到了4.9,日常优化得分达到了11.8,而基准模型在这个类别上同样是0分。在情节级服务上,EgoMemo在记忆回溯和任务提醒两个子类都取得了非零得分,而至少有一个基准模型在其中一类上得了0分。对于成功匹配到正确时间窗口的预测,内容质量评分平均为2.8分(满分5分),整体质量处于合理水平。
研究团队还做了一组拆解实验,把EgoMemo的各个组件一个一个拿掉,看会发生什么。把三层时间记忆系统简化成只有一层细节记录,整体得分从8.0降到7.0,跨日关联得分从4.9跌到1.9,日常优化得分从11.8减半到5.7,证明分层记忆对跨时间推理至关重要。把描述重建步骤去掉,整体降到6.6,记忆回溯和跨日关联都跌到0分,说明原始检索结果如果不经过重建处理,推理模块根本无法利用。去掉图像档案,整体从8.0降到6.9,主要影响跨日关联和日常优化这两类需要识别重复出现的视觉场景的任务。去掉关系图检索,整体降到6.5,跨日关联直接归零,说明关系图是连接跨时间语义关联的核心机制。去掉文字相似度检索,整体降到6.8,跨日关联降到2.1,这是找到时间上相关内容的主要渠道。三条检索通道缺一不可,共同构成了互补的证据体系。
六、能力迁移——在其他测试场景同样表现出色
一套专门为主动助手设计的系统,能不能在其他更通用的视频理解任务上也发挥作用?研究团队把EgoMemo放到了另外五个已有的测试基准上验证。
在ESTP-Bench这个考察视频流中主动问答能力的基准上,EgoMemo在需要显式背景信息支撑的任务上达到了27.6分,超过了包括EyeWO在内的有监督训练模型(EyeWO得23.6分),而且EgoMemo完全不需要训练数据,这一点相当值得注意。
在OVO-Bench这个考察实时视频理解能力的基准上,EgoMemo的实时感知得分达到75.15,超过了GPT-4o(64.46)和LLaVA-OneVision(64.02)。这背后的原因是,EgoMemo通过多层摘要对视频进行了系统性的理解和索引,而不仅仅是逐帧处理画面。
在离线的第一视角视频问答任务上,EgoMemo在EgoSchema这个需要长时间跨度推理的基准上得到74.8分,比此前最好的EgoThinker高出7.2分;在QAEgo4D这个情节记忆查询任务上也达到68.0,同样领先。在EgoTaskQA这个更依赖短片段内精细动作理解的任务上,EgoMemo得60.9,与EgoThinker的64.4接近,差距来自这个任务的特性——它更需要直接感知当下画面,而不是调用历史记忆。
从检索效率角度看,研究团队也做了横向比较。VideoAgent每处理一分钟视频需要67.25秒;Video-RAG需要20.81秒;EgoMemo只需要13.11秒,比VideoAgent快5.1倍,比Video-RAG快1.6倍。EgoMemo在构建记忆的阶段确实需要较长时间(平均每分钟视频77.33秒),但由于记忆构建和推理检索是异步进行的,这部分时间不会加到每次查询的延迟上。
七、数据是怎么制作出来的——标注流程的设计
制作EgoServe的标注数据本身也是一项不小的工程,因为标注主动帮助比标注普通视频内容难得多。你不仅要知道视频里发生了什么,还要判断哪个时刻应该触发哪类服务,以及助手该说什么。
研究团队采用了半自动化的流程。对于HoloAssist,他们把视频中已有的人工标注(包括步骤边界、错误标记、教练纠正)按时间顺序整理成结构化文档,然后用特定的提示词引导Gemini大模型把这些结构化标注转化为主动服务实例——比如教练的纠正动作自然对应错误纠正服务,步骤转换点对应步骤引导服务。
对于EgoLife,研究团队把每小时的人工标注整理后送入Gemini,针对即时、短期和情节级服务,让模型直接从当前时间段内生成候选服务实例。但对于需要跨越多天的长期服务,他们设计了一个滚动积累的策略:先让模型从第一天的记录中提取潜在的长期事件线索,把这些线索携带到下一天的处理过程中,再结合新的观察生成候选触发点——这样就模拟了助手跨天积累记忆、识别行为规律的过程。
对于CaptainCook4D,研究团队直接利用现有的食谱步骤标注和错误标签,生成工具建议、步骤引导和错误纠正三类服务实例。
所有自动生成的候选标注,最后都经过了人工核查。两名标注员共同观看对应视频片段,讨论并决定是否接受该候选条目。他们会拒掉三类问题标注:没有实际帮助价值的(比如把用户已经在屏幕上看到的信息再说一遍)、触发时间窗口与实际视频内容不对应的,以及仅凭对话音频而非视觉观察生成的。
最终,从4038个初始候选条目中,有3437条通过了人工核查,整体通过率85.1%。不同服务类别的通过率有所差异:安全提醒最高(实际上因为重新分类还从195条增加到了241条),跨日关联满额保留,而资源提示类最低(69.8%),反映了从视觉画面中判断"刚才用了什么资源"这件事本身的困难。
说到底,Vinci2这项研究做的事情,可以用一句话来概括:它试图把AI助手从"你来问我才回答"的被动接线员,升级为"我全程陪着你、在合适的时候主动开口"的贴心伙伴。为了做到这件事,研究团队首先制定了一套全面的考卷(EgoServe),明确定义了什么叫"在正确的时机提供正确的帮助",并且把帮助分成了从即时到跨日的四个时间层次;然后设计了一套记忆和检索架构(EgoMemo),让AI能像真正有记忆的助手一样,把当下观察和历史积累结合起来做判断。
这项研究目前仍存在一些明显的局限性。EgoMemo在把视频转化为文字描述时,会不可避免地丢失一些难以言说的视觉细节;它依赖名称匹配来识别同一个实体,当两个物品外观相似但名称不同时容易出错;自动标注流程也可能对某些更容易生成的服务类别有偏向。研究团队也坦承,整体得分仍处于中等水平,说明主动助手这个问题远比看起来复杂——同时找对时机、判对类别、生成有用的回应,三件事加在一起的难度相当高。
对于普通用户来说,这项研究意味着未来的智能设备有可能变得更加"懂你"——不是你说什么它理解什么,而是它看着你的日常,在你最需要的时候主动说一句恰到好处的话。这一天什么时候会真正到来,或许值得持续关注。
Q&A
Q1:EgoMemo需要提前训练才能使用吗?
A:EgoMemo完全不需要专门训练,它是一个"开箱即用"的系统,通过实时构建记忆结构和检索历史信息来工作。这意味着它可以直接应用于新的场景,不依赖特定任务的训练数据,这也是它能在多个不同类型的测试基准上都取得不错表现的重要原因。
Q2:EgoServe和已有的视频理解测试有什么本质区别?
A:EgoServe最核心的区别在于它考察的是"主动干预"而非"被动回答"。现有测试大多是给你一段视频然后问你问题,而EgoServe要求AI自己判断什么时候该说话、说什么类型的话,并且评估时机是否准确。这是一个从"问答能力"到"情境判断能力"的根本性转变。
Q3:EgoMemo的三条检索通道分别解决什么问题?
A:三条通道各有分工。文字相似度检索负责找语义相近的历史描述,适合处理能用语言清晰表达的信息;关系图检索负责找语义上相关联但用词不同的信息,比如"刀"和"切割工具"之间的关联;图像档案检索负责找视觉上相似的历史画面,弥补文字描述无法捕捉的视觉细节。三者互补,缺任何一个都会影响特定类别任务的表现。
