南京大学领衔研发:AI如何真正“看懂“视频里的每一个关键瞬间? 这项由南京大学、上海人工智能实验室、上海交通大学、浙江大学、中国科学技术大学和复旦大学联合开展的研究于2026年7月以技术报告形式发布论文编号为arXiv:2607.17423v1有兴趣深入了解的读者可以通过该编号查询完整论文。你有没有遇到过这样的烦恼明明记得那部纪录片里有一段特别精彩的画面却要把整个视频从头拖到尾一帧一帧地找或者问AI视频里有没有出现猫它能告诉你有却没法告诉你在第3分27秒到第3分45秒这个看似细小的缺陷其实是当今AI视频理解领域一个根本性的短板——AI能读懂视频里发生了什么却不太能精确告诉你它发生在哪个时间段。南京大学的研究团队把这个能力称为视频时间定位并以此为核心开发出了一套名为TimeLens2的系统。这套系统的核心雄心是用一个统一的模型在各种长短不一、内容各异的视频里精准找到任何你感兴趣的时间段——无论那段内容只出现了一次还是零零散散地出现了好几次无论视频只有几十秒还是长达一个多小时。要理解这项研究的价值可以把AI视频理解比作一个侦探。之前的AI侦探已经能看完一整个案件现场然后告诉你这里发生了一起谋杀案。但如果你想知道凶手的手套放在哪个抽屉里、从几点到几点被放在那里它就束手无策了。TimeLens2要做的就是培养出一批能精准指出证据在第几分第几秒的顶级侦探。---一、案件背景为什么找时间段这么难在深入了解这套系统的具体工作方式之前有必要先理解这个问题究竟难在哪里。表面上看在视频里找到某个时间段似乎是个简单任务。实际上这里藏着三层相互交织的困难。第一层困难来自标注数据本身的可靠性。研究团队把这个问题称为标注质量问题。当人类标注员面对一段一小时的视频被要求找出所有出现红色汽车的时间段时他们很容易犯以下几种错误把不同时间出现的两辆相似红色汽车搞混、漏掉某次出现、把开始时间标早了几秒或结束时间标晚了几秒。视频越长这些错误就越多。更麻烦的是视频里大多数内容都是无关的干扰项真正相关的内容可能只占整个视频的一小部分。这就像让侦探在一个装满无关文件的巨大档案室里仅凭记忆一次性找出所有关键证据。第二层困难来自目标本身的形态。有些证据只出现一次有些却断断续续出现好几次。比如搅拌红色酱汁的所有片段可能在视频的第2分钟、第8分钟、第15分钟都各有一段。传统的AI方法通常只会找出一个连续的时间段没办法优雅地处理这种多处出现、各自独立的情况。第三层困难来自训练AI的方式本身。即便有了高质量的标注数据用什么标准来打分、指导AI改进依然是个棘手问题。常用的打分标准叫做时间重叠度tIoU它衡量AI预测的时间段和正确答案有多大面积重叠。但这个指标有个致命缺陷只要AI的预测和正确答案没有任何重叠不管AI预测的位置是差了1秒还是差了10分钟得分都是一样的零分。这就像评判一个侦探只要他没找到凶器不管他找的地方是离凶器藏匿处一步之遥还是相差十万八千里都被认定为完全失败——这显然不公平也无法给侦探任何有效的方向性指引。这三层困难共同构成了TimeLens2需要解决的核心挑战。---二、建立案件档案库93,000个高质量训练样本是怎么来的任何侦探学校的核心资产都是案例库。TimeLens2的案例库叫做TimeLens2-93K包含23,793段视频和93,232个标注好的查询-时间段对其中还有12,091个包含多个不连续时间段的复杂案例。为了让这个案例库足够多样研究团队从YouTube收集了34,867段视频涵盖娱乐、教育、体育、新闻、科技、游戏、旅行、汽车、音乐、日常生活等15个领域。更重要的是这些视频在时长上经过了刻意的分层设计一分钟以内的有10,000段一到十分钟的有10,000段十到三十分钟的有10,000段三十到六十分钟的有3,096段超过一小时的有1,771段。这样的分层确保了训练数据覆盖各种搜索难度——在30秒的视频里找目标和在一小时的视频里找目标对AI来说是完全不同量级的挑战。然而仅仅收集视频还远远不够。关键在于如何为每一段视频生成可靠的标注。研究团队设计了一条六步流水线这条流水线的核心思想是把一次性做出全部判断这个高风险动作拆解成一系列逐步聚焦、相互验证的低风险决策。第一步是给每段视频建立分层时间索引。团队使用一种叫做PySceneDetect的工具根据视频内容的变化把视频切分成20到60秒的小片段然后用大型视觉语言模型具体来说是Qwen3-VL-235B一个极其强大的AI模型为整段视频生成一个全局描述同时为每个小片段生成一个局部描述。全局描述负责把握这个视频整体在讲什么局部描述则精确记录这个片段里发生了什么具体动作或变化。这就像侦探在研究案件时既要有整个案件的概览又要有每个现场细节的详细记录。第二步是自动生成查询和粗略候选区间。研究团队用另一个强大的AIKimi-K2.5读取所有这些描述自动生成有意义的查询语句同时初步圈定哪些时间段可能和这个查询相关。这些初步圈定的时间段叫做粗略候选区间它们继承了视频描述里的时间信息为后续的精确定位提供了起点。值得注意的是这些候选区间还不是最终答案——它们只是缩小了搜索范围。第三步是双侦探独立侦查。这是整个流水线最有趣的环节。研究团队部署了两个完全独立的AI模型——Qwen3-VL-30B-A3B和TimeLens-8B——让它们各自独立地观看视频中的相关片段并给出自己认为正确的时间段标注。这两个AI的思维方式不同用专业术语说是归纳偏置不同就像两个来自不同背景的侦探他们会用不同的方式分析同一个案件。每个AI都可以给出一个或多个时间段也可以给出空集意味着它认为这个视频片段里根本没有相关内容。第四步是双侦探协商取证。两个AI给出各自的答案后系统会计算两份答案的时间重叠度。如果重叠度超过0.9也就是说两个AI的答案高度一致相差不超过10%这个案例才被认为是可靠的被保留下来并以Qwen模型的答案作为标准答案。这个设计背后的逻辑是如果两个思维方式不同的侦探得出了几乎相同的结论这个结论很可能是正确的如果两人意见分歧很大说明这个案例本身存在歧义不应该被用来训练AI。仅仅时间上一致还不够研究团队还在第四步中加入了语义验证。他们用另一个AI模型Qwen3-VL-Embedding把被保留的视频片段和对应的查询语句都转换成数学向量然后计算两者的相似度。如果相似度低于0.5意味着即便两个侦探找到了同一个地方这个地方也和案件本身关系不大这个案例同样会被排除。这道关卡筛掉了两个AI碰巧都找错了同一个地方的情况。经过这两道关卡原本百万级别的候选标注被大幅压缩——从最初的近百万条经过时间共识筛选后剩下约17万条再经过语义验证后剩下约9.3万条。规模是缩小了但质量却大幅提升。第五步是边界精修。经过前面的验证研究团队已经确认了哪些时间段是有效的但时间段的精确起止点往往还不够准确。于是他们对每个时间段的边界各向前后延伸3秒让强大的Qwen3-VL-235B模型仔细观察这6秒的过渡区域精确找出真正的开始点和结束点。对于那些相邻时间段之间只有不到1秒间隔的情况系统会把它们合并认为这种微小的间隔不过是眨眼之间的遮挡或者边界标注的小误差而非真正独立的两段。这套六步流水线的精妙之处在于它把一个人面对整个视频做出一次判断变成了多个独立系统在局部范围内做出相互验证的判断。每一步都只处理自己擅长的子问题每一步的错误都会被下一步的验证机制捕捉并修正。最终留下来的9.3万条标注是经过层层筛选的高置信度证据。---三、训练侦探学校如何让AI真正学会时间搜索有了高质量的案例库接下来是如何利用这些案例训练出出色的AI侦探。研究团队采用了两阶段的训练策略。第一阶段是通读案例习得能力。研究团队把Qwen3-VL系列基础模型一种强大的视觉语言AI分别有20亿、40亿、80亿参数三个版本参数可以粗略理解为AI的脑细胞数量放在完整的长视频上进行训练让它同时学习TimeLens2-93K的数据、已有的TimeLens-100K数据集以及Ego4D-NLQ的第一人称视角视频数据。这一阶段有一个重要的设计细节格式多样化训练。同一个查询和同一段目标时间会被用27种不同的提问方式和28种不同的回答格式来呈现。比如同样是找到搅拌酱汁的时间段有时候会问这个动作发生在什么时候有时候会问请定位视频中搅拌酱汁的所有片段有时候用JSON格式回答有时候用自然语言回答有时候用分秒格式有时候用纯秒数格式……总计形成了756种不同的问答界面组合。这种设计的目的是让AI学会的不是如何回答某种特定格式的问题而是如何理解视频里的时间线索本身。就像一个真正优秀的侦探不管别人是用中文、英文还是手势比划来问他他都能准确指出证据在哪里——因为他真正掌握的是案件本身而不是如何应对特定的问句形式。第一阶段的效果是让AI具备了在长视频里搜索证据的基本能力。但研究团队发现仅凭这个训练AI给出的时间段往往还不够精准——就像一个侦探已经能找到正确的房间却还没精确到正确的抽屉。于是进入第二阶段用强化学习做精细校准。强化学习可以理解为通过不断尝试和打分来改进——AI猜一个答案系统打个分AI根据得分调整策略再猜再打分如此循环。具体使用的技术叫GRPO在这个过程中系统会为每个问题生成多个候选答案通过比较不同答案的得分来指导AI改进。为了让强化学习更有效率研究团队还引入了难样本优先策略在进入强化学习训练之前先用第一阶段训练好的模型对训练数据里的每个问题跑8次测试看看平均得分。得分越低的问题说明AI在这类问题上越薄弱在后续训练中就给予越高的权重。这就像一个侦探学校不把时间平均花在所有案例上而是重点针对学员最容易出错的案件类型进行专项训练。---四、发明新的打分标准用搬运距离来衡量预测质量这套训练系统的另一个核心创新是打分方式的设计。前面提到传统的时间重叠度tIoU打分有个根本缺陷只要没有重叠不管差多远都得零分。研究团队为此专门设计了一种新的打分方式叫做时间Wasserstein奖励RTW。要理解这个打分方式的直觉可以用沙堆搬运来类比。假设正确答案是把沙堆放在某个位置AI给出的答案是把沙堆放在另一个位置。时间Wasserstein奖励衡量的是把AI放置的沙堆搬运到正确位置需要搬运多远的距离距离越短说明AI的答案越接近正确得分越高距离越远说明AI的答案偏差越大得分越低。这个搬运距离的计算方式有一个巧妙之处它不管AI把沙堆分成了几堆也就是不管AI给出了几个时间段只关心所有沙堆合在一起后整体的重心和覆盖范围与正确答案有多接近。这解决了一个传统方法会遇到的棘手问题当AI把一个时间段拆成两段预测时传统的一对一匹配打分方式就会出问题但Wasserstein距离完全不受这种分法不同的影响。用一个具体例子来说正确答案是第3到第7秒AI-A预测的是第8到第12秒差了1秒才挨上AI-B预测的是第50到第55秒差了43秒。传统的tIoU会给两个AI都打0分因为都没有重叠。但Wasserstein距离会告诉系统AI-A只需要把沙堆搬动1秒的位移就能到达正确位置而AI-B需要搬动43秒的位移——AI-A明显更接近正确答案应该得到更高的分数和更积极的鼓励。实际的打分公式由三部分组成。第一部分是时间重叠度RtIoU衡量已经猜中了多少第二部分是时间Wasserstein奖励RTW衡量没猜中的部分离正确答案有多远第三部分是一个惩罚项–1invalid如果AI给出的答案完全不是有效的时间段格式比如说了废话或者给出了非法数值直接扣分。三部分相加就是最终分数。研究团队还进行了一项值得关注的对比实验他们测试了表示时间段的四种不同沙堆形态——用区间内所有时刻均匀分布来表示均匀支撑、只用起止两个端点来表示端点原子、用钟形曲线从中心向两侧扩展来表示中心高斯、以及在边界处放置钟形曲线来表示边界高斯。实验结果表明均匀支撑的效果最为稳定——因为它完整保留了时间段的在哪里和有多长两个信息与最终评估指标的数学性质高度吻合而其他三种方式都只保留了部分信息容易在某些测试任务上表现好、另一些任务上表现差。---五、实战测试七个不同类型的侦查场景为了全面检验TimeLens2的实战能力研究团队在七个不同类型的基准测试上进行了评估每个测试代表一种不同的侦查场景。第一个场景是短视频室内动作定位对应的测试集叫Charades-STA的TimeLens重标注版本。这类视频通常只有几十秒到几分钟查询的是具体的室内动作比如一个人打开了门。第二个场景是事件级别定位对应ActivityNet Captions的TimeLens重标注版本。这类测试关注的是比单个动作更宏观的事件比如一场大浪打到了冲浪者身上并造成了冲击。第三个场景是精彩时刻与亮点检测对应QVHighlights的TimeLens重标注版本。这类测试不仅要找到时间段还要识别视频中最精彩的部分查询可能是两个女性一起骑水上摩托艇。第四个场景是长视频多段定位对应VUE-TR测试集。这里的视频更长而且同一个查询对应的时间段可能分散在视频的多个不连续位置比如找到所有搅拌红色浓酱的时刻。第五个场景是长视频用户风格定位对应VUE-TR-V2测试集。这类查询带有更主观的色彩比如给我看所有航拍镜头——这要求AI不仅理解查询的字面意思还要理解航拍镜头这个风格概念对应的视觉特征。第六个场景是问句式定位对应MomentSeeker测试集的纯文本查询子集。这类查询不是描述性的而是疑问句比如从上到下出现在比赛出发名单上的第一个名字是什么——AI不仅要理解问题还要定位到能回答这个问题的视频片段可能是一个出现文字的短暂画面。第七个场景是第一人称视角自中心定位对应Ego4D-NLQ的官方验证集。这类视频是从佩戴摄像头的人的视角拍摄的查询同样是疑问句比如我把洋葱放在哪里了——这要求AI理解第一人称叙事并在日常生活记录中搜索。这七个场景从短到长、从简单到复杂、从客观描述到主观风格、从第三人称到第一人称覆盖了视频时间定位任务可能遇到的大多数实际情境。---六、比赛结果小型AI侦探团队完胜千倍规模的对手实验结果相当显眼。以20亿参数的TimeLens2-2B为例它在七个测试的平均时间重叠度mIoU可以理解为平均精准度上达到了44.5分比同等规模的其他模型都要高——比参数量相同的Qwen3-VL-2B高出了14.2分甚至比参数量是它4倍的TimeLens-8B还高2.4分。40亿参数的TimeLens2-4B表现更加惊人它在六个测试上击败了所有对手包括那些参数规模是它一百倍的闭源大模型。具体来说它比拥有3970亿参数的Qwen3.5-397B-A17B平均高出7.5分。这意味着一个小了将近100倍的系统在这个任务上的表现超过了那个大系统。针对不同类型的挑战性能提升的幅度也不尽相同。与Qwen3-VL-4B基础模型相比TimeLens2-4B在VUE-TR长视频多段定位上提升了19.6分在VUE-TR-V2用户风格定位上提升了27.8分在MomentSeeker问句式定位上提升了12.6分在Ego4D-NLQ第一人称定位上提升了7.2分。这些大幅提升集中出现在最具挑战性的场景上表明TimeLens2学到的是真正的时间搜索能力而非单纯的数据拟合。特别值得关注的一个发现是TimeLens2-93K的训练数据都是陈述句式的查询里面完全没有问句。但在MomentSeeker一个全部用问句提问的测试集上用TimeLens2-93K训练出来的模型成绩从基础模型的15.3分跳升到了25.8分。这说明AI学到的不是如何应对陈述句式的查询而是如何在视频里寻找证据这个更深层的能力这种能力自然地迁移到了问句式查询上。研究团队还提供了几个直观的对比案例。在一段93.7分钟的长视频里当查询是一个穿背心的男人坐在窗边的花盆旁手里拿着一支笔时TimeLens2-4B精准找到了在视频第4750秒附近的那一小段而对比模型要么给出了无效的时间戳要么找到了视频前半段某个相似但错误的位置要么在正确位置附近但偏差明显。在另一个多段定位案例里查询是手铐正确答案是视频里五个分散的时间窗口TimeLens2完整找到了全部五个而其他模型要么漏掉了一些要么加入了错误的时间段。---七、解剖实验每个设计选择都有多重要除了总体性能比较研究团队还进行了大量的拆零件实验验证每个设计选择对最终效果的贡献。这些实验的结论可以帮助我们理解哪些因素最为关键。关于训练数据规模研究团队发现数据量和性能之间存在一个边际递减的规律。仅用5%的TimeLens2-93K约4,700条样本进行训练性能就从基础模型的34.7分跳升到了42.8分用到20%时达到45.3分用全量数据达到45.8分。前5%的数据带来了最大的提升后面的数据虽然提升幅度越来越小但在最难的长视频和第一人称场景上仍有持续改善。关于标注质量的每一个流水线步骤研究团队发现了一个清晰的层层递进效果。如果直接用Qwen3-VL-30B-A3B的原始标注未经任何验证训练得到42.0分加入双侦探时间共识验证后用的数据量从73.5万条降到了17.4万条但得分反而升到了43.4分再加入语义验证后数据量进一步降到9.3万条得分升到44.1分最后加上边界精修得分升到45.8分。这说明数据质量的作用远大于数据数量精准但少量的标注胜过粗糙但海量的标注。关于训练时的最大序列长度研究团队发现把AI一次能看到的视频信息量从16K个词元增加到100K个词元平均得分从44.4分提升到46.4分。不同类型的任务从这种长上下文训练中受益的程度不同Charades这类短视频任务在32K时就基本饱和了但VUE-TR-V2、MomentSeeker和Ego4D-NLQ这类长视频或复杂任务则一直到100K都还在持续改善。这说明长上下文训练的核心价值在于扩展AI的搜索地平线让它能在更长的时间线上保持有效的搜索能力。关于指令和回答格式的多样化2×2对比实验单一查询格式 vs 多样化查询格式单一回答格式 vs 多样化回答格式表明两种多样化的效果相互叠加共同多样化比单独使用任何一种都更好平均提升了0.9分其中在VUE-TR上的提升高达3.0分。关于Wasserstein奖励的贡献研究团队发现它把平均得分从47.0分提升到47.7分关键在于它拯救了那些传统打分给出零分的预测组。在强化学习的每次迭代中系统会为同一个问题生成一批答案然后通过比较它们的得分来指导AI改进。如果所有答案都和正确答案没有重叠传统tIoU给所有答案都打0分平均之后得到的训练信号是一片空白。研究团队统计发现在300个训练步骤里传统tIoU有13.8%的问题组是这种全部答案都是零分的情况——这些问题组对AI的训练毫无帮助。而加入Wasserstein奖励后这个比例从13.8%降到了3.6%其中75.8%原本全是零分的问题组现在都有了有意义的得分差异能够有效指导AI改进。---说到底TimeLens2解决的问题看起来像是个技术细节但实际上触及了一个很根本的问题AI什么时候才算真正理解了一段视频仅仅能描述内容显然不够能精准定位证据才算真懂。这项研究最让人印象深刻的地方不是某一个单点技术突破而是它把整个问题链条从数据质量、训练方式到评估指标都重新审视了一遍并且在每个环节都找到了更合理的解决方案——数据层面用多侦探协商代替单人判断训练层面用多样格式代替单一模板优化层面用搬运距离代替零一判定。这种系统性的思维方式或许比任何单项技术创新都更有参考价值。对于普通用户来说这项研究意味着未来的视频助手将更有能力回答这件事发生在视频的什么时候无论是在监控录像里查找事故时刻、在教学视频里快速定位关键步骤、还是在长篇纪录片里搜索某个特定场景。至于这种能力什么时候能普及到日常工具里就要看工业界把这类研究成果落地的速度了。有兴趣深入探究技术细节的读者可以通过arXiv编号2607.17423v1查阅完整论文。---QAQ1TimeLens2是什么和普通的视频AI有什么区别ATimeLens2是南京大学等机构联合开发的视频时间定位模型。普通视频AI只能告诉你视频里发生了什么而TimeLens2能精准告诉你某件事发生在视频的哪个时间段并且支持同一件事在视频里多次出现的情况能把所有出现的时间段都找出来。Q2TimeLens2-93K数据集是怎么保证标注质量的ATimeLens2-93K用了一套六步验证流水线先从视频描述中自动生成查询和候选时间区间再让两个不同的AI模型独立标注只有当两个AI的答案高度吻合重叠度超过90%且视频内容与查询语义匹配时这条标注才被保留最后还对保留下来的时间段边界做精细微调。Q3时间Wasserstein奖励解决了传统时间重叠度打分的什么问题A传统的时间重叠度tIoU只要AI预测的时间段和正确答案没有任何重叠不管差多远都给零分无法区分差一点点和差很远的预测。时间Wasserstein奖励通过计算把预测位置搬运到正确位置需要多远的距离来打分差一点的预测能得到比差很远的预测更高的分数从而给AI提供有方向性的改进信号。