展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 当AI"看"视频时,它真的理解你在说什么吗?

当AI"看"视频时,它真的理解你在说什么吗?

卡内基梅隆大学与多伦多大学联合团队提出TemporalBench基准,专门测试视频语言模型的时间理解能力。在10,000道时序问题上,现有最佳模型配对准确率仅38%-45%,低于随机猜测的50%,而人类可达79%,揭示了AI在细粒度动作顺序理解上的系统性短板。

这项由卡内基梅隆大学联合多伦多大学研究团队完成的工作,发表于2024年的计算机视觉与模式识别顶级会议CVPR,论文编号为arXiv:2403.18839。感兴趣的读者可以通过该编号在学术数据库中查阅完整论文。

一、当AI开始"看"视频,问题也随之而来

你有没有试过用手机的AI助手问它:"刚才那个视频里,那个人是先拿起杯子,还是先说话?"不出意外的话,大多数AI助手会让你失望。不是因为它没有"看"视频,而是因为它根本没有真正理解视频里事件发生的先后顺序。

这正是这项研究的出发点。随着人工智能技术的飞速发展,能够同时处理视频和语言的模型——研究者把它们称为"视频语言模型"(Video-Language Models,简称VLMs)——已经遍地开花。这些模型看起来很聪明,能描述视频画面,能回答关于视频内容的问题,但当你问它们关于"顺序"的问题时,比如谁先谁后、哪件事发生在哪个时间点,它们往往会露出马脚。

研究团队意识到,现有的评测工具根本没有专门针对这种"时间理解能力"进行系统测试。换句话说,我们一直在考这些AI的语文阅读理解,却从没专门出过一套考察它们理解"时间轴"的试卷。于是,他们决定亲手编写这套试卷,并把它命名为**TemporalBench**。

这件事的重要性,不亚于教育界突然发现:所有学校一直只考学生的文字理解,却从未考过他们的数学逻辑。一旦真的出了一套数学题,才发现原来大家的数学都差得离谱。视频AI界正在经历这样一次"期末大考"。

二、时间理解到底难在哪里——AI的"时间盲区"

在搞清楚这套考卷是怎么设计的之前,我们需要先理解:为什么理解视频中的时间顺序,对AI来说如此困难?

以一段厨师做菜的视频为例。对人类来说,判断"厨师是先打鸡蛋还是先放油"是一件极其自然的事,因为我们的大脑天生就是一台时间感知机器,会自动把视频帧按照先后顺序串联成故事。但对于现在大多数视频语言模型来说,它们处理视频的方式更像是把一本书里所有的页面同时摊开来看,而不是一页一页翻阅——它们能告诉你书里有什么内容,但很难告诉你第五页发生的事是在第三页之前还是之后。

这种时间感知能力的缺失,在实际应用中会造成非常具体的问题。医疗监控视频中,一个动作发生的先后顺序可能关系到患者的安全;体育分析视频中,哪个动作在前、哪个在后可能决定了比赛的胜负判断;教育培训视频中,操作步骤的顺序更是不容出错。

研究团队把需要测试的时间推理能力拆解成了几个层面。最基础的一层是理解"细粒度动作"——也就是短时间内发生的细小动作,比如"先弯曲手指,再握紧拳头",这两个动作前后相差可能只有零点几秒,但顺序完全不同,含义也截然不同。再往上一层是理解"时间顺序",也就是多个事件按先后排列的关系。还有一层叫"时间方向",涉及视频是正向播放还是倒放时,AI是否还能正确理解内容。最后还有更高级的"反事实推理"——假如某个步骤没有发生,后续会有什么变化?

每一层都比上一层难,而现有的AI模型在这几层上的表现,正是这项研究着重要揭露的。

三、TemporalBench是怎么"出考题"的——一份精心设计的时间理解试卷

为了公平、全面地测试这些AI模型,研究团队花了大量精力设计这套考卷。TemporalBench最终包含了超过10,000道问题,覆盖了2,000多个精心挑选的视频片段,这些视频来自多个公开的视频数据集,内容涵盖日常生活、体育运动、烹饪、手工等各类场景。

考题的核心设计思路是"多项选择",也就是给AI看一段视频,然后提出一个关于时间的问题,同时给出若干个选项,让AI选出正确答案。这种形式的好处是,答案是客观的,不容含糊。

但仅仅是多项选择题还不够。研究团队额外设计了一种叫做"二元对比"的测试方式,这是整套考卷最具创意的地方。具体来说,对于同一个视频,团队会同时提出两个描述——一个是正确的,一个是把时间顺序故意颠倒或者替换掉的错误版本。然后分别问AI:这段描述对不对?

之所以要这样设计,是因为研究团队发现,很多AI模型其实是靠"猜"来通过测试的。它们可能并不真正理解视频,只是根据常识猜测"做菜一般先放油再打蛋",所以在单独问一道关于"是否先放油"的题目时,它们能答对。但如果同时问它正反两个描述,要求两道题都答对,它就暴露了:它真的不知道这个视频里的具体顺序,它只是在猜。

这个机制相当于给考试加了一道防伪验证。一个真正理解视频时间关系的AI,不仅要在"正确描述"上答"对",还要在"错误描述"上答"错",两道题都对才算真正通过了这道关卡。研究团队把这个双重验证的通过率称为"配对准确率",作为最严格的评估标准。

视频内容的标注也是一项极为耗时的工作。团队没有依赖自动生成的标签,而是让人工标注者仔细观看每一段视频,手写出视频中动作的详细时间描述,然后经过多轮审核修改,才最终确认每道题的标准答案。这个过程耗费了大量人力,但也保证了考题的质量。

四、这些AI模型考得怎么样——成绩单里藏着的真相

成绩单出来后,结果让研究团队既有所预料,又感到吃惊。

先说最直观的数字。在最严格的"配对准确率"指标下,目前业内表现最好的开源视频语言模型,成绩大约在38%到45%之间徘徊,而如果是纯粹随机猜测,理论上也能拿到50%。这意味着什么?这意味着这些看起来很厉害的模型,在时间理解这件事上,有时候还不如随机猜测靠谱。

更令人印象深刻的是与人类表现的对比。研究团队同样邀请了真实的人类参与者来完成这套测试,人类的"配对准确率"高达约79%,几乎是现有最好模型的两倍。这个差距用生活场景来理解的话,相当于一个正常人和一个对时间完全没有感知的机器人一起参加了一场"按时间顺序还原视频"的游戏——人类轻松过关,AI却频频出错。

研究团队对不同类型的问题分别进行了统计。在涉及"细粒度动作顺序"的问题上,AI的表现最差,因为这类问题要求模型真正捕捉到视频中极短时间段内的动作细节,光靠猜常识完全行不通。在涉及"大段事件顺序"的问题上,AI表现稍微好一些,但仍然远低于人类水平。

商业闭源模型,也就是那些大公司不对外公开代码的AI系统,表现略好于开源模型,但差距也没有想象中大。以GPT-4V等代表性闭源模型为例,它们的配对准确率在50%到60%之间,虽然比随机猜测强,但距离人类的79%仍有相当大的距离。

五、为什么模型会犯这些错误——揭开时间盲区的深层原因

看到这些成绩,很自然会想问:为什么这些模型这么差劲?难道它们没有被好好训练过吗?

答案比"训练不足"要复杂得多。研究团队通过进一步分析,发现了几个根本性的原因。

第一个原因是"帧采样"的局限。目前大多数视频语言模型在处理视频时,并不是真的逐帧分析整个视频,而是从视频中均匀地抽取若干个关键帧,可以理解为每隔一段时间截一张图,然后把这些截图拼在一起送给模型看。这就好比你想了解一段旅行的故事,但只给你看出发时、中途休息和到达终点时的三张照片,中间所有的过程都没有。如果视频里某个关键动作恰好发生在两次采样之间,模型就完全看不到它。

第二个原因是模型的"时间顺序感知结构"先天不足。现有的大多数视频语言模型在设计时,更多强调的是"这段视频里有什么",而不是"这段视频里的事情是怎么一步一步发生的"。它们的架构,可以理解为大脑的基本结构,并不擅长捕捉帧与帧之间的时间关系,更像是在看一堆照片,而不是在看一部电影。

第三个原因是训练数据的偏差。这些模型在被训练时,大量使用了描述性文本和视频的配对数据,但这些数据大多是"某人在做某事"这类静态描述,而不是"某人先做了A,然后做了B,接着做了C"这类严格时序描述。没有在这类数据上训练过,模型自然就没有建立起良好的时间顺序感知能力。

正因如此,TemporalBench的出现不只是在揭露问题,更是在为未来的改进指明方向:如果想让视频AI真正"看懂"时间,就必须在数据、架构和训练方式上做出根本性的改变。

六、这套考卷本身有什么特别之处——TemporalBench的设计哲学

研究团队在设计TemporalBench时,还特别注意了一个关键问题:如何防止模型靠"背答案"或"猜常识"来过关?

这种担忧并非多余。在AI领域,存在一种普遍现象,叫做"数据集污染"——也就是说,模型在被训练时,可能已经见过了测试题的答案,于是它在考试时并不是真的在思考,而是在"回忆"。为了对抗这个问题,研究团队在选择视频时,优先选择了那些不太可能出现在主流AI训练数据中的视频内容,并且专门设计了需要结合视频画面才能回答的问题,而不是仅凭文本常识就能猜到答案的问题。

此外,前面提到的"二元对比"设计也是防止猜答案的重要手段。当一道题的正确答案和错误答案都被包含在内,并且要求模型必须同时答对两者,靠猜测通过的概率就大大降低了。

研究团队还特别强调了考题的"细粒度"特性。很多现有的视频理解基准测试(也就是行业标准考卷)关注的是比较宏观的问题,比如"这段视频讲的是什么运动"或者"视频中的人物在哪里"。TemporalBench则专注于更细小、更精确的时间细节,比如"手指是先弯曲的还是先展开的",这类问题往往在几十毫秒内就发生了,必须真正理解视频才能回答。

七、与其他测试工具相比,TemporalBench有什么不同

在TemporalBench出现之前,学术界已经有一些视频理解相关的基准测试,比如MVBench、EgoSchema、NExT-QA等。研究团队专门对比了TemporalBench与这些现有工具的差异,结果颇为说明问题。

现有的大多数基准测试主要考察的是视频内容的理解,也就是"看出了什么",而不是"按什么顺序发生的"。即便有些测试也涉及时间相关的问题,往往也只是泛泛地问"发生了什么事",而不是精确到帧级别的动作先后顺序。

在现有基准测试上,很多模型已经达到了接近甚至超越人类的水平,这让研究者开始担忧:这些模型真的变得那么聪明了吗?还是说,这些考卷已经太容易了,模型只是找到了偷懒的捷径?TemporalBench给出的答案让后一种担忧变成了现实——同样的这些模型,一旦面对真正考察时间理解的题目,分数就跌落到了与随机猜测相当的水平。

这种对比就像是一个学生,平时做单选题总能拿高分,但一旦换成需要推理过程的大题,立刻原形毕露。TemporalBench正是那张真正区分"会背书"和"真理解"的大题答卷。

八、这项研究对未来意味着什么——从考卷到改变

研究团队在论文中明确指出,TemporalBench不仅是一份诊断工具,更是一份改进路线图。

通过对模型失败案例的细致分析,团队发现了几个最急需改进的方向。帧采样策略的优化是其中最直接的一项——未来的模型需要更智能的方式来决定从视频中采集哪些帧,而不是简单地均匀抽取。在处理快速变化的动作时,模型应该能够自动加密采样,不错过关键的时间节点。

另一个重要方向是模型架构的改进。现有模型在融合视频帧信息时,往往缺乏对时间顺序的显式建模,未来的模型需要像人类大脑一样,在处理每一帧时都清楚地知道"这一帧在时间轴上的位置",并据此建立前后关系。

训练数据的丰富化也是关键一步。研究团队认为,未来需要专门构建包含精确时序描述的大规模视频语言训练数据集,让模型从数据层面就开始建立对时间顺序的敏感性。

这些改进方向,不只是学术层面的探索,更有着非常实际的落地意义。以自动驾驶为例,车载AI需要准确理解路面上发生事件的先后顺序,才能做出正确的判断和反应;在医疗影像分析中,手术操作的时序理解直接关系到AI辅助系统的准确性;在智能家居和安防监控场景中,准确判断"谁先开门,谁后进来"这类时序问题同样至关重要。

归根结底,这项研究揭示的不只是某几个模型的缺陷,而是整个视频AI领域在"时间理解"这个维度上的系统性短板。TemporalBench就像一面镜子,清晰地照出了现有AI视频理解技术与人类认知能力之间那条还未跨越的鸿沟。

好消息是,现在我们至少知道了这条鸿沟在哪里、有多宽。这比浑然不觉地以为AI已经"看懂"了视频,要进步得多。下一步要做的,是真正跨越它。

有兴趣深入了解这套评测体系、查阅详细实验数据或探索研究团队提出的改进方向的读者,可以通过论文编号arXiv:2403.18839在arXiv等学术平台上获取完整论文。

Q&A

Q1:TemporalBench测试的是哪种AI能力,跟普通视频理解测试有什么区别?

A:TemporalBench专门测试视频语言模型对时间顺序的理解能力,也就是模型能不能准确判断视频里的事件谁先发生、谁后发生。普通视频理解测试主要考察"视频里有什么",而TemporalBench考察的是"按什么顺序发生的",并且采用了正反对比的双重验证机制,让模型无法靠猜常识蒙混过关。

Q2:现有视频语言模型在TemporalBench上的表现有多差?

A:相当不理想。在最严格的"配对准确率"指标下,现有最好的开源模型得分在38%到45%之间,而随机猜测的理论得分是50%,也就是说有些模型甚至还不如随机猜。即便是表现较好的商业闭源模型,得分也只在50%到60%左右,而人类参与者的得分高达约79%,差距非常显著。

Q3:视频语言模型为什么理解不了时间顺序?

A:主要有三个原因。首先,这些模型处理视频时通常只抽取若干关键帧而非逐帧分析,容易错过关键时间节点。其次,现有模型的架构设计更擅长识别"有什么"而非捕捉"按什么顺序发生"。最后,训练数据大多是静态描述而非严格的时序描述,导致模型从根本上缺乏时间顺序感知能力。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 AI
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。