展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 四川大学等联合研究:不需要标准答案,AI视觉推理也能越来越强

四川大学等联合研究:不需要标准答案,AI视觉推理也能越来越强

四川大学等联合提出V-Zero框架,通过在线蒸馏与对比证据门控,利用正负视觉证据对比提升AI细粒度视觉推理,无需标准答案与大量强化学习资源。训练仅需4.8小时,在多个基准测试上显著提升,且不损害通用理解能力。

这项由四川大学牵头,联合西安交通大学、中国电信TeleAI和北京大学共同完成的研究,以预印本形式发布于2026年6月,论文编号为arXiv:2606.25319。感兴趣的读者可以通过这个编号在arXiv平台检索到完整论文。

说到底,教会AI“看图说话”并不难,但要让AI真正懂得“看哪里”,却是个相当棘手的问题。当你拿着一张复杂的街景照片问AI:“图中右下角那个路牌写的是什么?”你会希望AI不只是模糊地扫一眼整张图,而是精准地把注意力集中到那块小小的路牌上。这种能力,研究者们称之为“细粒度视觉推理”——也就是让AI在视觉信息中精准定位关键细节,而不是对整张图做笼统理解。

然而,让AI掌握这种能力,代价通常极为高昂。现有的主流方法大致分为两类。一类是“有监督微调”,也就是给AI看海量带有标准答案的图文样本,让它对着答案死记硬背。这种方式效果不错,但准备这些标注数据需要大量人工,而且AI在学完新知识之后,往往会“忘掉”它原本就会的东西,出现所谓的“灾难性遗忘”。另一类是“强化学习”,让AI自己去试错,用奖惩机制引导它找到正确行为。这种方式更灵活,但需要事先设计好判断对错的规则,而且训练过程耗费的计算资源极为惊人,动辄需要数天的GPU算力。

正是看到了这两条路的局限,这支研究团队提出了一个核心问题:有没有可能在既不需要大量标准答案标注、又不需要耗费巨大计算资源做强化学习的前提下,让AI的视觉推理能力切实提升?他们给出的答案就是本文的主角——V-Zero框架。

一、老师与学生:一种叫“在线蒸馏”的训练方式

要理解V-Zero的核心思路,先得了解它所依托的基础训练方式——“在策略蒸馏”(On-Policy Distillation,简称OPD)。

可以用一个老师教学生写作文的场景来理解这件事。假设有一位水平很高的老师(教师模型),和一位正在学习的学生(学生模型)。传统的有监督微调,就好像老师给学生一篇篇范文,让学生照着抄,直到能模仿得像为止。强化学习则像是给学生布置题目,学生自己摸索着写,写得好就给红花,写得差就扣分。

而在策略蒸馏走的是另一条路:学生自己先写一篇作文,然后把这篇作文的每一个句子都拿给老师看,让老师逐字逐句地告诉学生:“在这句话之后,你应该怎么接”。老师给出的意见是基于学生实际写出来的内容,而不是预设的标准答案。这样一来,老师的指导始终贴近学生真实的思路,既精准又高效。

这种方式的好处是显而易见的:老师的反馈非常密集,几乎覆盖了学生写作的每一步;同时,因为老师是在纠正学生实际犯的错误,而不是让学生死记硬背范文,所以学生原有的能力不容易被破坏。

研究团队对这种方式做了一次深刻的理论梳理,他们发现OPD本质上可以理解为一种“无负例的停梯度对齐”——听起来很晦涩,但背后的意思其实很直观:老师和学生各自持有对同一个问题的判断,训练的目标就是让学生的判断向老师的判断靠拢,整个过程中老师的判断是固定的参照,只有学生在主动调整。“停梯度”意味着老师只做参照,不受学生影响;“无负例”则意味着这个对齐过程没有明确的“反面案例”来告诉学生哪条路是错的。

正是这个“无负例”的特点,暗藏了一个重要的缺陷。

二、一个被忽视的漏洞:写完整篇才知道跑偏了

回到那个写作文的类比。如果学生在写第二段时就跑偏了——比如把一道关于“交通安全”的题目写成了“旅游攻略”——那么老师纵然逐句纠正,改的也是这篇跑偏作文里的每一个句子,而不是在整体层面告诉学生“这整篇文章方向就错了”。老师能做的,是让这篇错误的作文写得更流畅,但无法阻止学生继续在错误方向上越走越远。

这就是标准OPD的核心局限:它在单个词语、单个句子的层面提供了极其密集的纠正,但缺乏一种机制来评估整篇“文章”(也就是整条推理链路)是否走在正确的轨道上。研究团队把这个问题称为“缺少轨迹级别的判别能力”。

对于视觉推理来说,这个问题尤其棘手。如果AI在开始推理时就没有把注意力放到图片的关键区域,后续哪怕每一步推理都很流畅,最终也可能给出错误的答案,而老师模型并没有一种简便的方式来告诉学生“你这整条思路都是因为看错了地方”。

V-Zero的设计就是为了填上这个漏洞。

三、正面图和反面图:用对比来判断推理的质量

V-Zero的核心创新,可以用一个非常直觉性的比喻来理解:考官出题时不只给一张图,而是同时给出一张“有用的局部图”和一张“无关的局部图”,然后看AI的推理是否真的依赖了有用的那部分视觉信息。

具体来说,在V-Zero的训练流程中,每道题都准备了三类视觉输入。第一类是完整的原图,这是学生模型平时看到的输入;第二类是“正向证据视图”,也就是从原图中裁剪出与问题直接相关的区域,比如如果问题是“路牌上写的什么”,正向证据视图就是路牌那一小块区域的放大图;第三类是“负向证据视图”,做法是先将原图缩小为原来的一半,然后从不包含路牌的区域随机截取一块同等大小的图片。

学生模型只看完整原图,自己生成推理文字。完成推理之后,老师模型会“回放”这段推理,但分别在三种不同的视觉条件下计算每个推理步骤的可信度。如果老师模型在看到“正向证据”(路牌区域)时,对这段推理中每个词的预测概率比看到“负向证据”(无关区域)时高得多,就说明这段推理确实依赖了正确的视觉证据,推理是“有根据的”。如果两者差别不大,则说明这段推理可能没有真正利用到关键的视觉信息,质量存疑。

这个差值就是所谓的“对比证据门控”信号。对于同一道题,学生模型会生成一组(比如8条)并行的推理链路,研究团队称之为“兄弟推理”。每条推理链路都会得到一个基于正负视图对比的可信度分数,然后在这组分数内部做归一化处理,判断哪条链路比其他兄弟链路更有视觉依据。

分数高的链路会在蒸馏训练中获得更大的权重,也就是说老师模型会更努力地去纠正和引导这条推理;分数低的链路则会被相应地降低权重,避免学生模型在错误的基础上越走越远。而蒸馏的目标始终是“正向证据”老师——也就是看到了关键区域的老师给出的指引,而不是看到无关区域的老师。负向视图只用于打分,不参与最终的学习目标。

整个过程完全不需要人工标注的文字答案。唯一需要准备的额外信息,就是训练数据中每道题对应的“关键区域是哪里”,这可以通过视觉标注工具以相对低廉的成本获得,而不需要逐道题准备正确答案文字。

四、训练流程:一套精妙的流水线

整个V-Zero的训练算法是这样运转的。每一轮训练,先从训练数据集中取出一小批题目,对于每道题,学生模型基于完整原图生成一组推理答案。与此同时,数据集中已经准备好了该题对应的关键区域裁剪(正向证据),并按照前述方法生成了随机的负向证据裁剪。

接下来,对于每道题的每条推理链路,分别计算老师模型在正向证据和负向证据条件下对推理内容中每个词的预测概率,相减得到每个词的证据差值,再对整条链路的所有词求平均,得到这条链路的“证据分数”。对同一道题的所有推理链路的证据分数进行组内归一化,得到每条链路的证据优势值,再通过一个截断操作将其转化为介于0到2之间的非负权重。

最后,以这些权重对所有链路的正向蒸馏损失做加权平均,通过梯度下降更新学生模型的参数。如此反复,训练60步后得到最终的模型。

值得一提的是,V-Zero在推理阶段完全不需要任何额外操作。学生模型依然只接收完整原图和问题,按普通方式生成答案,不需要调用任何外部工具或执行任何裁剪操作。所有“看局部区域”的能力,都在训练过程中内化到了模型参数里。

五、实验结果:数字背后的故事

研究团队在多个细粒度视觉推理基准测试上对V-Zero进行了系统评估,基础模型选用了阿里巴巴的Qwen3.5-4B,教师模型选用Qwen3.5-27B。

在视觉推理能力的测试上,V-Zero相比Qwen3.5-4B基础模型在VStar测试集上提升了4.7个百分点,在HR-4K(超高分辨率4K图像理解)上提升了3.4个点,在HR-8K上提升了2.5个点,在ZoomBench(需要精准定位小目标的测试)上提升了5.6个点。这四项测试的平均分从75.3分提升到了79.2分,进步幅度超过了3个点。

更有说服力的是与其他专门针对视觉推理进行优化的方法的比较。DeepEyes、Pixel Reasoner、Thyme等系统都是通过强化学习来提升视觉推理能力,它们使用了7B参数量的模型,但在HR-4K和HR-8K等测试上的成绩均低于使用4B参数模型的V-Zero。ZwZ(Zooming without Zooming)是与V-Zero最具可比性的方法,同样基于Qwen3系列模型,采用有监督微调方式,在其4B版本中HR-4K为82.1、HR-8K为79.6;而V-Zero在HR-4K达到87.8、HR-8K达到82.6,且在ZoomBench上以57.8对52.5大幅领先。在衡量泛化能力的MMStar测试上,V-Zero以74.4分超过了ZwZ的71.1分,说明V-Zero在提升视觉推理能力的同时没有损失通用理解能力。

训练效率方面,V-Zero仅使用8块RTX PRO 6000显卡训练约4.8小时,而ZwZ在8块H100显卡上需要约1天,DeepEyes则需要约2天。考虑到RTX PRO 6000的BF16计算吞吐量弱于H100,实际的计算量差距只会更大。研究团队因此保守估计V-Zero比有监督微调方法快5倍以上,比强化学习方法快10倍以上。

六、拆解验证:每个设计都有必要吗

研究团队还做了一系列对照实验,验证V-Zero各个设计决策的必要性。

在证据门控机制的消融实验中,对照方案包括“完全去掉门控”和“用随机证据替代有意义的正负视图对”。去掉门控后,四项视觉推理测试的平均分从79.2下降到78.0;用随机证据替代后,平均分更大幅下滑到72.5,甚至低于完全去掉门控的情况。这说明不仅证据门控机制本身有价值,而且对比的视觉证据必须是有意义的——随机的对比不仅没有帮助,反而会给学习引入噪声。

在教师模型规模的实验中,团队对比了9B和27B两种规模的教师。使用27B教师的整体表现更好,尤其在HR-4K(87.8对87.3)和ZoomBench(57.7对54.8)上优势明显,说明更大的教师模型能提供质量更高的视觉推理引导。

在并行推理链路数量的实验中,将每道题生成的兄弟推理链路从4条增加到8条,四项测试的平均分从78.1提升到79.2,在ZoomBench上的提升尤为显著(54.1对57.7)。这说明组内推理链路越多,对比证据门控的判别依据越充分,尤其是在需要精准定位小目标的任务上效果更明显。

在训练步数的实验中,模型在经过一定训练后整体持续提升,在第60步时达到最佳的79.2平均分,但继续训练到第70步后性能略有下滑至77.8。不同子任务的性能峰值出现在不同训练步数,这表明更长的训练可能在某些能力之间存在权衡取舍。

七、AI的眼睛真的看对了地方吗

除了数字上的验证,研究团队还做了直观的注意力可视化分析,展示了V-Zero与其他方法在处理细粒度推理题时,模型“眼睛”究竟聚焦在图片的哪个位置。

在一道关于“图中右下角的装裱海报上写的是什么”的题目中,DeepEyes和ZwZ都没有在正确区域产生明显的注意力激活,而V-Zero和Qwen3.5-4B基础模型都能覆盖到正确区域,但V-Zero的激活强度更高,说明它更确信地聚焦在了正确位置。在一道关于“图中路牌显示的限速是多少”的题目中,V-Zero在路牌区域产生了所有对比方法中最强的注意力激活。在一道需要同时定位白色卡车和有轨电车并判断两者位置关系的题目中,V-Zero是唯一一个同时在两个目标上都产生了清晰注意力高亮的方法,其他方法要么只关注了一个目标,要么两个都没有准确定位。

这些可视化结果说明,V-Zero的训练效果不只是反映在分数上的统计涨幅,而是切实改变了模型处理视觉信息的方式,让它真正学会了把注意力放到与问题相关的图片区域。

说到底,V-Zero做的事情,是在不需要昂贵人工标注、不需要复杂强化学习机制的条件下,用“正确区域的图”和“随机区域的图”这一对简单的训练信号,教会了AI模型在视觉推理时真正“看对地方”。这项研究的意义不只在于某几个测试集上的数字提升,更在于它表明视觉信息本身就可以作为训练信号——不一定非得告诉AI“答案是什么”,只需要告诉AI“关键的视觉依据在哪里”,AI就能自己学会如何推理。

这对于实际应用的潜在影响是相当直接的。构建细粒度视觉理解系统的成本,很大程度上来自于为每道题准备文字答案的标注工作。如果标注者只需要画出关键区域的边框,而不需要逐道题写出参考答案,准备训练数据的成本将大幅降低。与此同时,V-Zero在保持训练效率极高(不到5小时)的同时,模型的通用理解能力并未下降,这意味着在实际部署中不需要担心“为了改善一个能力而损害另一个能力”的困境。

当然,这项工作也并非没有局限。V-Zero的训练数据来自ZwZ项目整理的2.3万条高质量样本,训练中依然需要关键区域的标注信息,只是不再需要文字答案。如何在完全无需任何人工标注的条件下实现同等效果,依然是一个值得探索的开放问题。此外,V-Zero当前的教师模型规模(27B)远大于学生模型(4B),在资源受限的环境下能否使用更小的教师模型保持同等效果,也是未来值得研究的方向。

有兴趣深入了解技术细节的读者,可以通过arXiv编号2606.25319查阅完整论文,代码和数据集也将在论文所附的GitHub仓库中公开发布。

Q&A

Q1:V-Zero训练时需要准备什么数据?

A:V-Zero训练不需要为每道题准备文字答案,只需要准备原图、对应问题,以及标注出图中与问题相关的关键区域边框。训练过程中,系统会自动从关键区域裁剪正向证据图,并从图片其他位置随机采样负向证据图。这两类图片只在训练阶段使用,模型推理时只看完整原图。

Q2:V-Zero和强化学习方法相比优势在哪里?

A:V-Zero的训练时间约为4.8小时,而强化学习方法如DeepEyes需要约2天,保守估计速度相差10倍以上。此外,强化学习需要预先设计判断对错的规则,对于开放性视觉问题很难精确定义;V-Zero则用正负视觉证据对比来评估推理质量,不依赖预设的答案验证规则。

Q3:V-Zero提升视觉推理能力会不会影响模型的其他能力?

A:根据论文的实验结果,V-Zero在MMStar通用多模态理解测试上的得分为74.4,高于基础模型Qwen3.5-4B的71.8,说明视觉推理能力的提升同时伴随了通用理解能力的小幅改善,并未出现其他方法常见的“灾难性遗忘”现象,即提升某项能力时损害了其他已有能力。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关 AI
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。