展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 腾讯与中科大联手:当AI搜索遇上"阅卷老师",文档筛选的革命来了

腾讯与中科大联手:当AI搜索遇上"阅卷老师",文档筛选的革命来了

一项研究提出SETWISEEVALKIT评估工具,从三个层次九维度诊断文档集合质量,发现现有排序方法综合覆盖率不足45%。据此开发的RUBRIC4SETWISE方法,利用评分细则指导文档筛选,以平均2.66篇文档取得更优答案,并在长短答案场景均保持领先。

这项由中国科学技术大学与腾讯元宝团队、中国科学院大学及山东大学联合开展的研究,以预印本形式于2026年7月发布,论文编号为arXiv:2607.19747。有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。

一、搜索结果“全对”但答案却是错的?

想象一下,你请了五位助手去图书馆帮你查一道历史题。他们带回来的五本书,每一本都与这道题有关联。然而翻开一看:两本书讲的几乎是同一件事,第三本里有一个关键错误,第四本把重要信息藏在几百页无关内容的中间,第五本提供了一些边角料但缺少最核心的那块拼图。最终你手里有五本“相关书籍”,却依然无法给出一个完整、准确的答案。

这个令人沮丧的场景,正是当今人工智能搜索系统天天都在经历的困境。在传统的信息检索逻辑中,评估一次搜索好不好的标准非常简单:每一篇文档单独打分,看它与查询问题有没有关系,然后把分数加总排个名次,这就是所谓的nDCG评估体系。这套方法沿用了几十年,在人类用眼睛浏览搜索结果的时代运转得还不错——毕竟人类有能力自己过滤重复内容、识别矛盾说法、判断哪些信息是真正需要的。

然而现在,读取搜索结果的主体变了。大型语言模型(也就是那些能对话、能写文章、能回答问题的AI)会直接把搜索到的文档塞进自己的“大脑”里,以此为依据生成答案。这个过程叫做检索增强生成,简称RAG。在这种模式下,文档集合的质量直接决定了AI最终能给出多好的答案——就像厨师只能用现有的食材做菜,如果送来的食材里有坏的、重复的、甚至掺了杂质的,再高明的厨师也无法做出完美的菜肴。

这项研究的切入点正是这个被长期忽视的问题:现有的评估体系根本看不出文档集合里存在哪些深层缺陷,更无法指导我们去修复这些缺陷。于是,研究团队决定从头设计一套全新的诊断工具。

二、一份专为“文档集合”量身定制的成绩单

研究团队构建的核心工具叫做SETWISEEVALKIT,可以把它理解为一位非常挑剔的阅卷老师,不只是问“这份答卷有没有写到点子上”,而是从三个层次、九个维度对整套文档组合进行全面体检。

第一个层次是文档个体层面,考察每一篇文档自身的质量。这里包含三个维度:相关性,也就是文档有没有真正触及问题的核心,而不只是表面上出现了关键词;真实性,文档里陈述的事实有没有和正确答案相符,有没有包含错误信息;以及质量,文档的结构是否清晰,读者能不能方便地从中提取到需要的信息,而不是把关键内容淹没在大量无关废话里。

第二个层次是文档集合层面,考察多篇文档放在一起时如何相互作用。这里同样有三个维度:互补性,不同文档有没有各自提供不同的关键信息片段,拼合起来比任何单一文档都要完整;冗余性,有没有两篇或多篇文档说的几乎是同一回事,白白占用了有限的空间;以及冲突性,不同文档对同一个事实有没有给出互相矛盾的说法,从而可能误导AI得出错误结论。

第三个层次是整体效用层面,把这套文档组合当作一个整体来看,考察它能不能真正支撑AI完成推理任务。这里的三个维度分别是完整性,文档集合有没有覆盖生成正确答案所需的所有关键信息点;信息密度,文档里真正有用的内容占整篇文档的比例,有没有被大量无关填充物稀释;以及可达性,仅凭这套文档集合,不依赖任何外部知识,AI能不能从头到尾走完完整的推理链条,最终得出正确答案。

这套体系的精妙之处在于,它打破了“文档集合的质量等于每篇文档质量之和”这个长期被默认接受但实际上并不成立的假设。五篇各自相关的文档,组合在一起可能因为高度重叠而几乎没有额外价值;而五篇看起来分散的文档,如果每篇恰好提供了不同的关键信息片段,组合起来的价值可能远超单纯的分数叠加。

三、28000条评分标准从何而来

光有评估维度还不够,还需要具体的评分标准。研究团队采用了一种被称为“评分细则”的方法——为每一个查询问题专门定制一套评判标准,而不是用千篇一律的模板来评价所有问题。

生成这些评分细则的过程本身就颇具巧思。研究团队把每一对“问题+标准答案”同时交给两个顶级AI模型分别生成候选标准,要求每条标准必须具体到这道题的关键实体、具体事实和数字,绝对禁止写“包含相关内容”这样的模糊废话。然后,第三个AI模型对两批候选标准进行汇总和筛选,去掉重复的和质量差的,最终产出精华版本。

这个过程在两类场景下分别进行。第一类是短答案场景,基于四个多跳问答数据集——HotpotQA、2WikiMultihopQA、MuSiQue和Bamboogle——最终保留了2061个高质量样本,生成了约24000条评分标准。为什么偏偏选多跳问答?因为这类问题天然需要综合多篇文档才能回答,比如“哪家公司收购了在1994年引发个人电脑价格战的那家公司,最终于2002年完成合并”,一篇文档可能只知道谁发起了价格战,另一篇才知道后续的收购,两篇合起来才能回答完整。这种结构特别适合检验文档集合的组合质量。

第二类是长答案场景,基于ResearchQA这个横跨75个研究领域的学术问答数据集,随机抽取200个样本,生成了约4000条评分标准。长答案场景下使用的是一个叫做DR.Tulu-8B的开源深度研究智能体,它会自主进行多轮搜索,每次调用谷歌搜索API获取文档,最终综合所有轮次的发现生成一篇完整的研究报告。

整套标准经过人工质量审核。研究团队随机抽取样本,请博士级别的专家对每条评分标准从两个角度打分:这条标准有没有实际区分高低质量文档集合的能力,以及如果删掉这条标准,文档集合的排名会不会发生明显变化。结果显示,经过多模型汇总后,大约70%的标准被评定为高度或极度有区分力,远高于单个模型生成时的37%到43%的比例,而质量堪忧的标准占比只有约8%。三位专家之间的一致性得分也达到了非常高的水平,说明这套评分体系是可靠的。

四、现有搜索排序方法究竟差在哪里

有了这把精准的量尺,研究团队对12种主流文档重排序方法进行了全面测评。这12种方法大致分为三类:传统的逐文档打分排序方法(如BGE-Reranker、MonoT5、RankT5等),加入了推理能力的增强型排序方法(如Rank1、Rearank、ReasonRank),以及专门针对文档集合整体进行优化的新型方法(SetR和Rank4Gen)。

结果令人瞩目,但不是那种令人振奋的瞩目,而是令人清醒的瞩目。即便是表现最好的方法,在这套九维度评估体系下的综合覆盖率也不超过45%。换句话说,所有现有方法在保障文档集合质量方面,都还有超过一半的改进空间。

在短答案场景下,专门优化文档集合整体结构的SetR和Rank4Gen方法明显领先,这说明在固定候选池里选择最优子集的策略是有效的。加入了链式思维推理能力的ReasonRank在全局评估层面表现较强,因为推理能力帮助它更好地判断一套文档能不能支撑完整的推理链条。而传统的逐文档打分方法在任何层次上都没有明显优势,暴露出这类方法在设计上的根本局限。

在长答案场景下,情况发生了有趣的反转:推理增强型方法后来居上,ReasonRank和Rearank分别占据第一、第二位,而在短答案场景称雄的集合型方法反而跌到了中游。这个反转背后的逻辑是:多轮累积搜索场景需要的是判断每次新检索到的文档相对于已有信息的边际价值,这正是推理能力的用武之地。

贯穿两种场景的一个共同发现是:几乎所有方法在跨文档协调这个层面都表现得非常薄弱,尤其是互补性和完整性这两个维度。这意味着现有的排序方法几乎都没有真正考虑过“这批文档放在一起是不是一个有机的整体”这个问题,它们更像是在给每道菜单独评分,而不是在判断这一桌菜拼在一起算不算一顿营养均衡的餐食。

另外还有一个值得关注的细节:在长答案的多轮搜索场景里,每一轮检索到的文档质量评分都呈现出系统性下降的趋势,第一轮最高,越往后越低。但这并不意味着排序方法在后面几轮变差了,而是搜索本身的规律使然——前几轮把最容易找到的信息都采集完了,后面几轮面对的是越来越窄、越来越难的信息缺口,候选文档池天然稀薄。研究团队因此采用了把所有轮次选到的文档合并去重后统一评分的方式,才能公平衡量整个搜索过程累积下来的文档集合质量。

五、评分标准能直接变成筛选标准

前面的测评是诊断,接下来研究团队做了一件更大胆的事:既然评分细则能量化文档集合的质量,为什么不让它直接指导文档的选择?

这个想法催生了另一个核心贡献——RUBRIC4SETWISE方法。这个方法不需要任何额外的模型训练,直接把评估标准转换成筛选指令。具体来说,给定一个查询问题和对应的评分细则,系统会把所有候选文档和评分细则一起喂给一个推理模型(使用了Qwen3-8B作为推理主干),要求它先逐一核查哪些文档能满足哪些评分条目,然后选出能够覆盖所有评分条目所需信息的最小文档子集,而不是预先设定“取前五篇”这样的固定数量。

这种方式的直觉是清晰的:如果我们明确知道回答一个问题需要哪些具体的信息点,那么选文档的策略就不应该是“取得分最高的几篇”,而应该是“找到一个能覆盖所有必要信息点的最精简组合”。前者是量化排名,后者是目标导向的集合优化。

测试结果充分证明了这个思路的价值。在短答案场景下,RUBRIC4SETWISE以平均仅使用2.66篇文档的代价,在精确匹配率和F1分数两个指标上都超过了所有其他方法,而排在第二位的SetR平均需要2.75篇文档,传统方法则固定使用5篇。用更少的文档获得更好的答案,说明精准筛选比堆砌数量更有效。

在长答案场景下,RUBRIC4SETWISE同样以70.57分的LLM裁判得分拔得头筹,超过第二名SetR的70.54分,以及推理增强方法ReasonRank的68.36分。更值得注意的是,它使用的总文档数(20.52篇)少于SetR的29.23篇,搜索轮次(平均4.52轮)也少于SetR的4.73轮。也就是说,RUBRIC4SETWISE用更少的资源换取了更好的结果,这在实际应用中意味着显著的效率提升。

还有一点尤为重要:RUBRIC4SETWISE是唯一一个在短答案和长答案两种场景下都保持顶尖表现的方法,其他方法要么在短答案场景强而在长答案场景弱,要么反之。这种跨场景的稳定性,正是研究团队此前就已发现的现有方法普遍存在的“泛化天花板”问题的解法所在。

六、一道题的完整诊断报告

理解这套评估体系最直观的方式,是看一个具体的例子。

考虑这样一道问题:“在《办公室》这部美剧里,德怀特在哪一集救了帕姆的丈夫不被罗伊伤害?”正确答案是第三季第十九集《谈判》。

排序系统选出了五篇文档:第一篇和第二篇分别从不同角度记录了这一事件,都明确提到了集名和德怀特用辣椒喷雾阻止罗伊的情节;第三篇来自同一集的另一段落,讲的是事件之后帕姆和罗伊的关系,没有重述关键事件;第四篇是德怀特这个人物的传记介绍,完全没有涉及这场冲突;第五篇讲的是第五季完全不同的一集。

逐文档评分(以相关性为例)显示:文档一和二得4分,文档三得1分,文档四和五得0分。这和传统评估体系能给出的信息基本一致。然而一旦上升到集合层面,新的洞察就出现了:互补性只有1分,因为文档一和文档二几乎涵盖了所有必要信息,没有真正的分工;冗余性反而得了4分(这个维度分数越高代表冗余越少,因为两篇各自提供了略有不同的背景细节);冲突性得4分,说明两篇核心文档没有矛盾。但在全局层面,信息密度只有1分,因为有用的那一两句话在每篇文档中占的篇幅实在太小;可达性只有2分,因为没有任何文档明确交代帕姆的丈夫就是吉姆,这个看似显而易见的链接在文档中是缺失的,纯粹依赖这套文档而没有外部知识的AI,无法完整地推理出答案。

这就是传统评估与多维度评估之间的核心差距:前者告诉你有没有把“对”的文档选进来,后者告诉你这些文档放在一起能不能真正帮AI把问题解决掉。

七、研究的真实边界与未来方向

任何研究都有它诚实承认的局限,这项研究也不例外。

RUBRIC4SETWISE方法依赖预先准备好的评分细则,而这些细则的生成需要知道正确答案。这在研究环境中是可行的,因为研究团队手里有标准答案,但在真实应用场景中,系统往往不知道答案是什么。研究团队把这种设定诚实地称为“神谕设置”,也就是说目前的结果代表的是这个方法在理想信息条件下的能力上限,而不是日常部署时可以直接复现的性能。

这个局限同时指向了一个清晰的研究方向:如何在没有标准答案的情况下,让系统自己推断出它需要满足哪些信息条件?一种可能的思路是把评分细则的偏好“蒸馏”成可训练的奖励信号,让排序模型在训练过程中内化这套多维度的质量意识,而不需要在推理时依赖现成的细则。这是研究团队在结论部分明确指出的下一步工作方向。

另一个需要关注的现象是长答案场景下方法间差距的显著收窄——所有方法的综合得分差距只有大约3个百分点,而在短答案场景下这个差距接近9个百分点。研究团队的解读是:目前排序模型和搜索智能体基本上是各自为政,排序模型不知道智能体已经积累了哪些信息,智能体也不会把自己的状态反馈给排序模块,两者之间没有信息流动,这才是当前长答案搜索质量的真正天花板所在。解决这个问题需要的是排序模型与搜索过程的协同优化,而这超出了当前这项研究的范围。

归根结底,这项研究做了一件在信息检索领域长期被忽视但又至关重要的事:把评估的视角从“每篇文档够不够好”转向“这批文档放在一起够不够用”。随着AI系统越来越多地依赖外部知识库来生成答案,这种系统性的视角转换不只是学术上的整洁,更是工程实践上的必要进化。

当AI助手开始在医疗咨询、法律分析、科研支持等高风险领域发挥作用时,它所依据的文档集合究竟有多可靠,直接关系到答案的质量乃至安全性。一套能够诊断文档集合深层缺陷的评估体系,和一套能够主动规避这些缺陷的选择策略,其价值远不止于提升几个百分点的基准测试分数。

Q&A

Q1:SETWISEEVALKIT和传统的nDCG评估方法有什么本质区别?

A:nDCG是对每篇文档单独打相关性分数然后加总,默认“集合好坏等于单篇之和”。SETWISEEVALKIT则把文档集合当作整体来评估,涵盖九个维度,能发现传统方法看不到的缺陷,比如多篇文档高度重复、不同文档之间存在事实矛盾、整套文档无法支撑完整推理链条等问题。这相当于从“每道菜单独打分”升级到“整桌饭合不合理”的评估逻辑。

Q2:RUBRIC4SETWISE方法为什么用更少的文档反而能得到更好的答案?

A:传统方法通常取排名前五的文档,其中可能有两三篇内容高度重复。RUBRIC4SETWISE会先明确这道题需要哪些具体信息点,再找到能覆盖所有信息点的最小文档子集,平均只需2.66篇。删掉冗余文档后,AI不需要处理重复噪音,关键信息更突出,推理更准确。

Q3:评分细则的生成需要知道正确答案,实际使用时怎么解决这个问题?

A:目前RUBRIC4SETWISE确实依赖预先知道标准答案来生成评分细则,研究团队自己也承认这是“神谕设置”,代表的是方法的能力上限而非日常可用的状态。研究团队提出的解决方向是把评分偏好“蒸馏”成可训练的奖励信号,让模型在训练阶段就内化这套质量意识,推理时不再需要现成答案。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。