展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 硬件相关 > 数据越多,越难用?文远知行用WITT补上数据飞轮的关键一环

数据越多,越难用?文远知行用WITT补上数据飞轮的关键一环

文远知行发布物理AI认知基础大模型WITT,解决自动驾驶数据量大但长尾场景难提取的问题。WITT从道路视频中提取可信事实,具备事实提取、推理、验证和编排能力,错误率仅为通用大模型的三分之一,数据处理效率提升200倍,与GENESIS世界模型组成数据飞轮。

直接说几个核心判断:自动驾驶行业有个反直觉的现象——车队越大、数据越多的公司,反而越头疼怎么用数据。

数据量在暴涨,但模型能力的提升,却越来越依赖那些罕见、复杂、真正值钱的长尾场景。问题在于,把它们从海量数据里挖出来,难度不亚于采集本身。

7月17日的世界人工智能大会上,文远知行发布了物理AI认知基础大模型WeRide WITT。发布会现场,文远知行上海研发中心总经理霍达没有先谈参数,而是从一个更基础的问题讲起:没有可信的事实基础,我们就没有办法判断模型哪里对了,哪里错了。这句话,也点出了WITT诞生的逻辑。

它是一个运行在云端的数据理解模型,能从连续的道路视频中提取可信事实,判断哪些数据值得进入训练,哪些需要进一步验证,哪些只是大量重复出现的普通样本。

今年1月,文远知行发布了负责生成仿真场景的世界模型GENESIS。半年后,WITT补上了另一端的数据理解能力。一个负责理解真实世界,一个负责生成虚拟世界,两者共同组成了文远知行物理AI飞轮的重要环节。

01 从有没有数据,到怎么用数据

过去几年,自动驾驶行业一直在追求更多数据。特斯拉FSD累计行驶里程已经超过84亿英里,但马斯克认为,要实现安全的无监督自动驾驶,大约还需要100亿英里训练数据。美国兰德公司曾对自动驾驶安全验证做过测算:如果想以80%的置信度证明自动驾驶比人类司机安全,100辆测试车需要连续行驶518年。

训练数据和安全验证虽然是两个问题,但两组数字都说明了一件事:真实道路测试,很难覆盖所有罕见情况。

与此同时,当车队规模扩大以后,另一个问题又冒出来了——数据多到无法有效使用。

文远知行超过3000辆L4车辆在全球多个国家运营。一辆Robotaxi每天持续运行,会产生大量道路视频。其中绝大多数是普通的直行、跟车、等灯,真正影响模型能力的,是少数的复杂场景。

这些长尾数据价值高,但数量少,而且往往隐藏在大量普通数据中。人工筛选并不是一个可持续的方法。面对每天新增的大量视频,工程师很难靠人工逐段查看找到所有有价值的数据。

那么,能不能直接交给通用大模型?答案也并不理想。在WACV 2025的CODA-LM基准测试中,GPT-4V面对自动驾驶corner case场景时,通用感知得分为57.5分。

问题不仅仅是识别错误。交通场景里的视觉大模型还可能产生幻觉,它会描述一个视频中不存在的细节,或者错误理解事件发生的先后关系。如果错误的数据进入训练流程,模型学习到的可能不是现实规律,而是错误的判断,反而会影响算法的表现。

过去几年,行业一直在讨论“数据闭环”。采集、标注、训练、仿真、部署,看起来是一条完整链路。但真正落到工程现场,很多闭环卡在了同一个环节:哪些才是有价值的数据?

发布会上,霍达把这个问题总结为一句话:“没有可信的事实基础,我们其实就没有办法去判断模型哪里对了,哪里错了。”WITT试图解决的,就是这一步。

02 WITT:用事实建立对世界的认知



WITT的技术思路藏在它的名字里。它的全称是World Intelligence Toward Truth,中文解释是“以可信事实建立世界认知”。这个名字同时致敬了哲学家路德维希·维特根斯坦,他在《逻辑哲学论》中写下的第一条命题是:“世界是事实的总和。”

放在哲学史里,这句话讨论的是世界、事实与语言之间的关系。进入物理AI的语境,文远知行把它变成了一条具体的工程路线:AI要理解真实世界,需要先从环境、行为、规则、风险和时序关系中提炼出能够验证的事实,再在这些事实之上做判断和推理。

这条路线的载体,被文远知行称为“最小物理事实单元”。霍达称,这是行业内首次把这一概念引入物理AI。发布会现场,他用一个场景解释了这套方法:“一个路口里面可能有多个对象、多个行为、多层关系。比如说下雨是一个事实,右转是一个事实,路边有行人横穿马路是一个事实。这些事实按照时间和因果关系组合起来,才形成了我们看到的完整的场景。”

在WITT眼中,一段夜间雨天的城市道路视频不再只是一串连续像素。它会被拆解成一组相对独立、能够回到画面中验证的事实:天气正在下雨,自车准备右转,车辆位于交叉口,路边行人正在横穿马路,路口信号正在发生变化。

这里的“最小”指的是事实的颗粒度。复杂场景被拆开以后,每个单元只描述相对明确的一件事。在这些事实单元之上,WITT还会生成更完整的场景描述,把一段视频里发生的事情、参与者之间的关系和风险变化重新组织起来。

这和常用的标签系统不一样。传统的数据处理方式,是先由人定义类别,再给视频贴上标签。标签可以回答“这段视频里有没有行人”,却很难描述行人与自车的距离如何变化、风险从哪一刻开始、车辆为什么在这个时候减速。一张图像有可能有上百万个像素点,但跟决策相关的只有一小部分。

WITT要做的,是把这些像素背后的道路事实识别出来,再还原事实之间的关系,变成模型能够直接使用的认知单位。事实单元是基础,真正让它进入自动驾驶研发流程的,是在此之上搭建的事实提取、事实推理、事实验证和事实编排四项能力。

03 WITT四大核心能力



“最小物理事实单元”解决的是AI如何理解真实世界的问题,而围绕这些事实形成的四项能力,则决定了这些信息如何真正进入自动驾驶研发流程。

WITT目前形成了事实提取、事实推理、事实验证和事实编排四项核心能力,分别对应自动驾驶研发中的几个关键环节:从真实道路视频中提炼事实,理解事件背后的关系,判断模型输出是否可信,以及让不同数据进入合适的训练路径。

事实提取:从连续视频中找到关键事实

自动驾驶面对的真实世界并不是由一个个孤立标签组成的。一辆车在道路上行驶,背后同时包含天气、道路结构、车辆状态、交通参与者行为等多个因素。WITT要做的第一件事,就是从这些连续变化的信息中提取出能够被理解和验证的事实。

文远知行将事实分为三个层面:一类是标准驾驶事实,例如车辆转向、变道、减速;一类是多主体交互事实,例如车辆、行人、非机动车之间的位置和行为变化;另一类是物理模糊条件,例如雨雾、反光、遮挡等导致的不确定状态。一段夜间雨天城市道路视频,在WITT看来,不再只是一串连续画面,而是一组相互关联的事实:正在下雨,自车准备右转,车辆位于交叉路口,路边存在行人,信号状态正在变化。这些事实单元组合起来,才形成工程师真正关心的道路场景。

事实推理:不仅找到场景,还理解发生了什么

找到事实之后,下一步是理解事件。自动驾驶研发中,经常需要从大量历史数据里寻找某类特殊情况,例如施工区域内行人突然横穿、雨天低能见度下其他车辆压线、窄路会车时自车减速避让。

过去,工程师需要依靠标签系统筛选,再人工查看大量视频。WITT内置的视频数据引擎支持通过关键词和自然语言进行检索。工程师可以直接描述希望寻找的场景,模型定位相关时间段,并进一步分析事件的原因和演化过程。它回答的不只是“这里发生了什么”,还包括“为什么发生”。例如,一辆车突然减速,是因为前方车辆影响,还是因为行人正在进入潜在风险区域;一次避让动作,是正常驾驶行为,还是模型决策出现问题。

事实验证:减少模型对物理世界的误解

对于自动驾驶来说,理解错误比理解慢更危险。通用视觉语言模型能够描述画面,但在复杂交通场景中,也可能产生幻觉:补充不存在的信息,遗漏关键对象,或者错误判断事件顺序。

WITT针对这一问题建立了事实验证机制。它从弱势道路使用者、自车行为、他车行为、场景理解、事实完备性和交通设施六个维度评估模型输出,并加入事实置信度,形成“6+1”验证体系。模型输出的问题会被归纳为事实错误、幻觉、遗漏和时序错误,再用于判断数据质量,并反馈给模型训练。按照文远知行披露的数据,在自动驾驶垂类场景中,WITT平均每片段事实错误率约为通用基础大模型的三分之一。

事实编排:让不同数据进入不同路径

自动驾驶数据并不是越多越好。不同数据,需要进入不同的处理流程。WITT会根据事实价值对数据进行编排:稀缺的长尾场景进入世界模型GENESIS,用于生成更多模拟训练场景;大量高频日常场景用于强化学习和流程优化;暂时无法确认价值的异常片段进入复核机制,避免关键数据被误判为“脏数据”。

这也是WITT和传统数据处理工具最大的区别之一。它不是简单给数据分类,而是在判断这些数据接下来应该如何被使用。这套机制最终还要接受工程现实的检验。发布会上,霍达披露,在11项物理AI公开测试中,WITT有7项取得领先;单次请求可以输出100多个动态行为标签,事实错误率为通用基础大模型的三分之一。在工程成本方面,WITT相比通用大模型可以节省98%的Token成本;在同等算力预处理条件下,数据处理效率最高提升200倍,单张主流显卡每天可以处理1万分钟车辆运行视频。

霍达总结这套能力时表示:“用云端物理AI模型大规模处理车辆运行数据,在工程上变成了可行。”对于自动驾驶公司来说,真正困难的并不是让模型看懂一段视频,而是让它每天处理成千上万分钟的视频,并融入在研发流程中。

04 WITT + GENESIS:文远知行的物理AI飞轮



WITT解决的是“理解现实”的问题。但自动驾驶不能只理解现实。遇到一个危险场景之后,需要在大量相似场景中进行训练;发现一次模型错误,也需要在安全环境中不断验证改进。

今年1月,文远知行发布了通用仿真世界模型WeRide GENESIS。它负责生成高保真的虚拟道路环境,将真实世界中难以反复采集的场景搬到仿真环境中。车辆加塞、无保护转弯、行人突然出现,甚至极端天气条件,都可以在仿真世界里不断生成和测试。

如果说GENESIS负责“创造世界”,那么WITT负责的就是告诉它应该创造什么样的世界。真实道路中的数据经过WITT处理后,高价值长尾场景被提取出来,进入GENESIS进行扩展,生成的仿真数据再用于车端模型训练;车辆重新进入真实道路,又产生新的数据回流到WITT。一个负责理解现实,一个负责生成接近真实世界的训练场景,两者共同组成文远知行的物理AI飞轮。

这样的方向也正在成为自动驾驶行业的重要趋势。过去行业更多在讨论世界模型如何生成世界,而WITT在这基础上进一步探索:模型应该依据什么事实,去生成一个可信的世界?需要两个条件:足够多的真实道路数据和验证模型性能的产品体系。文远知行过去几年的积累刚好满足了这样的条件。

在L4自动驾驶领域,文远知行已经形成规模化运营。公司披露,目前拥有超过3000辆L4自动驾驶车辆,产品进入12个国家、40多座城市,并在广州、北京、阿布扎比和迪拜开展常态化纯无人商业运营。量产市场上,文远也已经获得近30个车型定点,并搭载于奇瑞星途星纪元、广汽埃安N60等车型。

L4车辆提供更加复杂、更加接近无人驾驶要求的真实场景,L2++量产车提供更大的车辆规模和更广泛的道路覆盖。两者产生的数据,都可以进入WITT进行理解和筛选,再反向推动模型迭代。

更值得关注的是,自动驾驶下一阶段的竞争,不只是比谁拥有更多数据,而是谁能够更快、更准确地从中找到真正有价值的数据。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
硬件相关
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。