复旦邱锡鹏团队提出「上下文世界建模」:无需微调,VLA即可适应新环境
作者:Jason
时间:2026-08-21
浏览:0
复旦大学邱锡鹏团队提出上下文世界建模(ICWM),让机器人在任务前执行随机探测动作,将交互上下文作为输入,无需微调和额外示范即可适应新环境。实验表明,该方法在跨视角和真实机器人场景中显著优于基线,有效提升泛化能力。
视觉-语言-动作(VLA)模型有个老毛病:部署时只要相机角度、安装位置或者机器人本体稍微变一变,性能就可能直线下滑。过去常用的“上下文学习”多半是把上下文当示范用——让机器人看人类做一遍任务,但它并不清楚整套系统到底怎么运作的。一旦环境变了,研究人员只能回头重新收集数据、重新调模型,又费时间又费力气。
针对这个问题,复旦大学邱锡鹏团队拿出了一个新方案——“上下文世界建模”(In-Context World Modeling,ICWM)。核心思路很简单:在任务执行之前,让机器人先来一段跟任务无关的随机探测动作,然后把这段交互过程作为上下文喂给模型,让它自己判断当前系统的配置。这样一来,后续的动作生成就不用重新示范,也不用调整模型参数。
本文内容来源于网友投稿,如有侵权请联系删除。

ICWM 是如何设计的?
与传统 VLA 模型相比,ICWM 的核心变化在于:它先根据交互上下文判断当前系统配置,然后再生成后续动作。整个流程分训练和推理两个阶段。 **训练阶段**:团队在每个任务样本前面拼接一段与任务无关的交互片段,作为上下文输入。模型根据交互带来的画面变化,推断当前系统的配置。有意思的是,ICWM 没有单独搞一个独立的世界模型,而是直接用 VLA 主干来处理这段交互历史。这么做既简化了结构,也让信息能直接为动作预测服务。 **推理阶段**:机器人不急着干活,先做一轮主动探测——记录动作前后的观测变化,形成所谓的“交互上下文”。然后模型把当前看到的上下文、画面和任务指令一起作为输入,判断接下来该怎么做。 
图|ICWM 的训练与推理流程概览。
实验结果
团队在跨视角、真实机器人和多种分布外扰动场景上都做了实验。结果表明,ICWM 借助交互上下文大幅提升了对新环境的适应能力,并且展现出向语义变化和机器人形态变化等场景扩展的潜力。1. 仿真结果
在 LIBERO 仿真基准上的跨视角实验中,ICWM 在已见视角和新视角下都优于基线。相比单纯靠多视角训练的方法,它在已见视角下平均高出 8.1%,在新视角下平均高出 13.0%。即使直接把真实相机参数输给模型,它的泛化表现仍然不如 ICWM。在长时序任务上,ICWM 对累积误差的控制也更出色。 
图|在 LIBERO 基准上,已见视角与未见视角的成功率(%)。
2. 真实机器人实验
在 UR5e 真实机器人平台上,ICWM 同样明显优于基线。团队用了一套 12 相机的多视角系统评估,任务覆盖堆叠、抓取和拾取、放置等操作。标准 VLA 对视角变化相当敏感——从训练视角切换到测试视角后,平均成功率从 68% 骤降到 17%,而 ICWM 的表现稳定得多。 
图|在 UR5e 平台上的真实世界评测。
定性结果也很有意思:切换到新环境后,普通模型容易出现位置偏移、过早闭合夹爪等问题,ICWM 则基本保持稳定。 
图|定性对比。
3. 消融与分析
消融实验证实,ICWM 的性能提升确实来自交互上下文,而不是简单的模式匹配。去掉图像信息后,模型表现下降最明显——平均成功率从 25.0% 降到 10.9%;去掉动作信息,或者不提供交互上下文,模型表现也会下降。更有意思的是,如果给一段错误的上下文,模型表现甚至比没有上下文时还差。对照实验还表明,模型必须经过专门训练才能利用交互上下文适应环境;否则,就算在测试时提供同样的信息,性能也几乎为零。 
图|交互上下文消融实验。
从可视化结果来看,模型已经能区分不同视角和配置:相同视角下的数据分布更集中,不同视角之间的区分也更清晰。 
图|不同分布外(OOD)视角下的 Ψ(T) 的 t-SNE 可视化。
团队还发现,ICWM 的效果并不依赖某一种特定的探测方式。无论采用随机探测,还是仅沿 XY、Z 或旋转方向运动,ICWM 都稳定优于对照方法,成功率提升约 15% 到 27%。泛化实验也显示,ICWM 对机器人形态变化有较强的适应性,在语义扰动场景下同样有一定提升。 
图|分布外(OOD)视角下,不同探测策略的成功率(%)。

图|对语义场景变化和机器人形态变化的鲁棒性。
不足与未来方向
ICWM 虽然显著提升了 VLA 在新环境中的适应能力,但团队也指出了几个短板。 首先是极端视角问题。在部分极端视角条件下,ICWM 的性能提升仍然有限。原因是这些视角往往伴随更严重的遮挡,操作目标在执行过程中也更容易短暂移出相机视野。后续需要结合多视角感知、主动视角调整以及更强的遮挡建模能力来突破。 其次是语义扰动场景。目前 ICWM 在这类场景下的提升仍比较有限——训练数据中的场景语义和组合配置还不够丰富。如果能进一步扩充场景语义和组合配置更丰富的训练数据,ICWM 在语义扰动场景中的表现有望继续提升。 更多技术细节,详见原论文。
作者最新文章
PDF转PPT在线教程:极轻PDF转换步骤与背景音乐添加指南
2026-09-02 18:58
红米RedmiNote13字体大小如何设置 红米RedmiNote13字体大小设置方法
2026-08-25 15:12
vivo Z5(6GB/128GB/全网通)忘了手机密码怎么办?
2026-08-25 14:07
老用户159元套餐不及新用户39元划算,媒体:通信行业提质升级仍在路上
2026-08-25 12:21
2026 最好用的 ORM 框架:xbatis 1.9.7 正式发布,基于 mybatis 的 ORM 框架
2026-08-25 10:29
精品专题
更多
Mac软件
更多
WINDOWS
更多

































