大模型与具身智能的火花,ICML 2024 MFM-EAI Workshop征稿和挑战赛启动

Workshop 主页: https://icml-mfm-eai.github.io/

概述

近年来,多模态基础模型(MFM),例如 CLIP、ImageBind、DALL・E 3、GPT-4V、Gemini 和 Sora,已成为人工智能领域最引人注目且发展迅速的领域之一。同时,MFM 的开源社区也涌现出了诸如 LLaVA、LAMM、MiniGPT-4、Stable Diffusion 和 OpenSora 等具有代表性的开源项目。

不同于传统计算机视觉和自然语言处理模型,这类 MFM 正在积极探索通用问题解决方案。通过引入 MFM,具身智能(EAI)能够在模拟器和现实世界环境中更好地处理各种复杂任务。然而,在 MFM 和 EAI 的交叉领域,仍有许多尚未探讨和解决的问题,包括智能体长期决策、智能体运动规划、新环境泛化能力等。

本次 Workshop 将致力于探讨几个关键问题,包括但不限于:

  1. MFM 的泛化能力;
  2. 用于具身智能的 MFM;
  3. 基于生成模型的世界模型;
  4. 模仿学习数据收集。

Workshop 征稿

该 workshop 聚焦于多模态基础模型(MFM)、具身智能(EAI)以及两项研究的交叉领域。本次征稿主题包括但不限于:

投稿规则

本次投稿将通过 OpenReview 平台实行双盲审稿。投稿的正文篇幅为 4 页,参考文献和补充材料篇幅不限。

时间节点

所有时间节点均为 [AoE] (Anywhere on Earth)。

大模型与具身智能的火花,ICML 2024 MFM-EAI Workshop征稿和挑战赛启动

MFM-EAI 挑战赛

三个赛道(可同时参与)

  1. EgoPlan 挑战

EgoPlan 挑战旨在评估多模态大模型在现实世界场景中,针对人类日常活动所涉及的真实任务的规划能力。模型需要依据任务目标描述、第一人称视角视频和当前环境观察,选择合理的动作推进任务完成。

  1. Composable Generalization Agent 挑战

Composable Generalization 挑战旨在评估规划-执行组合系统在开放场景下的任务能力和泛化能力。模型根据语言任务描述和多模态视觉输入进行任务拆解,控制器执行拆解后子任务。

  1. World Model 挑战

World Model 挑战旨在评估世界模拟器在具身智能场景中的应用表现。模型根据具身任务描述和实时场景观测生成符合任务指令的视频,评估视频生成质量和指导 agent 完成任务的能力。

委员会成员

Workshop 组织者

大模型与具身智能的火花,ICML 2024 MFM-EAI Workshop征稿和挑战赛启动

指导委员会

大模型与具身智能的火花,ICML 2024 MFM-EAI Workshop征稿和挑战赛启动

联系方式Workshop 相关问题icmlmfmeai@gmail.com

本文转载于:https://www.jiqizhixin.com/articles/2024-05-24 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。