展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 业界资讯 > 阿里通义千问的多模态大模型,是否能与GPT-4V竞争?

阿里通义千问的多模态大模型,是否能与GPT-4V竞争?

通义千问的图像推理能力,最近有了大幅提升。2024年,大模型领域要卷什么?如果没有思路的话,不妨看看各家大厂都在押注什么方向。最近一段时间,先是OpenAI推出GPT-4V,让大模型拥有了前所未有的图像语义理解能力。谷歌随后发布的Gemini是首个原生的多模态大模型,在泛化和无缝理解、操作、组合不同类型信息上具有突出能力,包括文本、代码、音频、图像和视频。显然,多模态是当前的新方向。随着GPT-4在语言领域的突破,业界一致认为"视觉"将是下一个爆发的领域。毕竟,视觉信息占据了人类五感的80%,因此未来的大

通义千问的图像推理能力,最近有了大幅提升。

2024 年,大模型领域要卷什么?

如果没有思路的话,不妨看看各家大厂都在押注什么方向。

最近一段时间,先是 OpenAI 推出 GPT-4V,让大模型拥有了前所未有的图像语义理解能力。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

谷歌随后发布的 Gemini 是首个原生的多模态大模型,在泛化和无缝理解、操作、组合不同类型信息上具有突出能力,包括文本、代码、音频、图像和视频。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

显然,多模态是当前的新方向。随着GPT-4在语言领域的突破,业界一致认为"视觉"将是下一个爆发的领域。毕竟,视觉信息占据了人类五感的80%,因此未来的大型模型应该充分利用更多类型的感知,以此来探索实现人工通用智能的路径。

国内的技术力量也在这个充满潜力的方向上蓬勃发展,除了GPT-4V和Gemini,阿里最近发布的新升级通义千问视觉语言大模型Qwen-VL-Max也值得关注。该模型在上周正式发布,并在多个测评基准上取得了优异成绩,展现出强大的图像理解能力。

我们还记得 Gemini 发布之后,谷歌马上被曝出给 Demo 加速。这让人们对新技术产生了一些质疑,并开始好奇:在当下的各路多模态大模型中,到底哪家比较强?

Demo 不作数,实际一测便知。有人拿着自己的名片给 GPT-4V 和 Qwen-VL-Plus 看,高下立见了:值得注意的是,去年底升级的 Plus 版还不是 Qwen-VL 的最强版本,最近发布的 Max 才是。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

图源:https://x.com/altryne/status/1742597044781395982?s=20

在 Qwen-VL-Plus 发布后,国内也有人拿 Gemini 演示视频里的问题对它进行了测试,发现所有问题 Qwen-VL-Plus 完全都能回答上来。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

一系列测评看下来,我们确实可以说,Qwen-VL 的整体能力已经达到了媲美 GPT-4V 和 Gemini 的水平,在多模态大模型领域实现了业内领先。

Qwen-VL 如何追平 GPT-4V、Gemini?

事实上,通义千问的视觉理解大模型已经经历了几轮迭代。

早在去年 8 月,阿里就放出了 Qwen-VL 模型的第一个版本,并很快对通义千问进行了升级。Qwen-VL 支持以图像、文本作为输入,并以文本、图像、检测框作为输出,让大模型真正具备了「看」世界的能力。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

图片来源:https://twitter.com/Gorden_Sun/status/1696021151753855331

经历了几个月的改进,Qwen-VL 的整体能力又有了一个跃升,陆续推出 Plus 和 Max 两大升级版本,限时免费使用。用户可以在通义千问官网、通义千问 APP 直接体验 Max 版本模型的能力,也可以通过阿里云灵积平台(DashScope)调用模型 API。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

相比于开源版本的 Qwen-VL,这两个模型在多项图文多模态标准测试中获得了堪比 Gemini Ultra 和 GPT-4V 的水准,并大幅超越此前开源模型的最佳水平。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

在多模态大模型性能整体榜单 OpenCompass 中,Qwen-VL-Plus 紧随 Gemini Pro 和 GPT-4V,占据了前三名的位置。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

图片来源:https://opencompass.org.cn/leaderboard-multimodal

Qwen-VL Plus 和 Max 支持百万像素以上的高清图,甚至各种极端长宽比的图片。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

它们不仅有高水平的基准评测性能,在真实场景中展现出来的解决问题的能力也有显著提高,不仅可以轻松进行对话,识别名人、地标,生成文本内容,视觉推理能力也有明显改善。

开发者一手实测

Qwen-VL 发布以来,从开源社区到社交网络上,我们已经看到了一系列「花活」。

接下来,我们从普通用户的角度,再来考验一下升级版的 Qwen-VL。

给它一张《繁花》里面 90 年代初的上海滩照片:

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

通义千问识别出了这里是上海外滩,还能介绍一下黄浦江的景色,以及上海海关大楼等特定建筑物。

剧中提到的炒饭内含多少卡路里?

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

看起来大模型可以理解并联系一些知识。

除了基础的描述和识别能力外,Qwen-VL 模型还具备视觉定位能力和针对画面指定区域进行问答的能力。比如,根据指示进行目标检测。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

如果你在截图上圈住一部分,它可以对其中的内容进行解释:

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

新升级的 Qwen-VL 模型最显著的进步之一是基于视觉完成复杂推理的能力,比如理解流程图这种复杂的表示形式:

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

与此同时,升级后的 Qwen-VL 处理图像中文本的能力也有了显著提高,不管是识别中文还是英文文本。Qwen-VL-Plus/Max 可以有效地从表格和文档中提取信息,并将这些信息重新格式化,以满足自定义输出要求。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

四个多月就有如此进步,这就让人们开始感叹,阿里通义千问大模型更新够快,能力够强。

阿里多模态大模型,正在爆炸式发展

能够达到如今的水准,Qwen-VL 的技术实力不是一朝一夕炼成的。

在多模态大模型方向上,阿里很早就开始布局。从 2021 年 M6 系列的预训练 - 微调模式,到 2022 年 OFA (One-For-All) 系列的统一模态表示和任务的模式,再到 OFASys 的系统化 AI 学习的尝试,通义千问团队的目标是做出和人一样能听、能看、能理解 & 沟通的通用 AI 模型(系统)。

2022 年,阿里开源了 OFA。OFA 能通过自然语言来描述一个图文多模态任务,比如输入「描述一下这张图片」,模型就会尝试去产生一个合适的图像描述,打破了大家对通用多模态任务模型效果不如专用多模态模型的传统观念。这篇被 ICML 2022 接收的论文思路启发了后续的许多研究,被谷歌、微软、Meta 等众多国际大厂所引用,是近年来多模态方向的高引论文之一。

2023 年以来,通义千问团队延续了 OFA 的研究路线,利用通义千问语言模型的能力,弥补了过去多模态模型在新任务泛化能力上的缺陷,相关成果就是 2023 年下半年我们看到的开源图文多模态模型 Qwen-VL 和音频多模态模型 Qwen-Audio。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

与此同时,阿里云通义实验室的一系列视觉生成类成果,也彻底火出了圈,社交网络上时不时可以看到利用通义 AI 技术生成的动图。

比如只需一张图片即可生成跳舞视频的 Animate Anyone,在国内外都引发了大量关注:

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

再比如实现真人百变换装的 Outfit Anyone。这项技术不仅能够精确地处理服装的变形效果,并且能调整以适应不同的姿势和体形,实现更加逼真的试穿体验。无论是动画形象还是真人,都可以一键换装,让「QQ 秀」真正升级成了真人版。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

此外,通义实验室的文生视频模型 I2VGen-XL 也是实实在在地火了一把,生成的视频兼顾高清、高分辨率、平滑、美观,毫不逊于 Gen2、Pika 效果。

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

多模态大模型,阿里通义千问能和GPT-4V掰手腕了

I2VGen-XL 生成视频结果。

众所周知,通用人工智能的求索之路相当漫长,而大模型的技术突破,已经为我们指出了一个光明的方向。过去一年多,人们见证了一场激烈的 AI 技术角逐,赛道上不乏来自中国的选手。

以往,大模型领域的厂商大多以 OpenAI 为标杆,需要承认的是,OpenAI 的最新一代对话大模型 GPT-4 仍然在语言领域保持着领先优势。

但在接下来的 2024 年,在下一个最具爆发潜力的技术方向 —— 多模态大模型上,中国的技术与产品或可与 OpenAI、谷歌这样的选手掰一掰手腕。像 Qwen-VL 这样的国产大模型,能否实现从追平到进一步超越?会不会再诞生一批爆款应用?这些都是接下来一年值得期待的事情。

长远来看,在多模态大模型进一步实用化之后,我们以后可以更加理直气壮,让 AI 自动识别图像和音频中的内容,进行总结、摘要和分析,新技术势必会大幅度提升我们的工作效率;我们在 AR、VR 世界中与环境的交互也会更加便捷,可穿戴设备的体验将会更具真实感,新应用可以大幅改进娱乐和日常体验。

更加直观的是,多模态大模型能够根据每个人的喜好生成定制化内容和产品,对于阿里来说,这件事很重要。

或许,随着多模态大模型技术的突破,我们将很快看到电商领域发生一场革命。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
业界资讯
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。