百度ERNIE团队打造的"音视频统一生成"黑科技
作者:BrightSoul
时间:2026-06-04
浏览:0
百度ERNIE团队提出原生音视频对齐框架NAVA,通过先建立音视频精细同步再引入文字条件,实现高质量共生成。采用三层训练策略与三个独立控制旋钮,支持多说话人音色控制,从1亿视频筛选15万样本训练。
这项由百度ERNIE团队主导完成的研究,以预印本形式发布于2026年5月28日,论文编号为arXiv:2605.30073,有兴趣深入钻研的读者可通过该编号在arXiv平台查阅完整原文。
**一、为什么同时“看”和“听”这件事对AI来说如此困难** 你有没有注意过,当一个人说话时,嘴唇的动作和声音是同步的?当一位钢琴家弹奏时,手指落键的瞬间和音符响起是对应的?当电影里发生爆炸,画面中的火光和轰鸣声是同时出现的?这些对人类来说理所当然的“音画同步”,对AI来说却是个极其棘手的难题。 目前市面上有一些AI视频生成工具已经能做到同时生成画面和声音,但它们大多采用的是一种“分家再合并”的笨办法——先让AI单独“想”出视频画面,再让另一个AI单独“想”出音频,最后把两者拼在一起。这就好比让两位作曲家各自戴着耳机、互不相通地创作同一部交响乐,然后强行把两份乐谱合并成一首曲子。结果可想而知:有时候差不多、有时候驴唇不对马嘴。 百度ERNIE团队意识到了这个根本性的问题,并提出了一种全新的解决思路——NA VA,全称“原生音视频对齐框架”(Native Audio-Visual Alignment)。这套框架的核心理念是:让音频和视频从一开始就在同一个“创作空间”里共同生长,而不是分开生长再强行拼接。 **二、现有方案的两种不同“走法”,以及它们各自的问题** 要理解NA VA的创新之处,先得搞清楚目前主流的AI音视频生成方案是怎么工作的。研究团队把现有方案分成了两大类,分别有各自的致命弱点。 第一类叫做“双塔架构”。顾名思义,就是音频和视频各住一座塔,两座塔里的AI各自干各自的活。视频那边根据文字描述生成画面,音频那边根据同样的文字描述生成声音,然后在最后阶段通过一个“桥梁模块”把两者连接起来。目前开源社区里比较知名的Ovi、LTX、MoVA等项目都属于这一类。 这种方法的问题在于,当音频和视频在各自的塔里独立发展了很长时间之后,它们已经各自形成了自己的“性格”,这时候再试图让它们“融合”,往往只能做到粗略的对齐,很难实现真正细粒度的同步。比如说话时嘴唇微妙的动作和声音之间的精确对应,这种精细层面的协调就很难靠后期“桥梁”来补救。 第二类叫做“完全统一的三模态架构”。这种方案走向了另一个极端,把文字、音频、视频三种信息全部丢进同一个大锅里一起搅拌。代表作是daVinci-MagiHuman系统。这种设计的好处是三种信息可以直接“对话”,但坏处是把两件性质完全不同的事情混在了一起:一件事是“语义层面的理解”(比如AI要理解“这段视频描述的是一个爆炸场景”),另一件事是“低级层面的同步”(比如爆炸画面和爆炸声要在毫秒级别精确对齐)。把这两件事硬塞进同一个空间,就像让同一个人同时负责编剧和同期录音,两件事的需求经常会互相干扰。 **三、NA VA的核心思路:先让声音和画面“谈恋爱”,再引入外部指导** NA VA的设计哲学可以用一句话概括:先建立音视频之间的“专属关系”,再引入外部信息来指导整个生成过程。 可以用谈恋爱来理解这个设计。在一段好的关系中,两个人首先需要在一起相处,建立起深度的默契和理解——这是私密的、专属的过程。然后,他们可以参考外界的建议(朋友的意见、社会的期待)来调整两人关系的方向。NA VA对音频和视频的处理方式正是如此:先给音频和视频一个专属的“私密空间”,让它们充分相互了解、建立精确的对应关系;然后再把文字描述等外部信息作为“外部建议”注入进来,引导最终生成的内容。 用更技术性但仍然好理解的方式来说:在NA VA的第一阶段,音频信号和视频信号会被放在一个共享的“音视频对齐空间”里,通过自注意力机制让它们直接相互“感知”——视频帧里的每个时刻可以直接感知到对应时刻的音频特征,反之亦然。文字描述在这个阶段并不作为平等的参与者混入其中,而是在第二阶段通过交叉注意力机制从“外部”向已经初步对齐的音视频联合体输入语义信息。这种“先对齐、后调控”的设计,既保留了音视频之间精细同步的可能,又让文字语义能够有效地引导生成内容,两者互不干扰。 **四、“先对齐再融合”的MMDiT架构:一栋精心设计的两层小楼** NA VA的具体实现依赖于一种被研究团队命名为“Align-then-Fuse MMDiT”的架构,可以把它理解成一栋精心设计的两层小楼,每层楼有不同的功能分工。 这栋小楼的整体框架是MMDiT(多模态扩散变换器),这是当前AI图像和视频生成领域里最主流的技术架构之一,简单来说就是一种通过逐步“去噪”来生成内容的神经网络。NA VA在这个框架的基础上,把30个处理模块分成了前10个和后20个两大组,各有不同的职责。 一楼是“层级对齐层”,负责建立音视频之间的原生对应关系。这里有一个重要的设计细节:音频信号和视频信号在物理特性上差异极大——视频是二维的空间加一维的时间,音频则是随时间变化的频谱;它们的采样率不同、信号密度不同、特征分布也截然不同。如果一开始就强迫它们共用同样的处理参数,会导致两种信号之间的“鸡同鸭讲”。所以在一楼,音频和视频各自先经过模态专属的投影层,把自己的特征转换到一个共同可理解的“语言”上,然后再放入共享的注意力机制中进行深度交互。这个过程就像两个来自不同国家的人,先各自学好一门共同的语言,然后再开始对话,效果远比强行让他们用完全不同的语言沟通要好得多。 一楼还解决了一个技术上的小难题:音频和视频的时间分辨率不同,同样一秒钟的内容,音频可能需要表示成更多的“时间片段”,而视频帧率相对较低。为了让两者在时间轴上能够对齐,研究团队对音频的位置编码(一种让AI知道“现在处理的是哪个时刻的信息”的机制)做了比例缩放,让音频和视频的时间坐标系对齐。具体公式是将音频的旋转位置编码角度乘以视频帧率与音频帧率的比值,从而让两者在时间轴上说的是同一种语言。 文字描述和参考音色等外部信息则通过交叉注意力机制注入,始终处于“外部顾问”的角色,而不是混入音视频的专属对话空间。这保留了一楼作为专属音视频同步空间的纯粹性。 二楼是“统一融合层”,负责在音视频对应关系已经基本建立的基础上,进行更高层次的协同去噪。经过一楼的充分“磨合”之后,音频和视频的特征已经不再那么“格格不入”,这时候可以安全地让它们共享同一套处理参数,进行更高效的联合生成。二楼的设计删除了音视频之间持续的模态区分,代之以共享的变换器模块,既节省了计算资源,也推动了音视频在更深层次上的协同演化。文字等外部条件仍然通过交叉注意力从外部注入,确保语义指导贯穿整个生成过程。 整体而言,这栋两层小楼的设计哲学是:在最需要精细协调的早期阶段,给音视频提供充分的“专属空间”来建立原生默契;在需要效率和高层融合的后期阶段,则推动两者共享资源进行协同生成。这种从“分”到“合”的渐进设计,是NA VA架构的核心精髓。 **五、音色控制:让AI记住“谁在说话”的创意方案** NA VA还解决了一个在实际应用中极为重要却常被忽视的问题:如何精确控制生成内容中不同说话人的音色。 考虑这样一个场景:你希望AI生成一段对话视频,左边的人用某个特定演员的声音说话,右边的人用另一个演员的声音说话。这涉及到一个棘手的问题:AI怎么知道哪段文字应该用哪种音色来说? 现有的一些系统虽然能支持参考音色(即给AI一段参考音频,让它“模仿”这段音频的音色来生成语音),但它们通常把音色信息作为一种“全局控制信号”注入——也就是说,整个视频里所有人说话都会受到这一个参考音色的影响。对于单人说话的场景这还勉强够用,但对于多人对话的场景,这种方法完全失灵。 NA VA提出了一种被称为“语境中的音色条件化”(Timbre-in-Context Conditioning)的机制,其解决方案非常优雅。具体做法是:在文字提示里,每段说话内容都用特殊标记`
作者最新文章
索尼 Xperia 1 VIII / VII / VI 等手机获 Android 17 更新,新增桌面模式等功能
2026-09-08 16:44
加拿大留学监护声明书(IMM 5646)双页签署与公证核对指南
2026-09-03 15:02
在线PDF转图片教程:一键生成高清图片包
2026-09-03 12:04
Creo零基础入门:新建零件与第一次拉伸建模完整指南
2026-09-03 06:02
扫描件PDF转Word的在线操作步骤与编辑可行性判断
2026-09-02 18:39
热门文章
更多
精品专题
更多
Mac软件
更多
WINDOWS
更多


































