微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 7B模型如何同时生成视频和声音,还能做到2K分辨率一步刷新

7B模型如何同时生成视频和声音,还能做到2K分辨率一步刷新

2026-09-23 10:08
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-23 10:08 科技行者

你有没有想过,为什么现在AI生成的视频,大多是哑巴的?

打开任何一个视频生成工具,你会发现它给你一段流畅的画面,马在跑,云在飘,人在走路。但没有声音。如果视频里有人说话,嘴巴一张一合,却什么都听不见。想要配音,得等视频生成完了,再单独跑一个音频生成模型,去猜这段画面应该配什么声音。

这事儿听起来别扭吗?确实别扭。就像你请了两个装修师傅,一个专门刷墙,一个专门装灯,他们互相不看对方在干什么,刷墙的师傅不知道灯要装在哪儿,装灯的师傅也不知道墙面会是什么颜色。最后墙刷完了,灯的位置对不上插座,只能返工。视频和音频分开生成,本质上就是这种各干各的活。

阿里的DreamX团队想解决这个问题。他们在2026年发布了一个叫DreamX-Creator 1.0的系统,核心是一个70亿参数的生成器,同时把视频和音频这两件事放在一个脑子里做,让它们一边生成一边商量。

**这套系统最打眼的地方,是它只用70亿参数,却做到了和更大模型掰手腕的效果**

要理解这有多难得,得先看看这个赛道现在都在干嘛。同类型的产品里,LTX-2.3用了220亿参数,MiniMax H3用了330亿,MAGI-2 Preview的总参数量甚至到了1140亿。这些都是能同时生成视频和音频的原生系统,DreamX-Creator却只用了这些模型的三分之一甚至十分之一的体量,还能把权重开放下载,还支持本地跑到2K分辨率。这种"参数量最小、能力最全"的组合,在目前公开的同类系统里几乎找不到第二个。

那它是怎么把这么多活儿塞进这么小的模型里的?往下看你就明白了。

数据这道坎,比想象中难跨

在讲模型架构之前,得先说说一个容易被忽略但极其关键的环节:数据。

原始视频素材,从网上抓下来的、公开数据集里的、内部积累的,质量参差不齐是常态。有的视频画面模糊,有的音频全是杂音,有的镜头切换太快导致声音和画面根本对不上,前一个镜头的枪声,混到了下一个镜头的对话里。如果拿这样的数据直接训练,模型学到的很可能是错误的因果关系:它可能以为某种画面天生就该配某种声音,实际上只是数据切片切歪了。

DreamX团队搭了一整套数据处理流水线来解决这个问题。

第一步是切片和过滤。用PySceneDetect(一款开源的镜头边界检测工具,能自动识别视频中场景切换的位置)先把长视频切成一个个独立的镜头片段,再把接近静音的段落剔除掉,分辨率不够的也扔掉。考虑到镜头边界的检测可能不够精准,他们干脆在每段视频的首尾各裁掉三帧,避免跨镜头的画面音频串门。

第二步是多维度质量打分。视觉质量用Q-Align评估,运动幅度用UniMatch光流算法估计,音频质量用Audiobox Aesthetics打分。光有质量还不够,还得看音画是否同步:用Synchformer(一种评估音视频时间同步程度的模型)检测一般场景的音画对应关系,遇到画面里有人说话的镜头,再额外用SyncNet(专门检测嘴型和语音是否匹配的模型)做唇音同步校验。

这个过程有点像给食材做质检。菜市场进来的一批菜,有烂叶子的要挑出去,水分不够新鲜的要挑出去,买回来的肉和菜要看看是不是配对的(比如买的鱼香肉丝的料,却混进了别的菜的肉)。如果这一步偷懒,直接把菜一股脑扔进锅里,炒出来的味道肯定是乱的。如果不做这层过滤,模型学到的音画关联可能全是巧合而非因果,生成的时候就会出现嘴型对不上话、动作和声音时间轴错位的问题。

数据标注这块也没有偷懒。团队没有让视频和音频分开打标签再拼在一起,而是用Qwen3-Omni模型同时看视频、听音频,联合生成一份描述,这样能让视觉证据和听觉证据互相制约,减少模型编造内容的可能。同时还用Qwen3-ASR专门转录语音内容,保证台词的准确性,最后再用Qwen3.6模型把这些信息揉合成一段通顺的文字描述。

标注完的数据,按照内容的主导因素被分成四类池子:对话类(占45%),动作和拟音类(占33.4%),环境音乐类,以及一般叙事类。这个分类的意义在于,不同类型的内容里,音画之间谁主导谁是不一样的,人说话的时候,是先有话音再带动嘴型,而物体碰撞发出声音,则是先有画面里的动作才有对应的响声。分开管理,能让训练时更有针对性地强化某种能力。

两条流水线怎么学会互相搭话

数据准备好了,接下来是模型架构本身的设计。

DreamX-Creator的生成器有两条独立的处理流:一条专门处理视频,一条专门处理音频。在网络的前半部分,这两条流各干各的,谁也不理谁,各自按照自己的节奏处理信息。到了网络的后半部分,情况变了,两条流开始"交谈"。

这个交谈机制,团队称之为门控跨模态注意力(Gated Cross-Modal Attention)。

**这个名字听起来复杂,拆开看其实很直白:两条流互相看一眼对方在干什么,再决定要不要根据对方的信息调整自己**

具体来说,有两条路径。一条叫A2V(音频到视频),让视频那条流去看音频流里的内容,调整自己的生成;另一条叫V2A(视频到音频),反过来让音频流去看视频流。这两条路径可以单独启用,也可以同时启用,取决于当前这段内容里,是音频驱动画面更合理,还是画面驱动音频更合理。

问题来了:如果两条流之间的交流力度不加控制,会怎样?

设想一下两个正在合作演奏的乐手。如果他们完全不听对方,各自按自己的节拍弹,合奏出来的东西会乱七八糟。但如果一个人过度听从另一个人的节奏,完全忘了自己该弹什么旋律,那这场合奏也失去了意义,变成了一个人在弹,另一个人在附和。真正好的合奏,是两人各自保持自己的旋律线,同时在关键的转折点互相呼应,该配合的时候配合,该各走各的时候各走各的。

DreamX-Creator用了一个"门控"机制来实现这种平衡。每次跨模态注意力算完之后,不是直接把结果加到主干网络里,而是先过一道筛选:根据当前这个位置的信息(是嘴巴在动还是石头落地),以及对方传来的信息,算出一个介于0到1之间的分数,这个分数决定了对方的信息在多大程度上被采纳。这个门是逐个词元(token,可以理解为模型处理信息的最小单位,一段画面或声音会被切成很多个token分别处理)、逐个注意力头单独计算的,意味着模型可以在同一时刻,让画面里嘴巴的部分多听一点音频的影响,而背景树叶晃动的部分完全不受音频干扰。

如果没有这个门控设计会怎样?

要么模型学会了过度依赖跨模态信息,导致视频流失去自己的独立判断能力,生成内容变得单调死板;要么跨模态信息的权重固定不变,无法针对不同内容动态调整,该强关联的地方关联不够,不该关联的地方却硬凑关联,产生莫名其妙的画面音频对应关系。

除了门控,团队还给两条流之间的对话加了个"共同时钟"。因为视频和音频的采样频率不一样(一秒钟的视频可能被切成几十个画面词元,而同样一秒钟的音频可能被切成完全不同数量的音频词元),如果不做时间对齐,两边的信息根本没法准确对应。团队用了一种叫时间旋转位置编码(temporal RoPE)的技术,把两条流的位置信息都映射到一个共同的时间坐标系里,这样即便两边的采样密度不同,模型也能准确判断哪一段音频对应哪一段画面。

三阶段训练,像升学一样一步步来

架构定了,怎么训练也是个学问。

DreamX-Creator用了一套渐进式联合训练方案,分成三个阶段。

第一阶段叫LoRA基础的音视频预训练。团队从已经训练好的独立视频模型和独立音频模型出发,把网络前半部分冻结不动,只在后半部分插入低秩适配器(LoRA,一种参数高效的微调技术,不需要改动整个大模型,只训练一小部分新增参数就能实现适配),同时直接训练跨模态注意力模块和门控参数。

第二阶段是全参数预训练。把第一阶段训好的LoRA参数合并进主干网络,然后放开手脚,让整个网络(包括视频和音频两条主干,以及所有跨模态模块)一起接受更大规模数据的训练。

第三阶段是高质量微调。团队用音画同步指标、美学评分、分辨率、时长等标准,筛选出一批高质量的数据子集,还专门用了一个叫OmniShotCut的工具做更精细的镜头边界检测,把那些跨镜头的、包含转场的片段统统剔除,只留下真正连贯的内容。

**这套训练流程,像极了学生从基础教育到专业深造的升学路径**

刚开始,基础打底,只调整一小部分模块(相当于打基础的通识课),然后逐步放开所有科目一起学(全面发展阶段),最后专攻一个精细方向,用最优质的素材反复打磨(相当于研究生阶段的精读文献)。如果一开始就让所有参数一起大规模训练,风险在于模型可能被海量掺杂质量参差的数据带偏,学到很多错误的模式,后面很难纠正。分阶段、先小范围调整再逐步放开的策略,给了模型一个从粗到细、逐步收敛的机会。

训练时还有个细节值得一提:模型内部其实有三种训练模式在混合使用,分别叫A2V、V2A和联合模式(Joint)。这三种模式对应着不同的信息流动方向和噪声强度分配,但注意,这些模式只是训练时内部使用的配置,不是用户在使用时需要选择的功能。用户最终只有一个统一的接口,即输入首帧画面和文字描述,模型自动决定该以哪种方式生成音画同步的内容。

光是生成得好还不够,还得让人满意

模型训练完,是不是就大功告成了?

并不是。用流匹配(flow matching,一种训练生成模型的数学框架)这类目标函数训练出来的模型,擅长的是拟合训练数据的统计分布,但这和"人类觉得好不好看、好不好听"是两码事。就像一个学生把考试大纲背得滚瓜烂熟,考试分数很高,但写出来的作文未必真的动人。

DreamX团队因此引入了一个叫音视频强化学习(Audio-Video Reinforcement Learning)的后训练阶段,用人类偏好相关的反馈信号,去进一步调优这个已经训练好的模型。

这里有个技术挑战:一段生成的音视频内容,可能画面质量很高但声音很差,也可能两边都不错但时间对不上。如果把所有评价维度粗暴地压缩成一个单一分数,会出现"拆东墙补西墙"的情况,某个维度的进步掩盖了另一个维度的退步,评分表面看起来在涨,实际上某方面正在变差。

**团队的做法是,把反馈拆开,分别送到对应的地方**

具体来说,每个生成的样本会同时收到视频质量、音频质量、以及跨模态一致性三种独立的反馈信号。视频专属的反馈只用来调整视频那条流,音频专属的反馈只调整音频流,而跨模态的反馈(比如同步是否精准)则同时作用于两条流以及它们之间的交互模块。

这就像一家公司做绩效考核。如果销售和产品团队共用一个笼统的"公司业绩"指标,那销售业绩好但产品出了大问题时,考核结果可能还是"不错",没人会去查产品出了什么问题。但如果把销售指标、产品指标、以及两个团队协作效率的指标分开考核,谁的问题就归谁负责,该协作的地方也有专门的指标盯着,这样才能真正定位到问题出在哪儿,进而精准改进。

除了拆分反馈,团队还注意到音画同步这件事其实主要取决于几个局部区域,比如说话人的嘴巴,或者正在发出声响的物体。他们利用视频到音频的注意力响应,去估计视频里每个位置对同步的重要程度,重要的地方(比如嘴巴)获得更高的关注权重,这个权重是逐帧动态计算的,训练初期权重比较均匀,随着训练推进逐渐聚焦到真正重要的区域。

把低分辨率视频一步刷新到2K的秘密

前面讲的都是内容本身怎么生成,还有一个现实问题没解决:分辨率。

直接生成2K分辨率的音视频内容,计算成本极高。但如果只在一个能接受的中等分辨率上生成,画面就会缺乏细腻的纹理和锐利的边界,达不到实际使用的标准。

DreamX团队为此专门做了一个叫2K Refiner的刷新模块,思路是让主模型先生成一个连贯的低分辨率视频,再用这个刷新模块把它提升到2K分辨率,同时保持内容、动作和音画同步不变,而且刷新过程中不改动音频。

这个模块的训练过程分了三步。

第一步,训练一个双向的多步扩散教师模型。这个模型可以同时看到过去和未来的帧,用来学习怎么把低分辨率视频恢复出细节。训练数据是拿高质量视频人为地做退化处理生成的,一开始退化程度很轻,逐步加入更强的模糊、噪声、压缩痕迹,甚至专门模拟了生成视频特有的闪烁纹理和局部抖动这类问题,毕竟2K Refiner要处理的是AI生成的视频,不是真实摄像机拍出来的素材,两者的瑕疵类型不一样。

第二步,把这个双向教师模型改造成自回归的多步刷新器。做法是用教师强制(teacher forcing)的方式:当前这一段视频块,在已知过去真实高清片段的前提下去做刷新,让模型逐渐适应"只能看过去、看不到未来"的推理场景。

第三步,把这个自回归多步模型蒸馏成一步学生模型。这一步用了一种叫DMD(Distribution Matching Distillation,分布匹配蒸馏)的技术,让学生模型的输出分布去匹配教师模型的分布,而不是死记硬背教师每一步的具体输出。

这里有个细节特别值得说:蒸馏过程中用了自我滚动(self-rollout)的训练方式。学生模型在推理时,是拿自己之前生成的高清片段作为后续片段的参考,如果训练时始终喂给它真实的历史片段,那模型在实际使用时一旦犯了一点小错误,这个错误就会在后面的片段里越滚越大,最终导致闪烁、过度锐化甚至画面漂移。团队因此让学生模型在训练阶段就用自己生成的完整视频去训练,这样训练和实际使用的场景才是一致的。

**这就像教一个孩子骑自行车,如果每次都在你扶着的情况下练习,一旦真正撒手让他自己骑,遇到的第一个小晃动就可能变成一次摔倒**

只有让孩子在真实条件下练习纠错,他才能学会怎么应对自己制造出来的小失误,而不是依赖一个理想化的、从不出错的支撑环境。

这套刷新方案最后实现的效果是:每一段视频块只需要一次去噪计算,就能完成从低分辨率到2K的提升,大大降低了推理成本,同时不破坏原本的动作和音画同步。

数据说话:这个7B模型到底行不行

理论讲了很多,最终还是要看数字。

团队在一个叫Verse-Bench的评测集上做了系统对比,这个评测集专门针对音视频联合生成场景设计,覆盖一般音视频事件和以对话为主的场景。

和几个体量相近或更小的研究性基线模型(NAVA、UniAVGen、Ovi、DaVinci-MagiHuman)对比时,DreamX-Creator在视频质量指标上拿到了0.6568的分数(强化学习后进一步提升到0.6573),唇音同步指标LSE-C达到7.8018(强化学习后为7.8361),这两项在对比模型里都是最高或接近最高的水平,同时它的音画不同步程度指标DeSync只有0.1902(强化学习后降到0.1351),明显优于其它对比模型,说明这个模型在保持画面质量的同时,音画对应关系做得更紧密。

和体量大得多的开源系统对比(LTX-2.3的220亿参数、MiniMax H3的330亿参数),差距就变得诚实起来了。LTX-2.3在音频内容丰富度(CE)、音频实用性(CU)、音频制作质量(PQ)、以及跨模态语义一致性(IB)上都要高于DreamX-Creator,MiniMax H3在这几项上领先得更多,唇音同步这一项也超过了DreamX-Creator。团队自己在论文里也坦承,这几项差距说明现在的70亿参数模型还没有做到全面追平这两个更大的开源系统,尤其在音频美学质量和跨模态语义理解上还有提升空间。

刷新模块这块,团队和几个业内常见的视频修复方法(FlashVSR、SeedVR、LTX-2.5 Refiner)做了对比,DreamX-Creator的刷新器在画面清晰度指标MUSIQ(0.7073)和无参考图像质量指标MANIQA(0.4382)上都拿到了最高分,同时保持了较低的音画不同步分数(0.1731),整体呈现出一个更均衡的提升效果,而不是在某一项指标上偏科。

团队还做了盲测的人类偏好研究,让评审在不知道模型身份的情况下对比两个视频。**结果显示,和几个研究性基线对比时,DreamX-Creator在视频质量维度的胜率非常高**,对NAVA胜率61.7%,对UniAVGen胜率73.7%,对DaVinci胜率68.2%。但换成和工业级大模型(Wan2.7、Kling v3、MiniMax H3)对比,胜负就变得五五开,视频质量维度对Wan2.7是45.5%胜、41.3%负,对Kling v3是48.8%胜、40.7%负,音频质量和跨模态对齐维度上则整体处于劣势。团队诚实地指出,这次评测抽样的场景里高度复杂、动态激烈的镜头占比不高,并没有充分测试出工业级系统的真正实力。

Q&A

Q1:DreamX-Creator 1.0是什么?

A:它是阿里DreamX团队开发的一个原生音视频联合生成系统,核心是一个70亿参数的生成器,能同时生成互相同步的画面和声音,还配有一个能把视频刷新到2K分辨率的模块,并且模型权重是公开可下载的。

Q2:DreamX-Creator 1.0和其他大模型相比优势在哪?

A:它的最大优势是参数量小,只有70亿,但同时具备原生音视频联合生成、模型权重开放下载、支持本地2K输出这三个特点,而同类的LTX-2.3、MiniMax H3等系统体量都要大好几倍,能同时满足这三点的模型目前很少见。

Q3:DreamX-Creator 1.0的2K Refiner是怎么实现一步刷新的?

A:它先训练一个能看到前后帧的双向教师模型学习细节修复,再改造成只能看过去片段的自回归模型,最后用分布匹配蒸馏技术压缩成一步推理的学生模型,每段视频只需一次计算就能提升到2K分辨率。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-