微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 英伟达造出了一个"既会说话又会听歌"的超级AI,而且完全不忘记原本的聪明劲儿

英伟达造出了一个"既会说话又会听歌"的超级AI,而且完全不忘记原本的聪明劲儿

2026-07-15 17:12
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-07-15 17:12 科技行者

这项由英伟达(NVIDIA)研究团队主导完成的研究,于2026年7月以技术报告形式发布,论文编号为arXiv:2607.05196。任何对这项工作感兴趣的读者,都可以通过该编号在arXiv学术平台上找到完整的原始论文。

**故事从一个让所有AI工程师头疼的矛盾说起**

你有没有遇到过这样的人:学了一门新技能,却把原来会的东西忘得干干净净?比如花了三个月学吉他,结果把从小练的钢琴技法全忘了。这种"学了新的、忘了旧的"现象在人类身上已经够令人沮丧,放到AI身上就更是一个大麻烦了。

英伟达的研究团队面对的正是这个问题。他们的目标听起来并不复杂:做一个既能处理语音、音乐、环境声音,又能正常对话、做数学推理、写代码的AI模型。但关键难点在于,绝大多数现有的多模态AI(也就是能同时处理多种媒体类型的AI)在学会"听和说"之后,原本在文字上的能力就会出现不同程度的下滑,就好像那个学了吉他忘了钢琴的人一样。

英伟达的团队把这款新模型命名为**Nemotron-Labs-Audex-30B-A3B**,简称**Audex**。他们在论文里宣称,Audex不仅在音频理解与生成领域达到了当前最优水平,同时还保住了文字推理、知识问答、代码编写等各方面的能力,几乎没有任何退步。这正是这项研究最核心的价值所在。

---

一、这究竟是一个什么样的AI,为什么它和以前的不一样?

要理解Audex的特别之处,先来建立一个直觉。以前大多数AI助手的工作方式,就像一家公司里的不同部门:语音识别部门负责把你说的话变成文字,文字处理部门负责理解和回答,语音合成部门再把答案读出来。这三个部门用的是不同的工具、不同的逻辑,彼此之间通过"传递文件"的方式协作。

Audex的设计思路截然不同。它用的是一套统一的"大脑"——一个单一的Transformer解码器(这是当前主流大语言模型的基本架构)。无论是听到声音、理解音乐、回答问题,还是把答案以语音形式说出来,全都由这同一个大脑完成,中间没有"传递文件"的环节。就好比雇了一个人,而不是雇了三个部门,这个人本身就能听、能想、能说,不需要在内部中转。

这种"一脑多用"的设计带来了几个实际好处。首先,不同模态的信息能更充分地融合,AI对声音的理解能直接影响它的推理过程,而不是等翻译成文字再处理。其次,整个系统与现有的AI训练和推理基础设施完全兼容,不需要专门发明一套新的工程体系。英伟达用的是他们自己的Megatron-LM训练框架和vLLM推理框架,这些都是业界成熟的工具。

Audex的文字处理底子,来自英伟达另一款叫做**Nemotron-Cascade-2-30B-A3B**的纯文字大模型。这款底模总参数量300亿,但每次实际运算时只激活其中30亿,因此既强大又高效。Audex是在这个底模的基础上,额外装上了一套"耳朵"(音频编码器)和一套"嘴巴"(音频解码器),然后用精心设计的训练流程让整个系统融合在一起。

---

二、AI的"耳朵"和"嘴巴"是怎么工作的?

Audex的"耳朵"部分,采用了一个叫做AF-Whisper的音频编码器。这个编码器的前身是OpenAI的Whisper Large-v3语音识别模型,但英伟达的团队对它进行了专门的微调,让它不只会识别语音,还能理解各种一般性的音频内容,比如音乐、环境声音等。

具体的工作流程是这样的:当你给Audex播放一段音频时,AF-Whisper会每30秒为一个窗口,把声音信号转化成一系列连续的数字向量,频率是每秒25个"快照"(对于30秒的音频,就产生750个快照)。然后,一个由两层神经网络构成的适配器,负责把这些快照转换成与文字信息同等"格式"的数字表示,送入Audex的核心大脑。这样一来,声音和文字在AI眼中就变成了同一种东西,可以无缝混合处理。

Audex的"嘴巴"部分则由两套独立的音频编解码器(codec)组成。可以把音频编解码器理解成一种"声音的压缩格式":它能把声音波形压缩成一串离散的数字编码(就像MP3压缩音乐),也能从这些编码反向还原出声音。

针对语音和非语音,Audex分别用了两套不同的编解码器,这个设计背后有很实际的考量。说人话(语音)的特点是信息密度高但音色变化相对单一,可以用更简洁的方式编码;而音乐、环境声音这类非语音内容,频率成分更复杂、细节更丰富,需要更细腻的编码方式。语音部分用的是X-Codec2,每秒50个编码单元,总词汇量65536个;非语音部分用的是X-Codec,也是每秒50帧,但采用了多层量化结构,每帧有4层编码,相当于每秒产生200个编码单元,总词汇量4096个。

这两套编解码器产生的编码,被直接追加到Audex原本的文字词汇表后面。换句话说,Audex看到的"词"不只是"你好"、"苹果"这样的汉字或英文单词,还包括成千上万个表示声音特征的特殊"符号"。当它生成回答时,可以直接输出这些声音符号,再经过解码器还原成真实的声音波形。

---

三、训练Audex的"食谱":数据和流程缺一不可

训练一个这样的多功能AI,需要的数据量是惊人的。英伟达团队总共整理了将近4亿条训练样本,涵盖音频总时长超过109万小时,音频编码共计1574亿个,文字编码共计3205亿个,合计超过4779亿个训练单元。

这些数据大致可以分成几个大类。首先是**文字对话数据**,这部分与训练Nemotron-Cascade-2时用的数据相同,包含推理、数学、编程、多语言对话、长文本理解等各类任务,共3.3亿条样本,文字编码3030亿个。

其次是**语音识别(ASR)数据**,也就是"听音频、写出文字"的训练数据,共9500万条样本,音频时长20万小时。为了让模型在嘈杂环境下也能工作,团队还专门生成了加噪声和加混响的版本,使用了真实的全频段噪声和房间脉冲响应(简单理解:模拟在不同房间里讲话时声音的变化效果)。

**语音翻译(AST)数据**共5800万条,涵盖多种语言翻译成英语的场景。值得一提的是,训练时的目标答案结构是"先说出源语言名称,再给出源语言转写,最后给出英语翻译",这让模型在翻译时会经历一个中间思考步骤,类似于人类先理解再翻译。

**文字转语音(TTS)数据**是数量最庞大的一类,共1.47亿条,音频时长42.1万小时,音频编码达758亿个。为了保证语音生成的稳定性,团队专门选定了一个由另一个AI模型(Tortoise)生成的"固定音色"作为输出目标,约占8%的TTS数据经过这个音色转换。

**文字转音频(TTA)数据**共1200万条,音频时长3.4万小时,专门针对"根据文字描述生成背景声、音效或音乐片段"的任务。

**音频理解数据**共4900万条,涵盖对各类音频的问答、描述和分类。

---

四、多阶段训练:像培养一个学生一样循序渐进

拥有了丰富的数据,怎么训练才能让模型既学会新技能、又不忘旧本领?英伟达团队设计了一套**多阶段监督微调(Multi-Stage SFT)**流程,思路就是"分科目学习、每科都不放松文化课"。

第一步,直接复用Nemotron-Cascade-2完成文字监督微调后的检查点。也就是说,Audex出发时已经是一个在文字上训练充分的成熟学生,而不是从零开始学。

第二步,**音频预热阶段**。此时模型的主体参数全部冻结不动,只允许训练新加入的两个部分:音频适配器(把声音信号转换成主模型能理解的格式的那两层神经网络)和新增的音频词汇表嵌入。值得注意的是,原有的文字词汇表嵌入被明确地冻结了。实验证明,如果在这个阶段也允许文字嵌入发生变化,文字能力会出现明显退步。

第三步,**音频生成监督微调阶段**。这一步解冻整个语言模型的参数,让模型学习"如何输出音频编码"这个全新的技能。同时,训练数据里依然保留了文字对话数据,比例约59%,以防止文字能力退步。在这个阶段,音频编码器和适配器不参与训练,因为这个阶段专注于输出能力,不涉及对输入的处理。

第四步,**音频理解+生成联合微调阶段**。在前一步的基础上,进一步解冻音频适配器,加入音频理解、语音识别、语音翻译等输入类任务的训练数据。音频编码器本体依然保持冻结。此时文字数据比例约69%。

团队也尝试了另一种更简洁的"单阶段合并训练"方案,把所有类型的数据一起丢进一个训练阶段。实验结果显示,这种方法在大多数指标上与多阶段方案相近,但有一个致命弱点:**长文本理解能力几乎完全崩溃**。在针对性测试中(NIAH测试,考察模型在百万字长文本中找到关键信息的能力),多阶段方案的分数是99.3/86.8(分别对应25.6万字和100万字长度),而单阶段方案的分数直接跌到6.0/0.0。研究团队认为,这是因为长文本的文字样本和长音频样本之间差异太大,同时学习会让注意力机制出现紊乱,而多阶段方案通过先把长文本能力练扎实、再逐步加入音频任务来避免了这个问题。

完成监督微调后,团队对30B-A3B版本的模型进一步应用了与Nemotron-Cascade-2完全相同的强化学习流程,包括指令跟随强化学习、多领域强化学习、多领域在线知识蒸馏(MOPD)、基于人类反馈的强化学习(RLHF),以及长文本强化学习。这个阶段**只在文字任务上做强化学习**,不涉及任何音频任务。令人欣慰的是,实验结果表明,文字强化学习对音频能力几乎没有负面影响,而文字能力则得到了显著提升。这说明英伟达之前在Nemotron-Cascade系列研究中发现的"级联强化学习抗遗忘特性"在音频-文字联合模型上同样成立。

---

五、一个关键技巧:分类器自由引导,让"听话"变得更好听

在音频生成领域,有一个经典技术叫做**分类器自由引导(Classifier-Free Guidance,CFG)**。用一个直觉来理解:假设你让朋友帮你买一束"明亮、热情的红玫瑰"。如果朋友既知道你想要什么(有条件),又知道一般随机买会买到什么(无条件),他就可以把两者的差距"放大",更精准地买到你真正想要的那种玫瑰。CFG的原理类似:在生成时,模型同时考虑"有提示词时的输出倾向"和"没有提示词时的输出倾向",然后将两者之差按一定比例放大,从而让输出更贴近提示词描述。

为了让Audex支持这一技术,团队在训练时随机选取10%的语音和音频生成数据,把其中的文字提示(比如歌词或音效描述)替换成随机长度的空白填充符,作为"无条件输入"样本。推理时,每生成一个音频片段,系统会同时跑一个有条件版本和一个无条件版本,将两者的预测概率按公式合并。

实验结果非常有说服力。对于文字转音频任务,CFG的引导强度(λ值)在3到5之间效果最佳;低于这个范围效果明显变差,高于这个范围同样变差。对于文字转语音任务,即使不用CFG,发音错误率(WER,越低越好)也已经很低;使用λ≈1.5时能进一步轻微改善,但提升有限,而且会把推理计算量翻倍。因此实际部署时,语音任务选择λ=1.5,音频任务选择λ=3。

同样值得关注的是温度和Top-k采样参数的差异:文字转音频任务最适合温度1.0、Top-k=80(较高的随机性,让输出更有创意和变化);文字转语音任务最适合温度0.1、Top-k=80(极低的随机性,确保语音内容准确忠实于文字)。这反映了两类任务在本质上的不同需求:生成音效需要多样性,语音朗读需要忠实性。

---

六、成绩单:Audex在各项考试中表现如何?

说了这么多训练方法,最终模型表现到底怎么样?

在**文字能力**方面,Audex-30B-A3B的成绩与其纯文字底模Nemotron-Cascade-2-30B-A3B基本持平,有些指标甚至略有超越。以数学竞赛题为例,在2025年美国数学邀请赛(AIME 2025)上,Audex得分91.2(搭配代码工具时达98.3),底模得分92.4(工具模式98.6),几乎没有差距。在另一项高难度数学竞赛HMMT Feb25上,Audex得92.2/93.8,底模得94.6/92.2,同样处于同一水平。在IMO AnswerBench(国际数学奥林匹克题库的答题测试)上,Audex反而以81.1分超过了底模的79.3分。在代码能力测试LiveCodeBench v6上,Audex得85.3/86.2,底模得87.2/88.4,差距非常小。

相比之下,竞争对手Qwen3-Omni-30B-A3B在与自己的纯文字底模Qwen3-30B-A3B-Thinking-2507对比时,AIME 2025得分从85.0降到73.7,HMMT从71.4降到60.4,退步明显。Qwen3.5-Omni-Flash同样比其底模Qwen3.5有不小的退步。这个对比充分说明了Audex在"学新技能不忘旧本领"这个核心目标上取得了真正的突破。

在**语音识别**方面,Audex在OpenASR英语语音识别排行榜上的平均词错误率为6.82%,优于Step-Audio-R1.1-33B的7.91%和Qwen3-Omni-30B-A3B-Thinking的8.00%,与Qwen3.5-Omni-Flash(仅公布了LibriSpeech部分数据)水平相当。在嘈杂环境语音识别测试中,Audex的平均词错误率2.92%同样优于多数竞争对手。

在多语言语音识别(德语、西班牙语、法语、意大利语、葡萄牙语、俄语、韩语七种语言平均)上,Audex的平均词错误率为5.11%,与Qwen3-Omni的4.27%(Instruct版本)有一定差距,但优于Step-Audio-R1.1的6.59%。在语音翻译任务上,Audex的BLEU分数34.0/COMET分数86.9,处于竞争性水平。

在**音频理解**方面,Audex在MMAU(多媒体音频理解)测试中得分75.6,处于行业前列;在MMAR和MMSU两个测试上分别为63.2和63.4,与最佳开源模型有一定差距。特别突出的是音频蕴含推理测试(Audio Entailment),Audex在Clotho v2和AudioCaps两个数据集上的平均分高达95.0,远超Step-Audio-R1.1的62.7(两项平均)和Qwen3-Omni的约65。这表明Audex在"判断一段声音是否符合某个文字描述"这类推理任务上具有特别强的能力。

在**文字转语音**方面,Audex在Seed-TTS-Eval英语测试集上的固定音色词错误率为1.70%,优于MiMo-Audio的5.37%,但略逊于Qwen3-Omni-30B-A3B-Instruct的1.39%。

在**文字转音频**方面,Audex在AudioCaps测试集上的OpenL3 Fréchet距离(这是衡量生成音频与真实音频"分布差异"的指标,越低越好)为66.9,在SongDescriber(音乐描述生成)上为62.7。这两个成绩优于或持平于此前最强的开源LLM类音频生成模型UALM(AudioCaps: 65.9,SongDescriber: 83.7),同时也明显优于所有扩散模型(Diffusion Model,比如Stable Audio Open在AudioCaps的得分是100.9,ETTA是80.1)。值得特别说明的是:Audex是这些对比模型中唯一一个同时具备强大文字推理能力的通用语言模型,其他模型大多是专门为音频生成而设计的。

在**语音交互**方面,Audex在BigBenchAudio测试(考察AI在语音对话中回答问题的能力)中得分90.0,超过了Qwen3.5 Omni Flash Realtime的59.0和MiMo-Audio的60.2,仅次于Fun-Realtime-Audiochat(97.6)、Step-Audio R1.1 Realtime(97.6)、Gemini 3.1 Flash(96.6)等商业实时语音系统。

---

七、一个有趣的细节:冻结文字词汇表嵌入为什么很重要?

在消融实验(也就是"把某个零件拆掉看看有没有影响"的实验)部分,论文揭示了一个特别有意思的细节。

在音频预热阶段,研究团队对比了三种方案。方案一:冻结原有文字词汇表的嵌入向量,只更新新增的音频词汇表嵌入(Audex实际采用的方案)。方案二:完全解冻,文字和音频词汇表嵌入都参与更新,同时加入文字训练数据。方案三:先用方案一,再改用方案二继续训练。

在预热阶段结束后,方案一在文字测试中的MMLU-Pro得分78.9、GPQA-Diamond 73.8、AIME 2025达到93.2。方案二的对应得分则跌至71.2、62.3、71.8,全线大幅下滑。方案三更糟,MMLU-Pro只有65.1,AIME 2025的结果甚至没能完成测试。即便在后续的音频生成微调阶段补充文字训练,方案二的曲线也一直低于方案一,无法追回。

这个结果的直觉解释是:语言模型的文字词汇表嵌入,是整个模型文字能力的"基础语义地图",一旦在早期被破坏,后续很难修复。将它冻结住,相当于保护这张地图不被音频训练信号误伤。

---

八、一个规模更小的版本:Audex-2B

除了30B-A3B旗舰版之外,论文还介绍了Audex-2B,一个使用20亿参数稠密Transformer作为语言模型底座的小型版本。Audex-2B使用与30B-A3B完全相同的数据配比和训练流程,但没有进行强化学习阶段(强化学习只应用于30B-A3B版本)。

Audex-2B在各项测试中的表现普遍低于30B-A3B版本,这是预料之中的。但它依然在多项指标上超过了一些规模更大的竞争对手。例如,在BigBenchAudio测试中得64.3分,超过了7B甚至更大规模的多个模型。在LibriSpeech干净语音识别上词错误率1.63%,与各种专业语音识别模型相比也属于有竞争力的水平。这说明Audex的训练框架本身就具备相当强的效率。

---

说到底,Audex这项研究最核心的贡献并不是某一项具体的能力,而是证明了一件事:用正确的架构设计和训练策略,完全可以让一个语言模型在学会听声音、说话、生成音乐和音效之后,依然保持原本的推理、知识和编程能力不退步。

这对于未来AI助手的发展有很现实的意义。如果你有一个既能听你说话、又能理解复杂指令、还能帮你写代码或解数学题的AI助手,你一定不希望它在学会"聊天语音化"之后就变笨了。Audex的研究路径,提供了一个可参考的工程方案。

当然,这项研究也有一些还未解决的方向。论文明确指出,目前只做了文字领域的强化学习,未来有潜力把强化学习扩展到音频-文字联合任务上,有望进一步提升音频相关能力。此外,文字转音频目前固定生成10秒的片段,可变长度生成尚未实现,这也是未来要解决的问题。

任何有兴趣深入了解技术细节的读者,都可以通过论文编号arXiv:2607.05196找到完整的技术报告,那里有更详尽的实验数据和方法说明。

---

Q&A

Q1:Audex模型开源了吗,普通人能用吗?

A:根据论文,英伟达已经发布了Audex-30B-A3B和Audex-2B的模型权重,供开放研究使用。感兴趣的研究者和开发者可以通过论文中提供的链接下载,但实际部署需要一定的GPU计算资源。

Q2:Audex和GPT-4o这类商业语音AI比,差距大吗?

A:在语音交互测试BigBenchAudio中,Audex得90分,而GPT Realtime系列得分在63到83之间,Audex实际上优于后者。但与Fun-Realtime-Audiochat(97.6分)和Step-Audio R1.1 Realtime(97.6分)这类专门做实时语音的系统相比还有差距。Gemini 2.5 Flash原生音频对话版本得分90.7,与Audex基本持平。

Q3:为什么多阶段训练比单阶段训练更好?

A:单阶段合并训练在大多数指标上与多阶段方案相近,但会导致长文本理解能力几乎完全崩溃,原因是长文本样本和长音频样本同时训练会干扰注意力机制。多阶段训练通过先稳固文字长文本能力、再逐步加入音频任务,有效避免了这一问题。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-