
这项研究由德国弗劳恩霍夫研究所(Fraunhofer IAIS)、达姆施塔特工业大学(Technische Universitat Darmstadt)、德国人工智能研究中心(DFKI)、维尔茨堡大学(Universitat Würzburg)、柏林工程与经济应用科学大学(Berliner Hochschule für Technik)、L3S研究中心等多家德国顶尖研究机构联合完成,并获得德国联邦经济事务和能源部(BMWE)资助。论文于2026年7月10日发布在预印本平台arXiv,编号为arXiv:2607.09424v1,归属于计算机科学·计算与语言(cs.CL)领域。整个项目由德国联邦人工智能协会(KI Bundesverband)统筹协调。
一、为什么欧洲需要"自己的大脑"
全球AI大模型的发展速度让人目不暇接,GPT、Llama、Qwen……一个接一个地涌现。但如果你仔细观察,会发现一个让欧洲研究者深感不安的现象:这些功能强大的模型,几乎都是美国或中国团队做出来的,训练数据和运算基础设施也都在欧洲以外。对于德国这样一个拥有强大工业和科研基础、对数据安全和法规合规高度敏感的国家来说,这不仅仅是技术问题,更是主权问题。
更具体地说,存在三个让研究者头疼的缺口。第一个缺口,是"开放"的真实含义。市面上所谓"开放"的模型,绝大多数只是公开了模型权重——也就是最终的参数文件,就像你拿到了一道菜的成品,却不知道食材来源、烹饪步骤和调料比例。研究者无法真正审计、复现或改进这些模型。第二个缺口,是语言代表性不足。大多数多语言模型要么以英语为绝对核心,要么试图同时覆盖几十种语言,结果每种语言都浅尝辄止。德语作为欧洲最大经济体的官方语言,在这些模型里的表现远不如其地位所应得的。第三个缺口,也是最直接影响实际部署成本的那个,是推理效率。当你要同时服务大量用户、处理超长文本时,传统的Transformer架构会随着文本长度增加而越来越慢——这就像一个图书管理员,每次找书都要把整个图书馆翻一遍,书越来越多,他就越来越慢。
正是为了同时填补这三个缺口,Soofi S 30B-A3B诞生了。
二、Soofi S是一个什么样的模型
要理解Soofi S的设计思路,不妨用一个大型餐厅厨房作为比喻框架,贯穿整篇文章。
传统的AI大模型就像一个超级大厨,无论做什么菜,都要把整个食谱库从头到尾翻一遍,菜越复杂、食谱越多,效率就越低。而Soofi S的设计更像一个高度分工的现代化厨房:专门有人负责记流水账(Mamba-2层),有几位主厨只在关键步骤出手(GQA注意力层),还有一大批各有所长的专项厨师按需调用(MoE专家层)。
从技术层面说,Soofi S采用的是"混合Mamba-Transformer专家混合"架构,直接沿用了NVIDIA公开发布的Nemotron 3 Nano参考设计。整个网络共有52层,其中23层是Mamba-2序列混合层,负责用固定大小的"记忆槽"高效处理长文本;23层是细粒度MoE层(专家混合层),每次处理一个词,只激活128个专家中的6个;剩下6层是分组查询注意力层(GQA),只有这6层会维护传统Transformer那种随文本长度增长的键值缓存。
模型总参数量约为31.6亿,但每次处理一个词只激活约32亿(含词嵌入约36亿)参数。这意味着Soofi S拥有一个300亿参数量级大厨房的"知识储备",却只需要动用一个30亿参数量级小厨房的"实际工作量"。更关键的是,由于绝大多数层(Mamba-2层)使用的是固定大小的循环状态而非随文本变长的缓存,整个模型在处理超长文本时,内存占用几乎不随文本长度增加。
研究团队之所以选择直接采用Nemotron 3 Nano的参考架构而不自己从头设计,出于三个非常务实的考量。其一,这个架构已经被主流推理框架(如vLLM)原生支持,模型一发布就能直接部署,无需用户额外做工程适配。其二,该架构在长文本、高并发场景下的效率优势已经得到充分验证。其三,与NVIDIA的Nemotron 3 Nano共享相同架构,意味着两个模型之间的性能差异可以完全归因于训练数据的不同,从而实现科学上的"受控实验"。
三、训练配方:从普通食材到精品料理
一个大模型的能力,很大程度上取决于它"吃了什么"——也就是训练数据。Soofi S的训练分为三个阶段,就像一道精心设计的多道菜晚宴:先上开胃菜打开胃口(多样化预训练),再来主菜精细烹饪(高质量退火),最后是一道特制的长桌料理(长文本扩展)。
第一阶段是"多样化预训练",共消耗约20万亿个词(token),相当于几十万本小说的文字量。这一阶段的数据来源极为丰富:英文网页数据(包括NVIDIA公开的Nemotron-CC系列,涵盖高质量网页、合成改写版本、多样化问答格式和翻译版本)占了最大份额约50.3%;学术与百科数据(论文、维基百科、PDF文档等)占约8%;代码数据(来自网页爬取的代码和代码仓库,包含五种合成变体:代码评审、问答、重写、师生对话和跨语言转译)占约14.6%;数学数据(从网页提取并保留LaTeX公式的数学内容)占约6%;推理与STEM数据占约10.4%;SFT格式的指令数据(已在预训练阶段就引入指令格式)占约3.5%;德语数据占约7.2%,显著高于参考配方中5%的多语言份额。
德语数据的来源非常多元:有质量过滤后的网页爬取数据(HPLT v3和v4,取前10%高质量文档)、德语公开文本(German Commons,约1546亿词的开放授权德语文本)、商业授权的Genios新闻数据库(来自916个德语报纸和行业媒体的1.931亿篇文章,涵盖2010-2025年,总计约576亿词,是本项目中唯一无法公开再发布的数据来源)、德语PDF文档和维基百科,以及机器翻译和合成德语数据(将高质量英文文档翻译成德语,或将英文推理链翻译成德语)。
高质量数据的处理方式也颇为讲究:高质量和合成版本会被重复训练多个轮次(epoch),相当于让厨师多次练习这道菜;而中等质量的大型数据池则被直接排除在外(epoch设为0),宁缺毋滥。
第二阶段是"高质量退火",共消耗约6.58万亿词。这一阶段相当于用最好的食材做一道精品料理:完全去掉低质量网页数据,只保留最高质量的网页内容(占36.4%);大幅增加代码(16.4%)、数学(5.2%)、推理(11.8%)和指令格式数据(8.5%)的比重;德语数据更是跃升至15.3%,是参考配方多语言份额的三倍以上。这一阶段新增的德语数据来源包括更新版的HPLT v4(取前10%高质量)和用KletterMix管道将ClimbMix数据集翻译成德语的大规模语料。
研究团队还在退火数据中加入了一个有趣的组件:25个标准英德NLP评测基准的训练集的改写版本,类似于OLMo 3等项目的做法——让模型在预训练阶段就见过这些题型的"变体",从而在评测时表现更稳。
第三阶段是"长文本扩展",共消耗约1006亿词,将模型可处理的最大文本长度从8192个词扩展到100万个词。这一阶段将约1885亿词的数据按文本长度分成9个桶(4K、8K、16K、32K、64K、128K、256K、512K、1M),确保模型见过各种长度的文档。七个领域的数据被纳入其中:通用网页(28.78B)、代码(9.51B)、数学(6.73B)、德语(6.68B)、通用SFT(31.25B)、代码SFT(29.24B)和数学SFT(76.31B)。值得注意的是,数学数据源不提供超过64K的文档,所以长文本桶主要由网页、代码和SFT数据填充。
四、厨房里的操作规程:训练超参数与动态过程
训练一个大模型,不仅仅是准备好食材,还需要精确控制烹饪过程——火候、时间、步骤。
Soofi S采用AdamW优化器(一种在神经网络训练中广泛使用的参数调整算法),学习率调度方案为"预热-稳定-衰减"(Warmup-Stable-Decay,WSD):先用254步的线性预热将学习率从0提升到峰值1e-3,然后在整个20万亿词的基础预训练阶段维持这个峰值(稳定平台期),进入退火阶段后按照minus_sqrt曲线从1e-3衰减到1e-5,之后再以1e-5的固定学习率继续训练约158万亿词(常量退火),最后尝试了一个从1e-5降到0的最终退火阶段,但该阶段的检查点没有带来明显的基准提升,研究团队选择放弃。
每个优化步骤处理25,165,824个词(批大小3072、序列长度8192、张量并行度1、专家并行度8的组合结果)。训练全程使用bf16混合精度,每101次迭代触发一次手动垃圾回收。
整个训练过程的动态曲线非常稳健:损失函数在稳定训练阶段平稳下降,进入退火阶段因切换到高质量数据而出现明显的快速下降;梯度范数全程稳定,退火阶段略有上升但没有出现任何发散或异常尖峰;训练吞吐量全程稳定(约10-12百万词/秒),偶尔的下降对应于保存检查点和评测操作。
整个训练在德国慕尼黑的"工业AI云"基础设施上完成,该设施由德国电信(Deutsche Telekom)与NVIDIA合作运营,于2026年2月正式投入使用。Soofi S是这个平台上的首批旗舰工作负载之一。训练使用了512块NVIDIA B200 GPU(64个DGX B200节点,每节点8块GPU),节点内通过第五代NVLink/NVSwitch全连接,节点间通过8轨NVIDIA Quantum-2 NDR InfiniBand网络互联(每GPU 400Gb/s带宽,每节点3.2Tb/s对外带宽)。将专家并行组保持在节点内,使得MoE的全转发通信(all-to-all)走的是节点内NVLink而非较慢的节点间网络,对整体吞吐量至关重要。整个训练从2026年3月24日持续到5月13日,共消耗约253,000 B200 GPU小时。
该数据中心完全由可再生能源供电,采用从附近Eisbach运河取水的水冷系统,并将余热接入周边Tucherpark区域供暖系统——研究团队特别提到这一点,以强调主权模型不仅是数据和计算的主权,也包括对可持续性的承诺。
五、真正的"透明厨房":数据开放与溯源
Soofi S最与众不同的地方,也许不是它的性能,而是它的透明度。
大多数大模型的数据信息就像餐厅的秘密配方,最多告诉你"用了多少食材",却不说食材来自哪里、怎么加工的。Soofi S的团队则做了一件在AI领域非常罕见的事:把每一个数据源的名称、原始词数、训练轮数、有效词数、在每个阶段的比例全部公开,连"考虑过但最终没用"的数据源也逐一列出并说明原因。
整个26.68万亿词的训练数据中,绝大多数来源都是公开可获取的——NVIDIA的Nemotron-CC系列、Dolma 3、FinePDFs、ClimbMix、SwallowCode、UltraData-Math、AceReason、HPLT、German Commons、KletterMix等。唯一的例外是商业授权的Genios数据库,占第一阶段有效词数的约1.3%。对于Genios,研究团队公开了完整的统计信息(916个德语出版物来源、1.931亿篇文章、约576亿词、覆盖2010-2025年,以及按年份的文章数量分布),但不能再发布原始文本。研究团队明确声明:在OSI的开放源代码AI定义1.0(OSAID 1.0)框架下,Soofi S满足开放要求;但在要求所有训练数据均可再发布的更严格欧洲开放标准下,由于Genios的存在,约99%的数据可被独立重建,还差最后那1.3%。研究团队选择明确说明这个边界,而不是模糊处理或虚报开放程度。
除数据透明度外,研究团队还公开发布了完整的训练代码(GitHub上的Soofi-Pretraining仓库)、评测代码(base-eval和eval-hive两个仓库),以及完整的超参数设置、学习率调度、各阶段词量预算,和一个可以实时追踪训练动态的Weights & Biases公开看板。模型权重、部分中间检查点也将在HuggingFace的Soofi-Project主页上发布,全部采用开放友好的许可证。
六、德语+英语双语冠军:评测表现
接下来是最直接的问题:这个模型到底好不好用?
研究团队使用统一的评测框架(lm-evaluation-harness),在同样的提示词、同样的少样本设置下,对17个开放基础模型进行了横向对比,涵盖代码、数学、知识、推理、科学、阅读理解和德语语言能力等维度,既有英文评测也有德文评测,部分基准是在任何消融实验中都没有用到的"保留集",以确保评测的公正性。
在"全开源"模型对比组中(Alia 40B、EuroLLM 22B、Apertus 70B、OLMo 3 32B),Soofi S在几乎所有维度上都排名第一。英文综合分70.1,比次优的OLMo 3 32B高2.8分;德文综合分79.1,比次优的Apertus 70B高6.3分;保留英文集41.4,比次优高8.3分;保留德文集41.8,比次优高5.6分。代码生成方面,Soofi S在HumanEval(73.8%)、MBPP(70.2%)、HumanEval-DE(65.5%)、MBPP-DE(84.2%)四项上均排第一,只有防污染代码评测LBPP(31.0%)略逊于OLMo 3 32B(32.1%)。数学方面同样全线第一:GSM8K 86.1%,GSM8K-Platinum-DE 87.1%,Minerva-500 79.4%,Minerva Math-EN 81.0%,Minerva MATH-DE 56.0%,部分超出次优20分以上。知识与推理方面,MMLU-STEM 75.9%,MMLU-Pro 51.4%,INCLUDE-DE(专门测试德国本土知识的基准)61.2%,BBH 78.8%,GPQA-Diamond(研究生级别科学题)43.4%,GPQA-Diamond-DE 41.9%,ARC-Challenge 90.6%,均排第一。德语能力方面,GLP-DE(德语语言水平)88.8%,ARC-Challenge-DE 92.3%,全部第一,部分领先次优10分以上。
在"开放权重"模型对比组中(Nemotron 3 Nano 30B-A3B、Qwen3.5 35B-A3B、Ministral 3 14B、Gemma 3 27B),Soofi S的综合成绩与密集参数量14-27B的大模型相当,仅以30亿活跃参数实现了这一水平。Qwen3.5 35B-A3B在英文综合(74.6%)、德文综合(81.6%)和保留集上仍是最强,但Soofi S在代码生成(HumanEval第一、MBPP第一、MBPP-DE第一)和德语专业知识(INCLUDE-DE与Qwen并列第一)上仍有突出优势。最重要的对比是与架构完全相同的Nemotron 3 Nano:Soofi S的英文综合提升1.8分,德文综合提升4.2分,保留英文集提升6.7分,保留德文集提升2.0分,GLP-DE(德语语言水平)大幅提升15.1分,INCLUDE-DE提升1.5分,GPQA-Diamond提升9.6分,代码英文综合提升2.2分,CommonsenseQA提升5.1分——这些提升几乎完全可以归因于德英双语的数据配方,而非架构差异。代价方面,德语竞赛数学(Math-DE综合)下降1.4分,开放域事实问答(NaturalQuestions)下降1.3分,GSM8K小幅下降0.4分,这些是德语数据占用了部分英文知识容量的合理代价。
研究团队特别诚实地披露了一个评测中遭遇的重大问题:初始评测配置在Minerva数学题上使用了"\n\n"作为停止符号、生成上限1024个词,导致模型的长链式推理被截断,得出的分数极低(Soofi S仅9.8分,Nemotron仅5.6分)。修正为不设停止符、生成上限4096词后,成绩才恢复到正常水平(79.4和81.0)。这种主动披露评测bug的做法,在AI研究界并不常见。
七、最强的实际部署优势:长文本、高并发下的速度
如果说评测分数决定了一个模型"会不会",那么推理效率决定的是"够不够用"。
研究团队用一个非常务实的指标来量化效率:在单块NVIDIA B200 GPU上,批处理32个请求,以不同输入长度运行时,每秒能生成多少个词(TPS/GPU)。他们用"延迟相减法"将推理延迟分解为预填充(处理输入)和生成(逐词输出)两部分,重点关注生成阶段的吞吐量,因为这才是实际服务成本的主要来源。
结果非常惊人。在40K词的上下文长度、批大小32的条件下,Soofi S达到4820 TPS/GPU,是Ministral 3 14B的9.2倍,是EuroLLM 22B的8至9倍,是OLMo 3 32B的类似倍率。更关键的是,随着上下文长度从4K增长到256K,Soofi S的生成速度几乎完全不变(从4290 TPS/GPU到4300 TPS/GPU,变化不超过34%);而传统密集Transformer模型的速度则随上下文增长急剧下降——Qwen3 32B全密集版的256K速度测量耗时6428秒,而Soofi S仅需373秒完成同样测量。
这种优势的根源在于Soofi S的架构:在52层中,只有6层GQA层会维护随文本长度增长的键值缓存,每个词的缓存增量仅约6KB;而典型密集模型的缓存增量是Soofi S的11到53倍。Mamba-2层使用的循环状态是固定大小的,完全不随文本长度增长。
有趣的是,同样采用混合架构的Qwen3.5 35B-A3B也展现出类似的平稳扩展特性,但其每秒速度仅为Soofi S的一半左右(2600 TPS/GPU vs 4820 TPS/GPU)。研究团队分析认为,这是因为Qwen3.5使用了Gated DeltaNet混合层,其9B版本中8/32层为全注意力层,键值缓存增量约32KB/词,是Soofi S的5.3倍。
在首次生成时间(TTFT,即模型处理完所有输入开始输出第一个词所需的时间)方面,Soofi S在40K上下文下达到22.7秒,而Ministral 3 14B需要71.9秒,Gemma 3 27B需要92.9秒,OLMo 3.1 32B需要101.7秒,Qwen3 32B全密集版需要213.4秒。
八、这项研究的局限性和未来方向
研究团队同样坦诚地指出了三个明确的局限性。第一是德语竞赛数学:尽管德语小学数学(GSM8K-Platinum-DE 87.1%)已与参考模型相当,但德语竞赛数学(Minerva MATH-DE 56.0%)仍比Qwen3.5 35B-A3B(76.5%)和Gemma 3 27B(65.6%)差得较多。这可能是因为高质量的德语数学推理数据仍然稀缺。第二是开放域事实记忆:NaturalQuestions(79.0%)略逊于最大密集模型(Gemma 3 27B 83.5%),这与Soofi S每次只激活30亿参数有关——能"装进脑子里"的世界知识自然有上限,但研究团队认为检索增强部署可以弥补这一点。第三是长文本聚合任务:在RULER长文本评测中,Soofi S在常见词提取(CWE)这类需要聚合整篇文档中最频繁词语的任务上,超过32K后性能急剧下降(256K-1M时仅约3%,而参考模型为60-64%)。研究团队将此归因于长文本数据配方中缺少专门针对聚合类任务的合成数据,计划在下一版本的长文本数据管道中专门补充。
未来工作方向上,研究团队计划沿三条线继续推进:一是对Soofi S进行开放式后训练(指令微调和大规模强化学习),推出指令版和推理增强版;二是构建更宽泛、更深入的德语评测体系;三是持续扩大高质量德语数据管道,因为这被认为是进一步提升性能的核心瓶颈。
说到底,Soofi S代表的是一种新的可能:一个国家或地区完全可以自己建造、完全控制、完全透明、真正好用的AI大模型。它不是一个遥遥领先的技术奇迹,而是一个精心工程化的"已经够用且完全自主"的存在。对于欧洲的研究者、开发者和企业来说,这个模型最有价值的地方也许不是它在某张榜单上的排名,而是它背后那套可以被审计、被复现、被信任的完整开放配方。
有兴趣深入了解的读者可以通过arXiv编号arXiv:2607.09424v1查阅完整论文,或访问HuggingFace上的Soofi-Project主页获取模型权重和相关资源。
Q&A
Q1:Soofi S 30B-A3B在实际部署中比普通大模型快多少?
A:在40K词上下文、批处理32个请求的条件下,Soofi S每秒可生成约4820个词/GPU,比同规模的Ministral 3 14B快9.2倍,且随上下文从4K增长到256K,速度几乎不变。这是因为模型只有6层传统注意力层,其余层使用固定大小的循环状态,内存占用不随文本变长而增加。
Q2:Soofi S的德语能力有多强,真的比Apertus 70B还好吗?
A:在全开源模型对比中,Soofi S的德语综合评分79.1,比参数量是它两倍多的Apertus 70B(72.8)高6.3分,在德语语言水平、德语代码、德语数学、德语区域知识等专项评测上均排名第一。相比架构完全相同的Nemotron 3 Nano,Soofi S的德语综合分提升4.2分,德语语言水平(GLP-DE)提升15.1分。
Q3:Soofi S的训练数据是否完全公开,Genios数据库是什么?
A:约99%的训练数据来自公开可获取的来源,并已完整披露每个数据源的名称、词数和配比。唯一例外是Genios数据库,这是一个覆盖916家德语报纸和行业媒体、含1.931亿篇文章的商业授权语料库,占第一阶段约1.3%的数据,研究团队公开了其统计信息但因版权无法再发布原文。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。