
你可能已经习惯了这样的场景:打开一个AI绘图工具,输入一句话就能生成图片,再输入一句"把背景换成夜晚",图片就真的变了。GPT-4o、Nano-Banana这些名字背后,代表的是一种新常识:图像生成早就不是单纯的"画图"任务了,它变成了一个统一的接口,既能看懂内容,又能画出内容,还能按照你的指令改内容。
但如果你把同样的期待放到三维世界呢?
答案是:目前还做不到。这不是因为研究者不想做,而是三维数据这件事本身就比图片难太多。一张图片,互联网上有几十亿张,配上文字描述几乎是白捡的。但一个三维模型呢?建模师做一个像样的模型可能要花几个小时甚至几天,愿意公开分享的更是少之又少,能配上精确文字描述的就更稀缺了。所以直到现在,三维领域里的"理解模型"(负责看懂物体是什么)、"生成模型"(负责凭空造出物体)、"编辑模型"(负责按指令修改已有物体),基本上还是三个互不来往的独立系统,各自为战。
腾讯混元这次想解决的,正是这个问题。他们发布的Hunyuan3D-Buffalo 1.0试图用一套架构同时搞定三维理解、文本生成三维、指令编辑三维、以及按文字提取部件这四件事。而这背后最大的拦路虎,其实不是算法,是数据。
数据荒漠里挖井:一个8700万样本的三维语料库
如果你去问任何一个做过大模型的人,"这个项目最难的部分是什么",十有八九得到的答案是"数据"。三维领域尤其如此。
论文里提到一个很扎心的数字对比:现有的3D编辑数据集Nano3D只有大约10万样本,Omni123大约100万样本,而腾讯这次构建的编辑数据集达到了1200万样本,是Nano3D的100倍,是Omni123的12倍。整个训练语料库加起来是8700万个样本,包括2500万条理解类样本、5000万条文本到三维的配对、以及1200万条编辑配对。
**数据规模的差距不是量的问题,而是质变的门槛。**
这就像是学做菜,如果你的师傅只带你炒过10道菜,你顶多学会应付这10道菜的变化;但如果师傅让你炒过1000道菜,你才可能真正理解"火候"和"调味"这些抽象的东西,面对没见过的食材也能上手。三维编辑模型如果只见过几万个编辑案例,很容易死记硬背,换个稍微不一样的物体就露怯;但见过1200万个案例之后,模型才有可能真正学到"编辑"这件事的通用规律。
那么这1200万条编辑数据是怎么来的?这里要引入这篇论文里一个核心的技术名词。
Nano3D-v2*:一套自动化的、基于AI智能体的3D编辑数据生产流水线,它的前身是Nano3D,专门用来把一个原始三维模型和一句编辑指令,转换成一对高质量、几何一致的"编辑前-编辑后"三维资产。
要理解Nano3D-v2为什么要设计成这么复杂的多阶段流程,得先看看之前的方法有什么问题。
第一类老方法是"2D编辑再提升为3D",比如先用2D扩散模型把图片编辑好,再靠多视角重建把编辑结果还原成三维模型。这个思路的毛病在于,2D图片和3D模型之间没有严格的对应关系,编辑完之后经常出现"身份漂移",也就是编辑完的模型看起来已经不是原来那个物体了,或者出现几何幻觉,凭空多出些不存在的结构。
第二类方法引入了显式的三维空间约束,比如Nano3D的第一代和VoxHammer,它们只允许在一个局部三维区域内做修改,这样能更好地保留没被编辑的部分。但这类方法也有毛病:VoxHammer需要人工手动指定要编辑的三维框,这在大规模自动生产数据时完全行不通;而Nano3D第一代用的是启发式的区域估计方法,遇到很小、被遮挡、或者需要多角度才能看清的编辑目标时,经常定位不准。
Nano3D-v2的做法是引入一个专门训练出来的定位模型,来精确预测编辑区域的三维位置,同时增加了一整套精细化的几何和纹理修复流程。
具体来说,整个流水线分成五个阶段。第一阶段是"锚点视角选择",先给三维物体渲染出8个不同角度的画面,用一个视觉语言模型判断哪个角度最适合展示这次要做的编辑,然后用Qwen-Image在这个角度的图片上完成2D层面的编辑。
视觉语言模型*(VLM,Vision-Language Model):一种既能理解图像内容又能理解文本内容的AI模型,可以回答关于图片的问题,或者根据图片和文字指令做出判断。
第二阶段叫"编辑规划",通过比较编辑前后的锚点图片,算出一个像素级的差异掩码,再用一个自回归Transformer模型,把这个2D差异信息转换成精确的三维编辑区域框。这个框内的部分才允许被修改,框外的一律保持原样,相当于一道硬性的空间约束。
第三阶段是"体素编辑",也就是在三维体素表示的层面完成粗粒度的修改。这里用到了TRELLIS的体素Transformer结合FlowEdit采样技术,同时会把框外被误改的体素替换回原始状态,防止全局走样。
第四阶段是"精细几何和纹理编辑",因为体素级别的分辨率不够精细,容易出现过度平滑的问题,所以引入了LATTICE模型做子体素级的几何修补,让编辑边界和原模型无缝衔接,同时用专门的纹理生成模型做纹理层面的修补。
第五阶段是"编辑对标注和过滤",这一步很关键,因为前面几步生成出来的原始数据其实是有噪声的,有些编辑后的模型结构是破损的,原始的用户指令也常常模糊或者和实际发生的几何变化对不上。这个阶段用视觉语言模型重新审视每一对编辑前后的模型,判断结构是否完整,重新提炼出精确的编辑指令,并从结构完整性、指令对齐度、区域一致性、视角可见性四个维度做最终验证,不合格的直接丢弃。
**这套流程本质上解决的是一个信任问题:怎么让机器自动生产的数据也能达到人工标注的可靠程度。**
如果没有第五阶段的过滤,那前面辛辛苦苦生产出来的1200万条数据里必然混杂着大量残次品,模型学了这些残次品反而会学坏。这就好比工厂流水线生产零件,如果没有最后的质检环节,前面工序再精细,出厂的产品照样会有瑕疵品混进去,而且规模越大,瑕疵品的绝对数量也越大,越需要一道靠谱的把关工序。
除了编辑数据,文本到三维的数据构建也走了一套五阶段的自动化流程:先建立一个四层的提示词分类体系(生成模式、大类、子类型、具体实例),再合成组合式的提示词,然后用图生3D的模型把提示词变成实际的三维资产,接着用视觉语言模型给每个资产打上六种不同详细程度的文字描述并打出一个0到10分的几何质量分数,最后按分数过滤,只保留最干净的高质量资产。最终得到了大约5000万条高质量的文本到三维配对数据。
至于三维理解数据,则是把点云和各种对话式的问答、描述、定位、编辑指令合成任务打包在一起,大约2500万条,其中包括3D描述、3D问答、3D空间定位(用量化的边界框坐标表示)、编辑指令生成、以及编辑结果描述这五类任务。
Hunyuan3D-VLM:让模型真正"看懂"三维物体
有了数据,接下来的问题是怎么让模型理解三维物体。这里引出这篇论文的另一个核心贡献。
Hunyuan3D-VLM*:一个专门为三维物体设计的视觉语言模型,能做细粒度的语义、结构、空间理解,包括物体级别的描述、部件级别的问答、三维空间定位、编辑指令生成、编辑结果推理。
这个模型有个挺巧妙的设计,就是给同一个三维物体准备了两条并行的信息通路。一条叫结构通路,处理的是XYZ坐标和表面法线这些几何信号,专门捕捉物体的形状、空间布局、部件边界;另一条叫语义通路,处理的是RGB颜色信息,用来区分那些几何形状相似但外观不同的部件。
这个设计想解决的问题其实挺直观:一把塑料椅子和一把木头椅子,几何形状可能一模一样,唯一的区别就是颜色和材质。如果只靠几何信息判断,模型根本分不清这是两种不同的椅子;但如果只靠颜色信息,模型又抓不住形状结构这些更本质的东西。**两条通路各管一段,缺一不可。**
这就像是医生看病,光看CT片子(结构信息)能发现骨骼、器官这些硬性结构的问题,但光看CT看不出皮肤颜色是否发黄、嘴唇是否发紫这些外观线索;而光靠肉眼观察外观(语义信息),又诊断不出骨折或者内脏移位。两种检查手段结合起来才能给出准确诊断,缺了任何一种都容易误判。
为了支持精确的三维空间定位,Hunyuan3D-VLM还给词表里加了133个特殊符号。其中有三个符号专门用来标记点云序列的起止位置,剩下的用来表示三维边界框,包括框的起止符号,以及128个离散的坐标标记(从0到127),每个边界框最终会被表示成六个量化坐标数字加上首尾标记的形式。这样一来,物体定位这件事就被转化成了一个"预测一串数字符号"的问题,和文本生成用的是同一套机制,不需要额外设计特殊的输出结构。
在评测环节,Hunyuan3D-VLM在UniPart-Bench基准上和GPT4Point、PointLLM、ShapeLLM、ShapeLLM-Omni、Part-X-MLLM、UniVerse3D这几个代表性的三维多模态模型做了对比。
结果显示,Hunyuan3D-VLM在部件理解问答任务上拿到了85.47的SBERT分数和89.06的SimCSE分数,明显超过此前表现最好的UniVerse3D(83.11和87.16)。在整体物体描述任务上差距更大,Hunyuan3D-VLM达到72.94的SBERT和52.84的ROUGE-L,而UniVerse3D是65.18和44.17。这说明这个模型不管是回答关于局部部件的细节问题,还是描述整个物体的宏观特征,都做得更准确、更流畅。
把"理解大脑"和"生成引擎"接起来:Hunyuan3D-Buffalo的整体架构
理解模型有了,接下来的问题是怎么把理解能力转化成生成和编辑能力。这需要把Hunyuan3D-VLM和另一个生成模块连接起来。
3D-DiT*:三维扩散Transformer,这里初始化自Hunyuan3D-2.1,专门负责把语义信息转化成实际的三维几何结构,是整个系统里真正"画出"三维模型的那个引擎。
Hunyuan3D-VLM扮演的是语义理解的角色,而3D-DiT扮演的是生成合成的角色。这两者之间通过一个轻量级的MLP连接器桥接,把VLM产生的高层语义特征,转换成扩散模型能理解的条件信息,让高层的语言推理能够指导底层的三维生成过程,同时不破坏3D-DiT原本已经学到的生成先验。
这个设计思路挺像团队分工。理解模型好比是懂业务的产品经理,负责搞清楚用户到底想要什么;生成模型好比是执行力强的工程师,负责把需求变成实际产品。两者之间需要一个翻译层,把产品经理的自然语言需求转换成工程师能直接执行的技术规格。如果没有这个连接器,你要么得让工程师自己去理解模糊的用户需求(容易理解偏),要么得让产品经理自己去写代码(干不了),中间的桥接层省不掉。
对于编辑和部件生成任务,架构上还有一个特别的设计,就是让扩散过程同时依赖两个条件:一个是VLM产生的语义信息,另一个是原始物体本身的三维表示。具体做法是把源物体的三维表示和加噪声的潜在特征图拼接在一起,作为3D-DiT自注意力层的输入。这样模型在做去噪的每一步时,都能直接看到原始的几何结构,从而既能精确修改指定的目标部位,又能忠实保留没被编辑的区域。
值得一提的是,论文里把"部件生成"这个任务处理成了"编辑"的一种特例,编辑操作和部件提取操作走的是完全相同的数据准备和训练流程,唯一的区别是编辑要修改的目标区域是被指令指定的部位,部件生成要提取的目标区域就是那个部件本身。这种统一处理让整个系统不需要为部件生成单独搭一套流水线。
整个训练过程分成四个阶段。第一阶段先单独训练三维视觉语言模型,让它先学会理解,分为对齐阶段(只训练三维token的连接组件)和指令微调阶段(解冻整个模型联合训练多种理解任务)。第二阶段是文本到三维的预训练,把VLM和3D-DiT接起来,在5000万条文本资产配对数据上训练。第三阶段是全任务联合预训练,文本生成任务和编辑加部件生成任务的采样比例设成1比1,因为编辑数据量比生成数据量小得多,所以编辑和部件生成数据要重复采样4次才能在每个批次里跟生成数据量持平。第四阶段是分任务的继续预训练,编辑和部件生成阶段仍然混入一半的文本生成数据以保持生成质量,纯文本生成任务则专注训练文本生成数据。
编辑效果实测:一个86.7%的降幅意味着什么
光说架构设计还不够,真正说服人的是数据。论文在Edit3D-Bench这个基准上对比了ShapeLLM-Omni、3DEditFormer、Tailor3D、Steer3D、Omni123这几个代表性的三维编辑方法。
评测用了两个指标,一个是倒角距离(Chamfer Distance,越低越好,衡量生成模型和真实目标模型之间的几何差异),一个是F1分数(越高越好,衡量整体的匹配精度)。
| 方法 | 增加操作CD↓ | 增加操作F1↑ | 移除操作CD↓ | 移除操作F1↑ | 平均CD↓ | 平均F1↑ |
|---|---|---|---|---|---|---|
| ShapeLLM-Omni | 0.2546 | 0.0877 | 0.2237 | 0.1166 | 0.2392 | 0.1022 |
| 3DEditFormer | 0.1676 | 0.1955 | 0.1342 | 0.1836 | 0.1509 | 0.1896 |
| Tailor3D | 0.1661 | 0.1217 | 0.1755 | 0.1352 | 0.1708 | 0.1285 |
| Steer3D | 0.1404 | 0.2414 | 0.0976 | 0.3044 | 0.1190 | 0.2729 |
| Omni123 | 0.0736 | 0.1743 | 0.0632 | 0.2259 | 0.0684 | 0.2001 |
| Hunyuan3D-Buffalo(CLIP版) | 0.0154 | 0.5657 | 0.0162 | 0.7015 | 0.0158 | 0.6336 |
| **Hunyuan3D-Buffalo(3D-VLM版)** | **0.0127** | 0.5610 | **0.0054** | **0.7420** | **0.0091** | **0.6515** |
和之前平均CD表现最好的Omni123(0.0684)相比,Hunyuan3D-Buffalo的3D-VLM版本把平均CD降到了0.0091,相对下降了86.7%。这个数字换成大白话就是:编辑出来的模型和标准答案之间的几何误差,缩小到了原来的七分之一还不到。
**如果说过去的方法编辑完还有明显的"缝合痕迹",那这次的差距已经是数量级的进步。**
表格里还藏着一个很有意思的细节,就是拿CLIP版本和3D-VLM版本做了对比。CLIP*:一种通用的图文对齐模型,能把图片和文字映射到同一个语义空间里进行比较,常被用作视觉理解的基础组件。
3D-VLM版本比CLIP版本的平均CD进一步从0.0158降到了0.0091,F1从0.6336提升到0.6515。这说明专门为三维设计的理解模型,确实比通用的图文理解模型更懂得怎么定位编辑区域、怎么解读指令,这个差距虽然看起来不算特别大,但足以说明"三维专属理解"这件事是有真实价值的,不是白折腾。
在文本到三维生成任务上,论文做了一个人类评测实验,找来100条覆盖各种物体类别和描述长度的提示词,让四个模型(TRELLIS、Universe3D、Omni123、Hunyuan3D-Buffalo)匿名对比,参与者从文本对齐度、几何质量、总体偏好三个维度选出最好的结果。
| 模型 | 文本对齐 | 几何质量 | 总体偏好 |
|---|---|---|---|
| Universe3D | 8.2 | 7.4 | 8.3 |
| TRELLIS | 14.9 | 12.4 | 14.4 |
| Omni123 | 17.5 | 21.0 | 18.4 |
| **Hunyuan3D-Buffalo** | **55.2** | **57.1** | **56.6** |
四选一的随机基准线是25%,而Hunyuan3D-Buffalo在三个维度上都拿到了超过一半的偏好率,是排名第二的Omni123的三倍还多。这个差距不是靠某个特定子集撑起来的,论文里特意提到这个排序在每个参与者身上都保持一致,也同时适用于短标签式的提示词和长篇细致的描述,说明优势是普适的,不是运气好碰上了几个特例。
训练数据规模:从300万到5000万,效果是怎么涨上去的
论文里做了一个数据规模的消融实验,对比了用300万、1500万、5000万样本预训练出来的三个模型版本,同样用人类评测的方式打分。
| 训练样本量 | 文本对齐 | 几何质量 | 总体偏好 |
|---|---|---|---|
| 300万 | 9.9 | 8.8 | 8.4 |
| 1500万 | 28.8 | 29.0 | 28.6 |
| **5000万** | **54.5** | **57.4** | **57.5** |
这里三选一的随机基准线是33.3%。可以看到,随着数据量从300万涨到1500万再到5000万,总体偏好从8.4%一路涨到57.5%,而且是相当规整的单调递增,没有出现"涨到某个点就饱和"的迹象。
**这意味着目前的性能天花板还没触及,继续加数据大概率还能继续提升。**
这对做研究的人来说其实是个既让人兴奋又让人有点无奈的消息:兴奋的是路子走对了,继续投入就有回报;无奈的是数据这道坎还得继续爬,不能指望靠更巧妙的算法一步登天绕过去。
论文还专门做了一个很直观的实验来验证生成能力和编辑能力之间的关系。他们训练了两个模型,模型A是基础版本,指令"把头换成鸡头"时效果不理想;模型B只是在文本生成任务的训练数据里加了1000条鸡的图片样本,没有增加任何新的编辑数据,结果编辑效果就明显变好了,成功把头替换成了鸡头。
这个实验揭示了一个之前不容易想到的规律:**三维编辑能力从根本上依赖强大的文本生成能力打底,如果生成模型本身没见过某个概念,编辑模型也编辑不出这个概念。**
这就像让一个从没见过长颈鹿的画家去给一幅画"添加一只长颈鹿",无论指令多么清晰、编辑技巧多么娴熟,画家脑子里没有长颈鹿的样子,画出来的东西肯定不对。如果不先让画家见过足够多的长颈鹿图片,光靠改进"如何添加"的技巧是没用的。因为构建文本生成数据的成本远低于构建编辑数据,这个发现指出了一条更省力的路:与其死磕昂贵的编辑数据构建,不如先把生成能力的覆盖面尽量做大做全。
部件生成:把"分割"也当成一种生成任务
除了编辑,这套系统还支持一个挺新颖的功能,就是按文字指令提取三维物体里的某个部件,比如输入"提取自行车上的车轮",就能单独得到车轮的三维模型。这个思路借鉴自图像领域的一个发现。
Vision Banana*:一项研究表明,把密集感知任务(比如语义分割、实例分割、指代分割)当成条件生成问题来做,能取得很好的零样本迁移效果,也就是说图像生成模型可以当作一个处理各种视觉任务的通用接口。
这套思路搬到三维领域,意味着"分割"这件事不再需要单独设计一套专门的几何处理模块,而是变成了统一的三维大语言模型里的一个指令跟随子任务,用自然语言表达(比如"分割出车轮")就能触发。
但实操起来有个麻烦事,就是现成的三维部件数据集普遍存在标注质量问题。像HY3D-Bench这样的数据集,提供的只是原始网格层面的部件切分,这些切分往往是建模或导出过程中自然产生的几何碎片,没有语义标签,而且经常出现"过度切分"的情况,一个语义上完整的部件(比如一个轮子)可能被拆成好几个互不相连的网格碎片,导致每个碎片单独看都太小或太模糊,没法用一个清晰的名词去指代它。
为了解决这个问题,论文设计了一个语义网格合并工具,分三步走。第一步是语义部件词表发现,给物体渲染多个视角的图片,让视觉语言模型总结出一组有意义的部件概念(比如车轮、机翼、把手),构成这个物体专属的词表。第二步是组件到部件的对应和合并,给每个原始网格碎片渲染红色高亮的视图,让视觉语言模型判断这个碎片属于词表里的哪个部件概念,属于同一概念的碎片就被归并成一个"宏观部件"。第三步是质量过滤和指令打包,重新渲染每个合并后的宏观部件,验证是否匹配预期概念、是否形成一个连贯的整体、视觉上是否自然,只保留通过检验的干净样本,最终转换成"分割出车轮"、"移除车轮"这样的指令微调数据。
**这套工具本质上是在给杂乱无章的几何碎片重新贴上人话能理解的标签。**
这有点像整理一堆散落的乐高积木。如果积木已经被拆散成了几百个零件,你很难直接指着某一块说"这是车门",因为一块积木本身不构成任何有意义的整体;但如果先把这些零件按照它们组合成的部件重新归类打包,你才能指着一堆积木说"这是车门部分",然后才谈得上单独把车门拿出来或者替换掉。
从展示的例子来看,这套部件生成能力覆盖面相当广,既能处理章鱼这种结构复杂的生物形态,也能处理车轮这种几何简单的机械部件,提取出来的部件几何保真度都很高,多个部件提取出来后还能重新组装成完整的分解展示。
论文没回避的问题:六个尚未解决的难题
这篇论文的结尾部分挺坦诚,专门列出了六个当前还没解决的问题,这在很多论文里是不常见的诚实。
第一个是单阶段高质量几何表示还没有收敛。目前主流的高质量三维生成方法(比如TRELLIS)都得靠多阶段的流水线才能出好结果,这对统一模型来说是个麻烦事,因为想做编辑就得跟着做多阶段编辑,难以规模化。三维领域能不能像图像领域那样实现单阶段直出高质量结果,还是个悬而未决的问题。
第二个是文本到三维数据集的标注质量问题。目前依赖Gemini这类多模态大模型给三维资产打标签,但这些模型的描述仍然存在不小的模糊性,导致训练对里混入噪声,这个问题大概率会随着多模态大模型本身的进步而逐步缓解。
第三个是端到端纹理编辑还没做。目前的系统主要聚焦几何编辑,纹理编辑几乎没有涉足,主要卡在缺乏合适的训练数据。这也引出一个更大的问题:几何和纹理能不能被联合建模,实现真正统一的单阶段高质量表示。
第四个是编辑数据构建流程的鲁棒性问题。目前的Nano3D-v2依赖用边界框来区分可编辑和不可编辑区域,框外部分能很好地保持一致,但框内部分里那些不需要被编辑的区域,一致性其实很难保证,这些不一致会传导进最终训练出来的模型里,拉低编辑质量。
第五个是新架构的探索空间。当前的架构是自回归模型加扩散模型的级联方式,而图像和视频生成领域里的Transfusion这类深度融合架构展现出了不错的效果,探索类似架构在三维领域的应用是个自然的下一步。
第六个是数据规模仍未达到理想水平,无论是数量还是质量,继续扩大规模仍然是提升效果的关键方向。
写在后面
读到这篇论文时,最让我意外的其实不是那些漂亮的评测数字,而是"文本到3D数据能带动编辑能力"这个发现背后的逻辑颠倒感。
直觉上你会觉得,要提升编辑能力,就应该多攒编辑数据、多标注编辑指令,结果论文用一个很朴素的实验告诉你,给生成任务多喂1000条鸡的样本,编辑任务里"换成鸡头"这个指令就突然能用了,压根没碰编辑数据本身。这说明编辑能力某种程度上是被生成能力"借"出来的,编辑模型并不是独立学会了怎么画鸡头,而是直接把生成模型脑子里已经会画的东西挪用了过来。
这个发现挺有意思的地方在于,它给了研究者一条投入产出比更高的路:编辑数据的构建成本远高于生成数据,那与其死磕更贵的编辑数据,不如先把便宜的生成数据尽量做全,这在工程决策层面是个挺实用的启示,值得后来做类似统一模型的团队认真参考。
论文里没细说的一个疑问是,如果生成能力本身就存在偏见或者覆盖不全(比如某些小众物体类别数据稀少),这种"借用"机制是不是也会把这些偏见原封不动地带到编辑任务里,这个问题恐怕值得单独做个实验看看。
Q&A
Q1:Hunyuan3D-Buffalo 1.0是什么?
A:它是腾讯混元推出的一个统一三维多模态模型,能在同一套架构里完成三维物体理解、文本生成三维模型、指令引导的三维编辑、以及按文字提取三维部件这四项任务,不需要为每个任务单独搭建系统。
Q2:Nano3D-v2解决了什么问题?
A:它是用来自动生产高质量三维编辑训练数据的流水线,通过锚点视角选择、编辑区域精确定位、体素编辑、精细几何纹理修补、以及基于视觉语言模型的质量过滤五个阶段,解决了此前编辑数据难以规模化生产、质量参差不齐的问题,最终生产出1200万条编辑数据对。
Q3:为什么说三维生成能力能带动编辑能力?
A:论文做了一个实验,只往文本生成任务的训练数据里加了1000条"鸡"的样本,完全没有增加任何编辑数据,结果模型原本做不好的"把头换成鸡头"这个编辑指令就成功了。这说明编辑能力很大程度上建立在生成模型已经掌握的知识基础上,扩大生成数据是提升编辑效果更省成本的路径。
好文章,需要你的鼓励
ARCHead是一种专门压缩大语言模型输出层的方法,通过量化低秩核心与激活度量修正,将LM-head存储压缩至BF16的约25%,质量损失极小。
这项研究发现AI投票推理在多答案问题上会系统性失效,提出用因果数学规则直接验证候选答案的CALVER方法,准确率比投票提升约11至19个百分点,且差距随尝试次数持续扩大。
这项来自港科大与腾讯视频的研究提出WorldCycle框架,通过可逆动作循环构造无标注自验证奖励,将视频世界模型的长程漂移误差降低最高44%,复合动作准确率提升约四倍。
哥本哈根大学团队构建了首个同时覆盖三种引用粒度、屏蔽信息泄露、包含全量段落候选库的法律信息检索数据集LegalPincite,用于评估法律判决段落精确检索任务。