微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 冻结的小模型如何在"已解决问题"上完胜顶级AI?Corbenic AI的这项研究给出了答案

冻结的小模型如何在"已解决问题"上完胜顶级AI?Corbenic AI的这项研究给出了答案

2026-08-05 17:57
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-08-05 17:57 科技行者

这项由Corbenic AI独立开发的产业经验报告由研究员Sietse Schelpe撰写,以行业经验报告形式发布,论文编号为arXiv:2607.14431,属于2026年发布的系列研究成果之一,感兴趣的读者可通过该编号查阅完整文献及相关附录资料。

当所有人都在谈论"更大的模型、更多的参数、更强的算力"时,有一个团队却在悄悄做一件看起来有些反直觉的事——他们把模型彻底冻住,不再训练它,而是在旁边建了一个"知识金库"。一旦某道题被解开并通过严格的独立验证,所有后续的相同类型问题就永远不需要再重新推理了,直接从金库里取答案,零消耗,毫秒返回,每次输出一模一样的字节。这个系统叫做Galahad,其底层存储引擎叫做Merlin。

这听起来像作弊,但仔细想想,它其实是在挑战AI领域一个被默默接受的浪费:每次用户问一道已经被无数次解答过的数学题、运算题或逻辑推理题,顶级AI服务都要重新从头推导一遍,消耗大量算力,花费真实的金钱,而且每次给出的答案还可能略有不同。Corbenic AI的这项研究要测量的就是:如果把"推导"和"执行"彻底分开,会发生什么?

一、让一个冻住的小模型"开挂":零推理代币、百分之百准确

理解这项研究的核心,需要先弄清楚一个关键区别:现在大多数AI每次回答问题,都要完整地重新"思考"一遍,就像一个学生每次被问到2+2等于几,都要重新在脑子里算一算,而不是从记忆里直接取出答案。这个"重新思考"的过程会消耗资源,叫做"生成代币"(generation tokens),可以粗略理解成AI思考的步骤数,每一步都要花钱、花时间、花电。

Galahad系统做的事情完全不同。它维护着一个"经过验证的解法库",每当一类问题被解决并通过严格的独立审核,这个解法就被存进去。下次碰到同类问题,系统不让模型重新推理,而是直接从库里调出那个已经验证过的解法,用模型去执行它、算出新参数下的答案,然后返回结果。模型本身没有产生任何新的推理步骤。

研究团队在一个12亿参数的开源模型Gemma-4-12B上做了测试,让它面对九类数学和算法问题的180道全新题目。所谓"全新",是指用从未见过的具体数字参数。结果是180道全部答对,答对率100%,而且每道题产生的生成代币数量是0。这里特别值得说明的是,这不是简单的"背答案"——系统存的是解法方法,而不是特定数字的答案。比如某一类问题的三道测试题,输入的数字分别是3105、390和15150,这三个数字从未出现在记忆库里,但系统用存好的解法方法把这三个新数字各自正确算出来了。

与此同时,研究团队还对比了四款来自不同厂商、不同架构的模型——包括稠密架构的Gemma-4-12B、Qwen3-14B、Phi-4,以及混合专家架构的DeepSeek-Coder-V2-Lite——四款模型在同一套记忆库下全部得到了180/180的满分,生成代币全为零。这说明这套机制和具体的模型选择无关,换个模型,结果完全一样。

二、验证不看答案卷:这个"守门员"是如何工作的

你可能会问,怎么知道存进去的解法是对的?这正是这套系统最关键也最花心思的地方。

Corbenic AI对"验证"的定义非常严格:验证过程绝对不能看答案卷(benchmark answer key)。这就像监考老师判卷,不是拿学生的答案和标准答案对比,而是通过完全独立的推理过程来确认答案的正确性。这样做的目的是防止系统"作弊"——如果验证时偷看了答案,那所谓的验证就没有意义。

具体来说,系统针对不同类型的知识采用了三种独立的验证方式。对于数学证明类的问题,使用的是机器可检验的形式化证明——就像数学家提交一篇证明,由独立的自动化验证工具逐步检验每一步逻辑是否成立,而不是由另一个AI模型给个评分。测试中,模型写出了一个正式数学证明,独立的证明检验器第一次提交就通过了;同时,一个故意写错的命题(2+2=5)被同一个检验器拒绝,证明这个门确实在认真把关。

对于开放性推理类的问题,系统采用一致性检验机制——模型以机器可解析的格式输出推理过程,自动化程序检查推理内部是否自相矛盾。如果推理的前提和结论打架,就会被拒之门外。四款模型各自接受了超过二十个推理框架的测试,88个提交全部通过并被正确复用。另外还测试了推理方法的跨域迁移——把一种在某领域验证过的推理方法移植到完全不同的领域(医疗分诊),四款模型总计80次迁移尝试,77次成功通过了一致性门控。

更关键的是,团队还专门测试了"欺骗"这个门是否可能——一个表面看起来正确但实际上有细微错误的候选解法,被这套分层验证机制识别并拒绝,具体的反例也被记录了下来。每个候选解法在被接受之前,都要经过150个边界条件的测试。所有测试输入上,验证门控一个都没有放错误答案进去。

三、这不是缓存,也不是普通的"知识检索"——一个被频繁误解的设计

不少人听到"存解法、取解法",会把它和已有的技术混淆。研究团队在报告中专门列出了这套系统与相邻技术的区别,因为这些区别恰恰是整套保证成立的关键。

语义缓存(semantic cache)和向量检索系统(RAG)——也就是目前AI行业里最流行的"知识库"方案——是通过模糊的语义相似度来找答案的,就像在图书馆里用关键词找大概相关的书。这种方式的根本问题是:找到的东西可能不是你真正需要的那本。研究团队做了一个专门的测试:在一个4500条目的验证知识库上,让精确地址寻址和近似相似度匹配各自工作,结果是精确寻址零错误,而近似匹配取错的比例高达94.3%。换句话说,用当前主流的向量检索方式,每一百次查询里有94次会拿回错误的答案——而且是拿到一个"看起来很正确"的错误答案,没有任何报错,这才是真正的危险所在。

前缀缓存(prefix/KV caching)——这是vLLM、SGLang等推理引擎里常见的加速手段——确实可以复用一部分计算,但它的本质是跳过了相同输入前缀的重复计算,模型依然要为每道题生成新的输出代币,而且没有任何验证机制确保答案正确。

还有一类"智能体技能库"(agent skill libraries),比如Voyager、TroVE等系统,思路上已经接近Galahad,会积累可复用的工具。但它们的验收标准通常是另一个模型的判断,或者针对特定任务的神谕(oracle),而不是独立的、不依赖答案卷的验证门控。一旦负责判断的模型出错,错误的解法就进了库。

Galahad把"精确选中正确条目"、"按位精确复现答案"、"存入前通过独立验证"三件事同时做到,而研究团队对市面上主要类别的六类已发布系统做了系统性审查,没有发现任何一个同时具备这三个属性。

四、一次性成本有多少?回本要多久?

这套机制的经济账是这样算的:解决并验证九类问题,总共花了16579个生成代币。这是一次性的总成本,覆盖了所有求解和验证活动。之后每次复用的边际成本是零个代币。

如果同样的问题由一个顶级AI服务来回答,每次都要走完整的生成流程,通常一道经过完整推理的答案需要500到1000个生成代币。按这个数字倒推,16579除以500得到的是33,16579除以1000得到的是17。也就是说,一个问题家族只要被问上17到34次,前期的一次性验证成本就全部回收了。从第35次开始,每一次都是纯粹的节省。这个比例会随着使用量的增加无限扩大。

从能耗角度看,180道题的完整复用测试,每款模型消耗了约6.3到6.5瓦时的电,平均每道验证答案约36毫瓦时——大约相当于一只LED灯泡燃烧13秒的用电量。而那次一次性的九类问题求解验证活动,总共消耗了81.1瓦时,大约是复用成本的2000多倍,但这2000多倍只付一次,此后永远免费。

五、知识可以合并,而且能跨域"搭积木"

Galahad的能力不只是"一对一地取出存好的答案",存进去的知识可以被组合起来回答从未存过的新问题。

研究团队测试了一道需要同时调用三个不同存储解法的复合问题——每一个单独的解法都不包含这道题的答案,但把三个解法拼在一起,系统答对了5道中的5道,生成代币仍然是零。当把其中一个必要的解法从库里拿掉,结果立刻变成0/5。这证明系统在用知识做真正的计算组合,而不是碰巧在某个地方存了这个问题的答案。

知识合并还可以在更大的尺度上进行。团队把来自单一专业领域的六个独立验证知识条目合并成一个14134个代币长的工作上下文,模型从这个合并上下文中生成了一个综合性的分阶段答案,每个元素都能追溯到它来自哪个源条目,没有任何跨源的张冠李戴。

更有意思的是跨域计算:给模型提供两个来自不同领域的存储条目,一个存着物理常数,另一个存着计算规则,模型把两者结合,算出了正确答案44牛顿(与真实值完全一致),而这两个条目单独看都不包含这道题的答案。类似地,来自医学领域和天文物理领域的两个存储知识,在合并上下文下,模型能够在一个回答里同时引用两者,两种不同的合并配置都测试成功了。

九个条目同时合并是目前测试过的上限,超出这个范围的行为尚未测量,研究团队在报告里明确说明了这一点,没有超出测量范围进行推断。

六、存储层"Merlin"是如何保证金库不崩、不混、不错的

维护这个知识金库的底层引擎叫Merlin,它负责确保存进去的东西是唯一的、可查的,而且出了问题也不会把整个库搞坏。

精确寻址的速度是一个关键指标。在一个包含4500个条目的知识库上,Merlin的内容键值计算速度达到每个键3.7纳秒,也就是每秒2.71亿个键,是加密哈希算法速度的60.2倍,是标准库默认实现的18.5倍。寻址从来不会成为系统的瓶颈,随着知识库扩大,这个优势只会越来越明显。在实际的全集成生产路径上,从一个查询进来到选中正确条目,中位数用时1.6微秒,95分位数是17微秒,而一次完整的复用执行需要6到23毫秒,寻址时间只占其中极小的一部分。

去重同样经过严格测试:给系统喂入6000个候选条目,其中2000个是唯一的,4000个是字节完全相同的重复项,系统精确接受了2000个,滤掉了4000个。而且规则是严格的——哪怕两个条目只差一个字节,也被视为不同的新知识。

存储安全性上,研究团队测试了两种真实故障场景。在一个硬性内存上限下,常规存储方式直接崩溃报访问违规、进程挂掉;Merlin在同样的上限和同样的工作量下,选择拒绝超出的请求,系统继续存活。在写入中途被打断的场景下,之前已提交的条目全部保持完整可读,没有任何数据损坏;而用同样方式打断一个常规文件存储,整个文件变得完全不可读。进程完全重启之后,Merlin恢复出了每一条条目,字节完全一致。

七、在"已解决的问题"上,小模型赢了

研究报告里有一节专门讲这套系统与顶级AI服务的比较,而且特别声明:用来比较的顶级模型的数字,全部来自那些模型厂商自己公布的官方报告,没有私自测试任何顶级模型。

在从零开始解决全新陌生问题这件事上,报告完全承认顶级模型领先——Anthropic公布的AIME 2026得分77.5、LiveCodeBench-v6得分72.0,谷歌公布的Gemma-4-12B的这些指标确实不在同一水平。这个方向不是Galahad的目标,报告没有任何这方面的竞争宣称。

但在"已经解决并验证过的问题"这块领土上,对比关系完全倒转。顶级API每次收到一道已经被解答过无数次的问题,依然要完整地生成一遍答案:花钱、花时间、不确定结果、没有验证保证。Galahad这边的答案是:零生成代币、6到23毫秒返回、每次输出字节完全一致、存储前通过独立验证。而且这块"已解决领土"只会随着时间推移不断扩大,从不缩小。

报告还专门提出了一个公开挑战:如果有任何厂商能展示一个API,在已解决问题上以零边际生成代币、按位精确、使用预先验证的结果来回答,研究团队愿意把这个挑战算作被推翻。目前没有已知的已发布产品文档描述了这样的服务。

八、一台46GB的GPU,能装下六百万个代币的上下文

最后还有一项关于存储容量的对比测试,结果可以说是量级上的差距。

研究团队在一台46GB显存的GPU上,让Galahad系统、vLLM和SGLang三者在同样的硬件条件下各自测试能够维持多大的工作上下文。vLLM在30399个代币时触发了硬性错误,这是它的上下文长度上限,它至少会诚实地报错。SGLang接受超过32000个代币的输入,但悄悄截断,而且不返回任何第一个代币——这意味着用户以为在获得服务,实际上什么都没收到。

Galahad维持了一个600万代币的可移动窗口,整个过程GPU显存增量只有263兆字节,几乎是平的。在这600万代币的存储内容里,团队放置了5个探测点,系统全部正确取回,而且无论探测点在哪个深度,访问时间都稳定在0.55到0.59秒之间——取第5970000个代币处的内容,和取第0个代币处的内容,花的时间一样。更早的一次测试甚至达到了1498万代币,同样保持了平坦的内存占用。

这里有一个重要的说明:这不是模型在"全局注意力"600万个代币,那对当前任何模型来说都是不可能的计算量。实际上,系统维护的是一个在这600万代币上可以自由移动的窗口,模型在任何时刻实际处理的仍然是一个有限大小的窗口,只是这个窗口可以精确地移动到任何位置。团队也用一个对照实验验证了这一点:故意把窗口放在别处,深层探测点就看不到了,答案就错了。这是设计上的预期行为,而不是缺陷。

此外,在复用速度上,同样的任务,Galahad在4000、16000、30000个代币大小的存储内容上,分别比对手快13倍、41倍和55倍,而且这个优势随着上下文增大而持续扩大。

说到底,这项研究的核心洞察是:当一道问题已经有了经过验证的正确答案,重新推导它一遍不是智慧,是浪费。Corbenic AI搭建的这套系统,本质上是给AI加了一个"永久不遗忘、永远不犯同样错误"的知识金库。小模型冻住不动,金库持续积累,已解决的问题越来越多,而每道已解决问题的回答代价趋向于零。

这种思路并不是要取代顶级AI的原始推理能力——在面对全新难题时,大模型的强项无可替代。但在那些可以被验证、会反复出现的问题上,反复为相同的推理付费,实际上是在用最贵的工具做最不需要贵工具的事。对于那些有大量重复性可验证任务的场景——比如财务计算、合规检查、参数化工程分析——这套机制提供了一种在成本、速度、确定性和可审计性上同时占优的选项。

对于普通用户来说,这项研究更像是一个提醒:当前我们付费使用的AI服务,可能有相当大比例的算力和费用被花在了重复解决已经解决过的问题上。如果这种浪费能够被系统性地消除,AI服务的成本结构可能会发生根本性的变化。至于这是否会推动行业改变当前的默认做法,以及这套系统在更复杂、更开放的任务上能走多远,将会是接下来值得持续关注的问题。

---

Q&A

Q1:Galahad系统和普通的AI缓存有什么本质区别?

A:普通AI缓存或向量检索是靠"大概相似"来找答案,研究测试表明这类方案在4500条目的知识库上有高达94.3%的错误取回率。Galahad用精确内容寻址,4500条目零碰撞,而且每个存入的解法必须通过不依赖答案卷的独立验证,确保取出的东西是真正正确的。这个区别决定了两者在可靠性上不在同一个级别。

Q2:Galahad验证知识的过程为什么不能看答案卷?

A:如果验证时直接把模型输出和标准答案对比,那这个"验证"本质上是在作弊——它依赖了外部已知答案,而不是独立判断解法是否正确。Galahad的三种验证方式(形式化证明检验、一致性检验、分层边界测试)都是通过独立的逻辑推断来确认正确性,和答案卷完全隔离,这样存入的解法才具有真正的可信度。

Q3:Galahad系统对普通用户或企业有什么实际意义?

A:对于有大量重复性可验证任务的场景,比如财务计算、参数化工程分析、合规审查,这套系统意味着前期解决和验证一次之后,后续每次查询的成本接近零,速度在毫秒级,而且每次结果完全一致,可以留审计记录。相比每次都调用顶级AI接口重新生成,这是一种在成本和确定性上的结构性改善。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-