
这项由True Trading与Inc4.net联合完成的研究,以预印本形式发布于2026年6月1日,论文编号为arXiv:2606.01886,有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。
**故事从一个令人沮丧的场景开始**
假设你每天都要跟同一位金融顾问打交道,但每次见面,他都完全不记得你上次说了什么。你昨天刚告诉他你不喜欢高风险投资,今天他又给你推荐了一堆高波动性的加密货币。你上周花了半小时解释自己的投资逻辑,今天还得从头再来一遍。更糟糕的是,市场早就发生了变化,他手里拿着的还是三个月前的旧分析报告,却浑然不觉地把这些过期信息当作建议的依据。
这不是夸张的比喻,而是当下大多数AI金融助手的真实写照。现有的金融AI系统基本上都是"一问一答"模式:你问,它回答,然后这次对话的内容就悄悄消失了。下次你再来,一切又回到原点。研究团队把这种现象称为"金融认知摩擦"——用户不得不一遍又一遍地把同样的背景信息、风险偏好、历史判断重新喂给系统,系统才能给出勉强贴近实际情况的回答。
正是为了解决这个问题,来自True Trading和Inc4.net的研究团队提出了一套名为"交互原生知识挽具"(Interaction-Native Knowledge Harness,简称InKH)的全新AI架构。这套架构的核心理念只有一句话:**复杂性应该被系统吸收,而不是转嫁给用户。**
---
一、为什么现有的AI金融助手总是"患了健忘症"
要理解这项研究的价值,得先搞清楚现有系统究竟哪里出了问题。
现有的大多数金融AI系统,工作方式就像一个没有长期记忆的接线员。每当你打来电话(发起对话),它会认真倾听、查找资料、给出回答,然后挂掉电话,所有内容清零。下次你再打来,它又是一张白纸。即便有些系统号称有"记忆功能",也往往是靠着一个粗糙的文档库来完成的——你得明确告诉它"去查一下我之前说过什么",它才会笨拙地翻一遍档案,耗时费力,而且翻出来的东西还可能是三个月前已经过时的内容。
更麻烦的是金融市场本身的特性。市场是不断变化的,昨天成立的判断今天可能已经完全作废。比如某个加密货币项目昨天还运行稳定,今天突然出了一个重大协议漏洞,整个市场对它的风险评估就该彻底改变。但那些没有"知识更新机制"的AI系统,依然会把旧的、过期的认知当作有效信息来使用,这就是所谓的"陈旧记忆"问题。
研究团队通过实验发现,在引入"冲击事件"(比如市场机制突变)之后,那些没有主动更新机制的系统,其陈旧知识使用率会急剧攀升,直接导致输出质量下滑。而且这种下滑很隐蔽,因为系统给出的答案听起来依然"有模有样",用户很难察觉背后引用的其实是已经失效的信息。
---
二、InKH是什么:一套让AI真正"持续思考"的记忆架构
InKH的设计思路可以用一个"专业金融分析师的大脑"来理解。一个优秀的人类分析师不会每次开会都忘记上次讨论的内容,他会在脑子里持续维护一张动态的知识图谱:哪些资产存在哪些风险,客户的偏好是什么,上周哪个判断被市场数据证伪了,应该相应调整。他的认知是连续的、累积的、有时效性判断的。
InKH试图给AI系统建立类似的机制,整套架构由五个相互协作的部分构成。
第一个部分是"事件流视角"。系统把所有输入——无论是用户说的话、市场价格变动、工具调用的结果、还是内部风险信号——都统一看作一个连续的"事件流",而不是一次次孤立的对话请求。这就好比分析师不是每次开会才开始工作,而是全天候地关注着信息流入。
第二个部分是"有界工作上下文缓冲区"。每当系统需要处理一个新任务时,它不是让AI模型自己去翻档案、搜记忆,而是由系统在幕后自动把最相关的知识片段提前准备好,打包成一个精简的"工作文件夹"(控制在300到600个Token的范围内),然后直接交给AI模型。这个过程称为"被动注入"——系统主动送上门,而不是让模型费力去寻找。
第三个部分是"时序知识图谱"。这是整套架构的记忆核心。所有提取出来的知识——比如"BTC在高波动市场下会出现滑点上升"——都以结构化的形式存储在一张图谱里,每个知识条目都带有创建时间、最后验证时间、是否已被推翻等属性。当新知识和旧知识发生矛盾时,系统会在"写入时"(而非"查询时")就把旧知识标记为失效,确保下次取用时不会拿到过期内容。
第四个部分是"Wiki审计界面"。这是给人类看的部分。所有知识被整理成可读的维基页面,包括资产页面、交易者页面、策略笔记、风险备注和维护日志。这让监管人员或用户可以随时查看AI的"思考依据",确保透明可查。
第五个部分是"后台提取、成熟度跟踪、衰减与失效机制"。每完成一个任务,系统会在后台自动从对话记录里提取有价值的知识点,更新到图谱中。同时,每个知识条目都有一个"成熟度"属性——新提取的信息是"初始"状态,经过多次复用和验证后才会晋升为"已验证"或"已证明"状态。高风险操作只允许使用成熟度足够高的知识来支撑决策。此外,知识还会随时间自然"衰减"——距离上次验证越久、与当前市场状态越不符,其有效置信度就越低。
这五个部分共同构成了一个闭环:实时吸收→结构化存储→智能注入→后台提炼→治理把关。
---
三、背后的数学逻辑:为什么被动注入比主动搜索更合理
研究团队为这套架构提供了严格的数学形式化描述,其中有三个核心命题值得关注,即便不懂数学,直觉上也不难理解。
第一个命题讨论的是"被动注入"和"主动搜索"哪个更经济。结论是:只要主动搜索带来的额外规划开销(AI模型需要额外花精力去想"我应该查什么")超过被动注入引入的少量无关信息噪音,被动注入就更划算。直觉上很好理解——与其让一个天才分析师每次开会前自己翻遍所有文件,不如提前让助手帮他准备好最相关的那一叠文件。
第二个命题讨论的是"治理机制如何防止错误记忆扩散"。研究证明,只要治理机制能在每次复用前过滤掉足够比例的噪音知识,错误信息就不会像病毒一样在系统内越传越多,而是维持在一个有界的水平。这就像免疫系统——不是要消灭所有外来信息,而是要确保有害信息不能无限繁殖。
第三个命题讨论的是"成熟度门槛为什么应该随风险级别提高"。对于低风险的信息查询,使用初步提取的知识就够了;但对于涉及实际交易的高风险操作,必须要求知识经过多轮验证、成熟度足够高,才能被用来支撑决策。这就像医院手术前需要多方会诊确认,而不是依赖一个刚入职的实习医生的单方判断。
---
四、实验怎么做的:一场精心设计的"压力测试"
为了验证InKH的实际效果,研究团队设计了一套严格的受控基准测试,规模相当可观:24个随机种子、4轮测试、每轮80个任务场景,每个基线系统跑完整实验需要7680个完整工作流程,六个基线系统合计产生了46080次评估。
四类任务场景覆盖了金融AI的核心使用场景:市场分析、投资组合评审、跟单交易评估和交易准备。四轮测试的设计也颇具匠心。第一轮是"冷启动",系统从零开始,没有任何积累的知识;第二轮引入用户偏好信号,测试系统是否能记住并利用这些信息;第三轮注入"机制冲击",比如突然出现的市场规则变化或协议漏洞,测试系统面对过期知识时的应对能力;第四轮测量冲击后系统的知识复用质量,验证它是否真的从历史中"学到了东西"。
与InKH对比的六个系统,从简单到复杂依次是:只有基础模型没有任何记忆的"纯模型系统"、加了工具调用的"工具代理"、有简单持久化记忆的"简单记忆"、有人工维护Wiki并由AI主动搜索的"Wiki漫游"、有时序图谱但缺少失效机制的"KH-无失效",以及完整的InKH。
---
五、实验结果:数字背后的故事
实验结果用一个直观的坐标图来理解最清楚:横轴是响应延迟,纵轴是任务质量。理想的系统应该占据左上角——质量高、速度快。InKH在所有有持久记忆的系统中,确实占据了这个最理想的位置。
在具体数字上,完整的InKH达到了0.815的平均任务质量,平均响应延迟为900毫秒,陈旧知识使用率低至0.9%,决策可追溯性接近满分(0.999)。
与表现最接近的"Wiki漫游"系统相比,InKH的延迟下降了82.95%(从5281毫秒降至900毫秒),Token用量减少了82.29%,任务质量提升了0.108,陈旧知识使用率下降了96.58%,决策可追溯性提升了0.461。延迟从5秒多降到不到1秒,对于实时金融决策场景来说,这种差异在实用层面几乎是天壤之别。
与最接近InKH但缺少失效机制的"KH-无失效"系统相比,InKH的任务质量提升了0.050,而陈旧知识使用率同样下降了96.58%,两者的Token用量几乎相同。这组对比非常关键,因为它证明了质量提升的来源不是"记忆更多",而是"治理更严格"。
最能说明问题的是第三轮冲击测试的结果。当市场机制突变被引入后,Wiki漫游、简单记忆和KH-无失效三个系统的陈旧知识使用率全都出现了明显跳升;唯独完整的InKH基本保持不变,因为它在冲击发生时就已经在写入阶段把旧知识标记为失效。
按任务类型拆分来看,InKH在跟单交易评估和交易准备这两类风险最高的任务上,质量优势最为明显——这正好是成熟度门槛机制发挥作用的场合。
研究团队还特别做了一个关键对照实验,把InKH和KH-无失效的"知识库存量"拿出来比较。结果显示,两者累积的知识条目数量完全相同(平均13.96条),新增知识数量相同(平均5.96条),验证过的和已证明的知识数量也完全一样。唯一的区别是:InKH平均失效了2.96条过期知识,而KH-无失效一条都没有失效。换句话说,两个系统记的东西一样多,但一个定期清理过期信息,另一个任由过期信息堆积。这直接导致了两者在面对冲击时的截然不同表现。
---
六、这项研究的局限性:研究团队自己说了什么
研究团队相当坦诚地指出了这项工作的四个主要限制。
第一,整个评测是基于受控合成数据集,而非真实的历史市场数据。虽然这样做的好处是可以精确控制变量、隔离架构效果,但它并不能直接证明InKH在真实市场中能带来更好的交易收益。
第二,任务质量的评分是由模拟器定义的"黄金标准"来衡量的,而非真人标注。这意味着质量分数衡量的是"系统行为是否符合模拟器设定的预期",而不是"人类专家是否认可这个答案"。
第三,当前的实现是对图谱检索和服务行为的抽象模拟,而非真正部署在生产级图数据库上的完整实现。
第四,用真实公开数据(包括美联储经济数据库FRED、美国证监会EDGAR系统和币安公开市场数据)进行的历史回放测试,在论文中只是规划出来了,并没有实际执行和报告结果。
---
七、这套架构与其他相关工作的关系
理解InKH在整个研究生态中的位置,需要把它放在几个相关工作的背景下来看。
Graphiti是Zep团队提出的一套时序知识图谱架构,专注于存储层的时效窗口管理和关系感知检索。InKH和它的关系是"互补而非替代"——Graphiti可以作为InKH时序图谱的底层存储基础设施,而InKH在其上增加了编排层:被动注入、治理门控和写入时失效。一个关注"存什么、怎么存",另一个关注"什么时候取、取什么、谁有资格用"。
Mem0是另一个强调生产就绪的长期记忆系统,报告了相对于全上下文基线的显著延迟和Token改善。InKH与Mem0的思路类似,但额外强调了金融场景特有的治理约束——特别是基于成熟度和风险等级的知识使用门槛。
MemGPT把多层记忆管理类比为操作系统的内存管理,InKH则进一步把"知识的时效性治理"提升为核心设计目标,而不仅仅是容量管理。
此外,研究团队还特别提到了同一研究方向上的两篇执行层安全论文——一篇讨论加密货币交易中的执行层攻击面,另一篇讨论跨市场交易的合规执行。这三篇论文共同构成了一个完整的金融AI安全体系:InKH负责上游的认知层(知道什么、记住什么、相信什么),执行层安全论文负责下游的动作层(做什么、怎么做、有没有越权)。
---
说到底,InKH这项研究想说清楚的事情并不复杂:一个金融AI系统如果真的要被人信任和采用,它不能只是一个聪明的"一次性助手",而必须是一个能持续积累、能辨别真伪、能在市场变化时主动更新认知的"长期协作伙伴"。研究团队给出的答案是:把复杂性留给系统,把简洁留给用户。
这种思路当然还有很长的路要走——合成测试和真实市场之间的鸿沟依然存在,系统质量的最终判断也还需要真人评估来佐证。但这套架构所展示的方向,无论是被动知识注入替代主动Wiki搜索、写入时失效替代查询时筛选,还是成熟度门控与风险级别挂钩,都是非常具有工程说服力的设计选择。
归根结底,金融AI的核心挑战从来不只是"够不够聪明",而是"记得够不够准、更新够不够快、决策够不够负责"。InKH在这三个维度上,都给出了比现有系统更清晰的工程答案。对金融科技、AI Agent设计、或者知识管理系统感兴趣的读者,完全可以通过arXiv:2606.01886查阅完整论文,里面包含所有算法伪代码、数学形式化推导和实验复现脚本,公开透明度相当高。
---
Q&A
Q1:InKH的"被动知识注入"和普通RAG检索有什么区别?
A:普通RAG(检索增强生成)是由AI模型在推理时主动发起检索请求,相当于让模型自己去图书馆找书。InKH的被动注入则是系统在模型开始推理之前,就自动把最相关的知识打包好送到模型面前,模型不需要发起任何检索动作。这种差异带来的最直接好处是延迟大幅降低——InKH相比Wiki漫游式的主动检索减少了82.95%的响应时间,同时Token消耗也下降了82.29%。
Q2:InKH的"写入时失效"和"查询时过滤"有什么本质区别?
A:查询时过滤是每次取用知识时才判断"这条信息是否过期",相当于每次吃饭前才检查食材是否变质;写入时失效是在新知识被写入时就立刻把与之矛盾的旧知识标记为无效,相当于超市一上架新货就立刻把同品类的过期货下架。写入时失效的优势是陈旧知识根本不会进入检索候选池,而不是在取用时才被筛掉——这在市场机制突变后表现出了96.58%的陈旧知识使用率下降。
Q3:InKH的成熟度门控机制在高风险金融操作中如何起作用?
A:InKH为每个知识条目设置了成熟度状态,从初始提取到经过多次复用验证的"已证明"状态是一个逐步晋升的过程。对于低风险的信息查询,初始状态的知识就可以被使用;但对于跟单交易评估或实际交易准备这类高风险操作,系统会要求只有成熟度达到更高级别的知识才能被纳入决策依据。实验数据显示,在仅统计高风险工作流的情况下,InKH的陈旧知识使用率为0.018,而同样有图谱但缺少成熟度门控的对比系统达到了0.336,差距约19倍。
好文章,需要你的鼓励
这项联合研究发现,将Muon优化器应用于强化学习智能体训练时,搭配合适的步骤级信用分配机制,可使任务成功率提升88%,揭示了优化器与评分机制需协同设计的新方向。
本文介绍了CPO方法,通过让AI将自身回答与参考答案对比,在词级别识别推理对错,从而提供比熵更精准的强化学习训练信号,数学推理性能提升高达8.5%。
RAGU是一个多步骤知识图谱增强生成系统,配套7B参数的Meno-Lite-0.1模型,通过两段式抽取和去重整合构建高质量知识图谱,在综合推理任务上超越HippoRAG 2,成本仅为商业API的百分之一。