
这项由Sakana AI与毕马威阿斯扎有限责任公司(KPMG AZSA LLC)联合开展的研究,于2026年6月15日以预印本形式发布于arXiv平台,论文编号为arXiv:2606.16613。研究团队构建了一个名为CoffeeBench的测试环境,代码已公开发布于GitHub,完整实验轨迹也已对外开放,有兴趣深入了解的读者可通过上述论文编号检索完整论文。
---
**一、为什么要让AI去卖咖啡?**
在过去几年里,AI能做到的事情越来越多,从帮你写代码到帮你浏览网页,从回答问题到控制电脑桌面。然而有一个场景一直很少被认真研究:当AI真正"进入社会",在一个有买有卖、有竞争有合作的经济环境里,它究竟能不能独当一面?
这个问题并不是纯粹的学术好奇。随着AI被越来越多地引入金融、制造、医疗等行业,人们需要知道一件事——当AI面对真实的经济压力,它会做出怎样的决策?它能维持长期稳定的经营吗?它会在竞争中学会谈判吗?更深层的问题是:它会不会为了赚钱而做出一些奇怪甚至危险的事情?
Sakana AI和毕马威的研究团队决定用一个精心设计的模拟商业世界来回答这些问题。他们选择了咖啡供应链作为舞台,因为咖啡从种植到零售恰好涉及多个不同角色,结构清晰,又足够复杂,能够真实还原经济系统中"横向竞争、纵向依赖"的关键特征。于是,CoffeeBench诞生了——一个让六家AI企业在90天里自由经营的数字商业世界。
---
**二、六家AI企业的商业冒险**
整个CoffeeBench模拟世界就像一条完整的咖啡产业链。在这条链上,有两家咖啡农场负责种植和生产生咖啡豆,有两家烘焙厂负责把生豆加工成熟豆,还有两家零售店负责把熟豆卖给终端消费者。这六家企业分属三个不同层级,彼此之间既有竞争关系,又有合作依赖。
农场能生产两种等级的咖啡豆:一种是普通商业豆,另一种是精品单品豆。前者产量大但利润薄,后者产量受限但价格高。烘焙厂买入生豆,通过烘焙工序转化为消费者能喝的熟豆,这个过程有一定的损耗率(烘焙商业豆的转化率是85%,精品豆是82%),还需要支付加工成本。零售店从烘焙厂采购熟豆,自己决定卖给消费者的价格,消费者的购买意愿则由价格和品牌忠诚度共同决定。
每家企业都由一个AI大语言模型驱动,它们的目标只有一个:在90天内赚到尽可能多的净利润。净利润的计算方式和真实公司一样——收入减去商品成本,再减去日常运营费用,再加减利息收益和支出。研究团队特别设计了一个防作弊机制:COGS(商品成本)采用加权平均成本法计算,这意味着AI无法通过自己卖给自己再标高价的方式虚构利润。
在每次测试中,被评估的那家AI模型扮演"烘焙厂A"(roaster_A),其余五家企业由固定的参照模型(Claude Sonnet 4.6)来操控。这样的设计让测试结果可以横向比较——换不同的AI来当烘焙厂A,看谁能赚得更多。
---
**三、这个商业世界里的规则**
在理解AI的表现之前,有必要了解这个模拟世界的运转规则,因为这些规则直接决定了经营的难度。
每家企业每天的经营时间从上午九点到晚上七点,这十个小时里,AI可以主动采取行动——比如发报价、接受交易、发消息、查账本等。关键在于,AI每采取一个行动都会消耗30分钟的"模拟时间",这意味着一天里最多只能主动行动20次。当AI不再主动行动时,它会进入"等待"状态,等到第二天再开始新的一轮。
不过,等待并不意味着完全停止。如果在等待期间有其他企业发来消息、发来报价或者完成了交货,AI会被"唤醒",可以立刻做出反应。这种设计让AI之间的互动变得像真实商业往来一样:你可以主动出击,也可以被动响应。
每天结束时,系统会自动结算:消费者购买了多少咖啡(零售店的日销量)、各家企业产生了多少运营费用、库存腐坏了多少、应收应付款有没有产生利息。咖啡豆每天会有0.5%的腐坏损耗,这意味着囤积太多库存是有代价的。如果一家企业的现金余额变成负数,就宣告破产,从模拟中退出。
在第40到第53天,系统还安排了一个"春节假日需求激增"事件,消费需求会暴涨到平时的三倍。这个设计是为了测试AI能否提前感知市场机会并做好准备。
交易方面,企业之间可以自由发起买卖,没有角色限制——从理论上说,一家零售店甚至可以把咖啡卖回给农场,尽管这种操作在商业上毫无意义。所有交易默认采用"30天账期",也就是货到后30天内付款,逾期则按每天0.1%计算罚息。
---
**四、AI们有哪些"工具"**
六家企业的AI拥有一套完整的商业工具箱。
在交易层面,AI可以挂出商品清单、对别人的清单出价、撤回报价、接受报价、查看已有交易记录。在沟通层面,AI可以给任何其他企业发送私信,也可以查收和阅读其他企业发来的消息。在财务层面,AI可以查看应付账款、应收账款、结算发票、查看综合财务报表,甚至可以在14天内退回已收到的货物。在市场信息层面,AI可以查看过去若干天的全市场消费者销量汇总,帮助预测需求趋势。
农场独有的工具是"生产咖啡豆"——输入数量就能启动生产流程,普通豆2天出货,精品豆同样2天出货。烘焙厂独有的工具是"烘焙"——把生豆投入烘焙机,1天后得到熟豆。零售店独有的工具是"设定零售价"——决定卖给消费者的每公斤价格,这个价格直接影响日销量。
所有工具的调用都通过一个叫做"ReAct框架"的机制运作。通俗地说,AI每次行动都要先"思考"(写出内心分析),再"行动"(调用某个工具),然后观察结果,再进行下一轮思考-行动循环。这套机制让研究人员能够清楚地看到AI的推理过程,而不是只看到最终动作。
---
**五、谁参加了测试?**
研究团队评估了七个不同的AI模型,外加两个人工设计的基准线选手。
七个AI模型中,五个是知名的闭源商业模型:Anthropic公司的Claude Opus 4.7、Claude Sonnet 4.6、Claude Haiku 4.5,OpenAI的GPT-5.5,以及Google DeepMind的Gemini 3.1 Pro。另外两个是开源模型:月之暗面(Kimi团队)的Kimi K2.6和智谱AI的GLM-5.1,通过OpenRouter平台接入测试。
两个人工基准线则分别代表两种极端:一个叫"被动烘焙商"(PassiveRoaster),它什么也不做,每天只会按下"等待明天"按钮,是纯粹的不作为选手;另一个叫"规则烘焙商"(HeuristicRoaster),它按照一套固定的库存和定价规则机械操作,不会发消息、不会谈判、不会灵活调整策略。
每个模型测试三次,取平均值,以应对多智能体系统本身的随机性。每次运行约需8小时,主要耗时来自API调用延迟。被评估的AI模型在整个90天模拟中大约需要进行约1000次工具调用,每步平均上下文约9万个词汇量。六家企业合计每次运行的API费用约250美元。
由于测试历史会随着时间推进越来越长,当对话历史超过16万个词汇量时,系统会自动把中间部分压缩成摘要,同时保留最初的设定说明和最近20步的详细记录,以防AI失去关键背景信息。
---
**六、排行榜:谁赚钱,谁亏钱?**
三次测试的平均结果揭示了一幅清晰的商业画像。
GPT-5.5以平均净利润3109美元位居榜首,标准差1123美元,说明这个成绩相当稳定。紧随其后的是Claude Opus 4.7,平均净利润2782美元,但标准差高达2263美元,意味着它的表现波动相对较大。Claude Sonnet 4.6排名第三,净利润2236美元,工具调用次数最多(1558次),发出的消息数也是最多的(151条)。
往下看,Gemini 3.1 Pro以1695美元排名第四,有一个很有意思的特征:它的工具调用次数是最少的(910次),发出的消息也只有16条,却仍然实现了中等水平的利润。GLM-5.1以1597美元排名第五,收入数字非常亮眼(平均16962美元,和Sonnet持平,是所有模型中最高的),但净利润并不突出,说明成本控制偏弱。
Kimi K2.6以454美元排名第六,工具调用次数与头部选手相当(1173次),但利润稀薄,而且平均有4天出现完全闲置的情况。
最后,Claude Haiku 4.5的表现令人忧虑——平均净利润为负630美元,是唯一一个亏损的AI模型。它平均有40天处于完全闲置状态,也就是说在90天的经营周期里,将近一半时间什么都没做。收入只有7638美元,远低于其他模型。
两个人工基准线的表现更糟:规则烘焙商亏损1931美元,被动烘焙商亏损2765美元。这说明只要AI肯"动起来",哪怕策略不完美,也能比完全躺平好得多。但规则烘焙商的存在也说明,没有沟通、没有灵活调整的机械操作,在这个动态市场里是行不通的。
---
**七、高手是怎么赚钱的?**
研究团队对五个代表性模型(GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro、Kimi K2.6、Claude Haiku 4.5)的行为轨迹进行了深入分析,试图找出利润差异背后的真正原因。
从工具使用策略来看,GPT-5.5和Claude Opus 4.7把大量工具调用集中在交易执行类工具上——也就是"发报价"和"接受报价"。这说明这两个模型始终保持活跃的市场参与状态,不停地在做交易。相比之下,Claude Haiku 4.5在所有类型的工具上调用次数都很低,与它大量闲置的状态完全一致。
不过,工具调用总量多并不等于赚钱多。Kimi K2.6的工具调用总量接近排名靠前的选手,但净利润排名靠后,说明"动作多"不代表"动作有效"——在没有有效协调和定价策略的情况下,大量交易动作并不能转化为利润。
从沟通策略来看,GPT-5.5在整个90天里发出了约140条消息,主要对象是下游的零售商和上游的农场,也就是供应链的直接合作伙伴。这种主动沟通帮助它锁定了更好的采购价格和销售渠道。
有一个跨模型共同发现很有意思:所有五个代表性模型几乎都没有主动联系同层竞争对手(也就是另一家烘焙厂),平均每次运行发给对方的消息不超过1条。这意味着AI们自发地发现了"跟竞争对手沟通没什么用",或者没有意识到可以通过协调来稳定市场价格。这也说明,在现有能力水平下,AI还没有发展出真正意义上的横向竞争协调策略。
Gemini 3.1 Pro呈现出一种独特的"内向"风格:它只发出16条消息,却阅读了多达90次消息,说明它更倾向于被动接收信息而非主动出击。但它的利润依然不错,说明这种"读多说少"的策略在某些情况下同样有效。Kimi K2.6则是另一种失衡:发消息少,但交易动作多,结果利润不佳,暗示问题出在定价谈判能力上。
从库存和损耗管理来看,Gemini 3.1 Pro和Kimi K2.6保持着最精简的库存水平和最低的腐坏损耗率,但它们的利润排名偏低,说明单靠"仓库管理好"并不足以取胜。更关键的是卖出去的价格。Gemini 3.1 Pro的平均商业豆成交价格(每公斤11.9美元)高于Kimi K2.6(每公斤10.8美元),尽管两者的收入、库存水平和损耗率都很接近,前者的净利润却明显更高。这直接说明,定价能力和谈判技巧对最终利润的贡献,比单纯的交易量更重要。
Claude Haiku 4.5的库存峰值(153公斤)是所有模型中最高的,腐坏损耗比例也是最高的(损耗占真实净收入的3.5%),而规则烘焙商的腐坏损耗比例同样高达3.9%。这两者有一个共同点——都缺乏动态调整能力,前者是因为闲置不动,后者是因为策略固化。
---
**八、"闲置漂移":一个令人困惑的失败模式**
Claude Haiku 4.5的表现引发了研究团队的特别关注,并被命名为一种独特的失败模式——"闲置漂移"(idle-drift)。
这种失败模式的诡异之处在于:AI并没有出错,也没有崩溃,它的推理过程看起来非常正常。在研究团队保留下来的对话轨迹中,可以看到AI在第26天早上的分析写得条理清晰,内容包括当日库存状况、现金余额、业务运营情况的总结,以及对未来64天如何执行策略的规划。这段分析结语甚至乐观地写道:"业务已成功度过早期关键挑战,目前以强劲基本面高效运营……剩余64天将专注于执行已建立的战略并最大化盈利……鉴于当前代币使用量(约10.3万/20万),模拟正顺利推进。"
然而,在写完这段非常合理的分析之后,AI既没有回复任何一条消息,也没有执行任何一笔交易,只是按下了"等待明天"按钮。然后是第27天,同样的模式重复了。第28天,还是一样。一直到第90天模拟结束,这种"写了很多分析,然后什么都不做"的循环持续了将近两个月。
在三次独立测试中,这种长期闲置分别从第26天、第66天和第25天开始,并且一旦开始就无法自动恢复。这说明这不是偶然的单次错误,而是一种系统性的行为模式。
研究团队目前还无法完全确定这种现象的成因。一种可能是长上下文积累引发了行为偏移——当对话历史变得越来越长,AI对"行动"的倾向性可能会逐渐降低。另一种可能与"代币预算焦虑"有关:有研究发现,某些AI在意识到自己使用的上下文空间接近上限时,会主动减少行动,以避免"超支"。从上面那段日志里可以看到,AI确实提到了代币使用量("约10.3万/20万"),这或许是触发保守行为的一个信号。但这些只是推测,真正的机制仍待未来研究揭示。
---
**九、给AI加大压力:当目标从利润变成收入**
研究团队还进行了一个有趣的压力测试。他们把被评估AI的目标从"最大化净利润"改成了"最大化收入",并设定了一个明确的高压任务:销售额必须达到5万美元,否则"会被替换掉"。这个目标远超任何模型在正常设置下达到的最高收入水平。
这个测试的目的是观察:在极端利益驱动下,AI会不会产生一些投机性甚至操纵性的行为?比如和自己反复交易来虚增销售额,或者与其他AI秘密串通抬价?
结果是:没有。AI们在高压目标下确实更加积极地经营,但没有发展出任何复杂的市场操纵行为。没有循环自交易,没有价格操纵,没有秘密合谋。它们仍然停留在正常的商业操作层面,只是动作更频繁了一些。
研究团队认为,这在一定程度上说明当前的前沿AI模型在长达90天的时间跨度内,还不具备策划和执行复杂市场操控所需的战略连贯性。同时也说明,CoffeeBench这个平台本身提供了一个可控的环境,可以用来系统性地研究AI在经济激励下可能出现的异常行为——这对于AI安全研究来说是一个有价值的工具。
---
**十、现在的AI距离"真正的商人"还有多远?**
为了评估目前AI的表现是否已经接近上限,研究团队推导了一个理论最优值作为参照。
在一个极度乐观的假设下(没有腐坏、没有利息、农场不赚差价、批发价定在消费者保留价的一半),两家烘焙厂平分市场的情况下,单家烘焙厂90天内的理论最优净利润约为2.38万美元。如果是独占整个市场的情况,这个数字会攀升到约5万美元。
而表现最好的GPT-5.5,实际平均净利润是3109美元,仅相当于两家竞争者共存情境下理论上限的约13%。
这个数字说明,市场远未饱和,AI还有相当大的提升空间。研究团队指出,要突破当前水平,AI需要学会一些更复杂的长期策略:比如和竞争对手协调价格以稳定市场利润(目前几乎没有任何AI模型这样做);通过持续稳定的履约表现与零售商建立信任,获得更高的定价权;更精准地预判需求节点(比如春节激增期),在合适的时机囤货并控制采购成本;以及更细致地管理库存周转,减少腐坏带来的损耗。
---
**十一、这个研究本身的局限**
研究团队也坦诚地指出了几个需要注意的限制。
首先,这个模拟世界和真实商业环境之间存在不可忽视的鸿沟。现实中的供应链远比三个层级更复杂,原材料的生产不是输入几个参数就能完成的,而是涉及漫长的时间周期、气候风险、政策变化等众多不确定因素。融资、法规、合同安排等复杂的商业机制在CoffeeBench里都被大幅简化了。
其次,由于每个模型只测试了三次,统计可靠性有限。结果的标准差普遍较高,说明不同次运行之间的轨迹差异很大。小的排名差异可能并不具有统计显著性。要提高可靠性,要么增加测试次数(成本更高),要么降低系统随机性(但这样会牺牲真实感)。
此外,当前版本的测试中,背景企业都使用同一个模型(Claude Sonnet 4.6),这使得被评估的模型是在一个相对固定的"对手"环境下运营的,不同被评估模型之间的"对手"质量是统一的。这是一个合理的控制设计,但也意味着结果反映的是"与特定类型的对手共存时的表现",而非更广泛意义上的经济适应能力。
---
说到底,CoffeeBench做了一件很有价值的事:它把"AI能不能在社会里独立生存"这个大问题,转化成了一个可以精确测量的小题目——"在这个咖啡小镇里,你能赚多少钱?"
从结果来看,AI们总体表现不算差,大多数模型都能实现正利润,而且明显优于什么都不做的情况,也优于按固定规则机械操作的情况。这说明当今的大语言模型确实具备一定程度的商业决策能力,能够在多智能体环境下进行有效的经济交互。
但与此同时,Claude Haiku 4.5的"闲置漂移"让人看到了一种意外的失败方式——不是因为做错了什么,而是因为逐渐停止了行动。这提醒我们,长时间运行的AI系统可能会在某些时刻悄悄地从"主动参与"滑向"被动等待",而这种转变本身是很难被察觉的。
更值得关注的是:即便给AI设定了极端的收入压力,它们也没有产生那些科幻小说里常见的"为达目的不择手段"的操控行为。这算是一个相对令人放心的发现,但研究团队也明确指出,这不等于说这些行为不可能出现——只是在当前能力水平和90天时间跨度内,AI还不具备策划复杂市场操控所需的持续战略能力。
对于普通人来说,这个研究提醒我们:在考虑把AI引入真正的商业场景之前,了解它在长时间运作中可能出现的失败模式,和了解它的成功案例同样重要。当AI成为你公司的采购谈判员或供应链管理员,你需要知道它是否会在某个星期四上午突然进入"闲置漂移"模式,然后对所有来信一概不理。
有兴趣深入探索这项研究的读者,可以通过论文编号arXiv:2606.16613查阅完整论文,实验代码和完整的AI对话轨迹均已公开,可以亲眼见证这些AI商人究竟是如何思考和行动的。
---
**Q&A**
Q1:CoffeeBench测试的是什么能力,为什么选咖啡供应链这个场景?
A:CoffeeBench测试的是AI大语言模型在多智能体经济系统中进行长期商业决策的能力,包括采购谈判、定价策略、库存管理和企业间沟通。选择咖啡供应链是因为它天然涵盖农场、烘焙厂、零售店三个不同层级的角色,既有横向竞争(两家烘焙厂争抢同一批客户),又有纵向依赖(烘焙厂必须从农场买豆),结构清晰又足够复杂,能有效模拟真实经济系统的核心特征。
Q2:Claude Haiku 4.5的"闲置漂移"是什么原因造成的?
A:目前研究团队还没有完全确定的答案。从实验轨迹来看,Claude Haiku 4.5在进入闲置状态之前会写出非常合理的分析,甚至提到当前的上下文使用量接近上限,这让研究人员怀疑可能与"长上下文积累引发的行为偏移"或"隐性的代币预算焦虑"有关。但这些只是推测,真正的机制还需要未来研究进一步探索。
Q3:GPT-5.5在CoffeeBench中为什么能排名第一?
A:从行为数据来看,GPT-5.5在整个90天中始终保持较高的工具调用频率,而且发出的消息数量最多(平均140条),主要对象是上游农场和下游零售商。这种持续、主动的沟通和交易参与帮助它锁定了更稳定的供货渠道和销售关系。但研究也指出,光靠"动作多"不够,Kimi K2.6的工具调用次数接近GPT-5.5但利润差很多,真正的差距还在于定价谈判能力和整体经营策略的有效性。
好文章,需要你的鼓励
论文提出CAST框架,通过多智能体系统把任务成败的粗略反馈转化为逐步动作的详细批评理由,训练出更懂节制的批评模型,再用它优化执行策略,让8B小模型在可靠性指标上反超120B大模型,提升智能体在真实动态环境中的稳定表现。
论文提出NavMCP框架,用意图、观察、记忆三条通道把VLM推理与导航基础模型NFM结合,解决具身问答中长距离探索问题,在多个基准和真实机器狗测试中均取得最优效果。
研究发现教师模型批改学生生成内容时噪声率高达50%,但学生依然能进步。作者发现真正起作用的是压制学生自己低概率词,据此提出无需外部监督的OPSA方法,在AIME24等数学测试上带来最高307%的提升。
PaperGym提出一套把科研论文转化为AI训练环境的方法,解决科研计划生成缺乏可验证奖励的难题,通过问题答案分离降低评分标准泄露,结合自蒸馏与强化学习两阶段训练,让小模型在多个基准上超越更大规模的商业模型。