微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 让AI开一年网店,结果它把自己搞破产了

让AI开一年网店,结果它把自己搞破产了

2026-09-23 15:51
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-09-23 15:51 科技行者

2026年,一个AI被交到了一个虚拟世界里,手里攥着十万块钱,任务只有一个:经营好这家网店,一年之后看看还剩多少钱。

这不是什么脑洞大开的科幻设定。这是阿里巴巴Qwen团队联合香港科技大学做的一项真实研究,他们把18个当下最强的AI模型,包括GPT、Claude、Gemini、Qwen自家的模型,统统扔进了这个叫做E-Commerce Bench的模拟商业世界里,让它们各自经营365天,同时管理最多四家网店,要跟供应商砍价、研究市场、处理退货、应对突发的自然灾害和促销活动。

结果呢?表现最好的GPT-5.6 Sol把十万块钱变成了143万,涨了14倍多。但表现最差的Qwen3.5-Plus,一年下来账户里只剩1100块钱,五次尝试里有四次直接宣告破产。

18个AI跑同一个世界,结局差了1264倍。这个数字第一次让我意识到,所谓"AI很聪明"这句话,可能需要打上一个巨大的问号。

为什么要让AI开网店

你可能会问,现在测试AI能力的基准测试(benchmark,也就是用来考核AI表现的标准化测试题)已经多如牛毛了,为什么还要专门造一个开网店的测试?

答案藏在一个关键区别里:大多数现有的AI测试都是"一次性"的。

给AI一个GitHub上的代码问题,让它修复,修完就结束,打分。给AI一个电脑操作任务,完成就算过关。这类测试有一个专门的名字。

情节式任务(Episodic Task):有明确的开始和结束,一旦达成目标或者失败,这一局就结束了,像打一盘游戏。

但现实里的很多工作根本不是这样运转的。开公司没有"通关"这一说,炒股不会在赚到某个数字后自动停止,写代码维护一个大型系统也不是修完一个bug就万事大吉。这类任务有另一个名字。

连续性任务(Continuing Task):没有终止状态,AI要一直做下去,靠累积的结果来打分,更接近真实世界里企业运营、投资管理这类持续性工作。

问题是,以前测试AI连续性任务能力的基准测试,都有明显的短板。有一个叫Vending-Bench的项目,让AI经营自动售货机,但里面的供应商是靠另一个AI模拟出来的,这意味着每次测试供应商的报价和反应都可能不一样,没法保证公平对比。还有的测试用了真实电商数据,但砍掉了和供应商讨价还价这个环节。

E-Commerce Bench想解决的就是这个两难:既要够真实,又要够公平。

一个不撒谎的世界

这篇论文最让我觉得聪明的设计,是它把整个商业世界的"物理规律"做成了确定性的,而不是随机的。

这里要讲清楚一个容易被忽略但极其重要的点。这个模拟世界里有两类互动对象:顾客和供应商。

顾客那边,买不买东西、退不退货,完全由一套写死的数学公式决定,价格、季节、促销、口碑等等因素输入进去,结果就是确定的,不会因为运气好坏而变化。

供应商那边更巧妙。表面上,AI是在跟一个会打字聊天、语气丰富、时而热情时而强硬的供应商在讨价还价。但这个供应商到底肯不肯降价、降到什么程度、什么时候会翻脸不卖了,这些决策全部由一套叫做谈判内核的固定算法计算出来,聊天时的那些话术,只是另一个AI把这些冰冷的数字翻译成了人类能听懂的语言。

谈判内核(Negotiation Kernel):一套预先设定好的决策规则,负责计算供应商的报价、让步幅度和成交与否,确保同样的行为在不同次测试中会得到同样的结果。

如果不这样设计会怎样?想象一下你在玩一局扑克,对手出的牌完全是随机的,那么无论你多会算牌,输赢很大程度上还是看运气,你没法证明自己的策略到底行不行。这个模拟世界如果让供应商的态度和底价随机波动,那两个AI跑出来的成绩差异,你根本分不清是策略高下的差异,还是纯粹撞大运撞出来的差异。把供应商的经济决策做成确定性的,就是把"运气"这个变量从考试里摘出去,让分数只反映真本事。

更狠的是,论文里152个供应商是彻头彻尾的骗子,占了整个576个供应商名单里的四分之一还多。这些骗子供应商用的谈判策略,跟正经供应商里最难缠的那一档一模一样,唯一的区别藏在让步的速度里:骗子让步得比最强硬的诚实供应商还要慢。这个信号非常隐蔽,AI要是接受得太快,连这唯一的破绽都抓不到,只能靠读聊天记录里的蛛丝马迹去分辨对方是不是在下套。

骗术分两种,一种当场宰你,一种秋后算账

这些骗子供应商具体是怎么下手的,论文分了两大类,时机完全不同。

第一类是签约前下手。最常见的手法是推销"会员费",供应商会说交1000块钱就能拿到市场价三成的会员价,结果钱交了,便宜价格从来没兑现过。还有的会承诺"下次订货给你打折",或者制造紧迫感,说"最后一批库存了,再不下单就没了"。这三招的共同点是,它们把成交价格抬高到了正常范围的1.5倍左右,但这个抬高后的价格仍然落在诚实供应商可能报出的合理区间内,所以光看价格根本发现不了猫腻,只能靠聊天里那些反常的推销话术。

第二类是签约后下手,价格完全正常,骗术藏在货物里。要么是缺斤少两,付了100件的钱只送来60到70件;要么是以次充好,发来的货有问题,退货率飙升到至少40%甚至翻倍。这类骗术最阴险的地方在于,它把有问题的货和正常货混在同一批库存里,等你发现退货率不对劲的时候,钱早就打出去了,而且你根本查不出问题究竟出在哪一批货、哪个供应商身上。

我算了一下,整个测试里因为这类骗局损失掉的钱里,53.4%来自以次充好这一种手法,占了大头。

这里可以做个类比。这就像你去菜市场买菜,一个摊主开价合理但偷偷往秤里加了配重块,另一个摊主开价明显偏高但过程光明正大。如果你只盯着价格标签看,那个偷偷加配重的摊主永远抓不到现行,因为价格本身没有任何异常,异常只会在你回家称重的那一刻才显现出来,而那时候钱已经付了。E-Commerce Bench里最会骗人的供应商,玩的就是这套把戏。

有意思的是,论文发现最会赚钱的模型GPT-5.6 Sol,在防骗这项上排在倒数第三名(18个模型里排第16),而最干净的模型Claude Opus 4.7,防骗做得最好,但赚的钱只排在中游。这说明会赚钱和不上当受骗,压根不是同一种能力。

一年时间,AI到底在忙活什么

想搞懂AI在这一年里具体干了什么,得先说说这个虚拟世界是怎么运转的。

整个系统被分成了四层。最底下是数据层,里面塞进了6886种真实商品、576家供应商、60个商品分类、12种店铺类型,数据全部来自淘宝天猫这样的真实电商平台经过脱敏处理后的信息。往上一层是环境层,负责计算每天谁买了什么、供应商怎么谈判。再往上是工具层,给AI提供了18种操作按钮,查市场、搜供应商、开店铺、发货、提现,一应俱全。最上面是智能体循环层,负责管理AI每一步的行动节奏和记忆。

这里有个特别值得说的细节。这个模拟世界是按照"回合制"运转的,AI在一次调用里可以连续下达好几个操作指令,系统按顺序一个个执行,每个操作都会消耗虚拟世界里的分钟数,比如查一次余额花10分钟,开一家店花60分钟,一整个工作日只有600分钟。这意味着AI不能无限制地反复查询、反复试探,时间本身就是一种资源。

时间预算制:每个操作都对应固定的虚拟时间消耗,一天只有600分钟可用,逼迫AI在探索(查信息)和执行(下单、发货)之间做取舍,而不能无限次免费试错。

这套设计带来一个很现实的约束。全年下来,平均每个AI大约要执行1000到4000次工具调用,但18种工具里,真正能改变商品成本的供应商谈判环节,占用的调用次数不到十五分之一。绝大部分时间花在了发货、查状态、提现这些日常琐事上。

再说一个容易被忽略但特别重要的机制,叫做上下文淘汰(Context Eviction)。AI和这个世界的每一次对话,都会累积进它的"记忆窗口"里,但这个窗口有容量上限,大约是十二万八千个token(可以粗略理解为字词的计量单位)。一旦对话记录快要塞满这个窗口,系统就会自动删掉最早的一批记录,只留下最新的几轮对话和最开始的任务说明。

这套机制像极了你手机相册快满了的时候,系统提示你清理旧照片。区别在于,这里删掉的不是照片,而是AI经商过程中积累的经验,比如它上次跟某个供应商砍到了多少钱、哪个供应商曾经骗过它。如果AI没有把这些关键信息主动记到一个专门留出来的"备忘录"里,这些信息一旦被系统清理掉,就彻底消失了,AI下次面对同一个供应商时,只能从头再谈一遍,完全不记得上次的战果。

论文里专门给AI留了一个持久记忆模块,最多能存20条笔记,这些笔记不会被自动清理。但实测发现,大部分AI几乎不用这个功能,20个位置一年下来只被翻来覆去改了几十次。这就好比公司发了你一个专门用来记重要客户信息的笔记本,结果你从来没打开过,每次谈判都是凭当场的印象现场发挥。

赚钱最多的不等于最会谈判

如果只看最终账户余额这一个数字,你会得出一个简单粗暴的结论:GPT-5.6 Sol最强,Qwen3.5-Plus最菜。但这篇论文最狠的地方,恰恰是它不满足于只看这一个数字。

研究团队专门设计了六个维度来拆解"赚钱"这件事背后到底发生了什么:谈判水平、防骗能力、现金流健康度、运营效率、执行力、以及跨越一整年的学习成长能力。

结果非常打脸。排名第一的GPT-5.6 Sol,在防骗这一项上18个模型里排第16;在运营效率(每次操作能换来多少利润)上,还不如排名第二的Fable5,后者每次工具调用平均能赚回479块钱,而GPT-5.6 Sol只有363块钱,足足少了近三分之一。

而谈判能力最强的Claude Opus 4.7,能把每笔交易的议价空间吃掉81.1%,是全场最会砍价的模型,防骗做得也最干净,但它最终账户余额只排在中游第八名。

这说明什么?一个既能狠狠砍价、又几乎不上当受骗的AI,不代表它就是最会赚钱的商人。会砍价是一回事,敢下单、敢铺货、敢冒险扩张又是另一回事。这跟现实里那种精打细算但不敢下重注的小老板,和敢冒险却经常被坑一把的野心家,是同一个道理。

这里必须提一下开源模型里的表现。Qwen3.8-Max-Preview,也就是阿里巴巴自家的模型,在十个开源模型里排名第一,一年下来把十万块钱变成了41.6万,比第二名的智谱GLM 5.2高出38%。更值得注意的是,它是全场唯一一个真正展现出"越谈越精"这种学习曲线的模型:面对同一个供应商反复下单时,价格是持续走低的,而其余17个模型里有16个,压根没表现出这种随经验积累而提升议价能力的迹象。

论文里专门统计了8647次针对同一家诚实供应商、同一款商品的重复购买记录,发现绝大多数AI在第二次、第三次下单时,支付的价格并不比第一次更低,有时候反而更高。这就好比你去同一家店买了十次同款咖啡,第一次因为不熟悉行情多付了钱情有可原,但第十次还在多付冤枉钱,说明你压根没有从前九次的经历里学到任何东西。这暴露了当前AI在"长期经验积累"这件事上一个非常本质的短板:它们可能很擅长在一次对话里表现得很聪明,但没法把过去几百天的交易历史真正内化成可复用的策略。

破产是怎么发生的

十八个模型里,有四个至少有一次经营到中途就宣告破产,GPT-5.5甚至有两次尝试在第17天就破产了,这时候一分钱的销售收入都还没结算到账。

破产的机制说起来其实很简单,但很容易被忽视。这个虚拟世界里的钱分三个账户存放:银行账户、平台钱包、还有在途的托管资金(Escrow)。

托管资金:货物发出后,销售收入不会立刻进你口袋,而是先冻结在一个"托管账户"里,过九天之后才会转入平台钱包,你还得再手动操作一次提现,才能把钱转回可以自由支配的银行账户。

这个设计跟真实电商平台的资金结算规则几乎一模一样,也正是这套规则制造了破产的陷阱。你采购货物、开店铺、每天的运营成本,这些钱是立刻从银行账户里扣掉的,一分钟都不会拖延。但你卖出去东西赚的钱,要等发货、等退货窗口过去、等九天托管期结束、再等你自己记得去点提现,前前后后加起来可能要半个月甚至更久,钱才能真正回到你能花的账户里。

一旦银行账户连续十天都是负数,系统就直接判定这家店破产,游戏结束。

这就像你开了一家实体小吃店,你每天要付房租、进货款、水电费,这些都是当场现结的硬支出。但顾客扫码支付的钱,平台要压半个月才结算给你,而且结算了你还得自己记得去银行柜台把钱取出来才能用。如果你不留够足够的周转资金硬扛过这半个月的空窗期,哪怕你每天生意火爆、账面上是赚钱的,你也可能因为手头没有现钱付房租而被房东赶出去。这就是为什么论文里发现,有的AI明明在"赚钱"这件事上做得不错,却因为把钱都压在囤货和托管账户里,现金流一断就直接破产。

论文里专门追踪了一个Qwen3.5-Plus的破产案例,细节相当扎心。这个AI在一年的第一天就一口气开了四家店,几乎把十万块钱本金的三分之二都花在了囤货上。但接下来的一百三十天,它总共只卖出去1428件商品,远远配不上它囤的货量。更雪上加霜的是,它24笔采购订单里有12笔付给了骗子供应商,钱花在了虚高的价格上。到了5月2日,银行账户第一次出现负数,而这时候平台钱包里躺着的钱最多也就一千多块钱,根本不够填这个窟窿。十天倒计时一到,游戏结束。

破产从来不是某一天突然发生的意外,是一连串错误决策提前半年埋下的雷。

写在后面

读完这篇论文,我印象最深的不是排行榜,是那种"看起来很聪明的AI,骨子里可能压根没在真正积累经验"的落差感。

论文里有个细节我反复琢磨了很久:研究团队专门设计了一个反事实检验,把每个AI实际拿到的成交价格,和"把这些价格随机打乱顺序"得到的结果做对比。如果一个AI真的在学习,它后面的成交价应该比随机排列的价格更低,因为它记住了之前谈到的最优价格。结果是,16个模型的实际表现,比随机打乱后的结果还要差,这意味着它们的议价能力不是在随时间进步,反而有点像在退步,或者说压根没有形成任何"记住历史最优价、并以此为基准继续压价"的习惯。

这让我想起一个问题:我们现在评价一个AI聪不聪明,很多时候看的是它单次回答问题的质量,像做一道数学题、写一段代码。但这篇论文提醒我,真正的智能,可能更多体现在"能不能把过去的经验,变成未来决策里看得见的改进"这件事上。一个人聊天聊得很妙,和一个人能把十年生意经营成越做越精的老字号,考验的根本不是同一种能力。

还有一点值得琢磨。论文特意把供应商谈判做成了确定性的,目的是排除运气因素,让分数只反映真本事。但反过来想,现实世界里的商业环境从来不是确定性的,竞争对手会变、政策会变、消费者口味会变。E-Commerce Bench证明了AI在一个规则透明、没有噪音的世界里都很难做到持续学习和自我修正,那放到真实世界里,这个短板会不会被进一步放大?

这大概是这篇论文留给我的最后一个问题:如果连一个规则写死、供应商行为可预测的模拟商店都能让顶尖AI集体栽跟头,我们距离让AI真正独立经营一家公司,到底还有多远?

Q&A

Q1:E-Commerce Bench是什么?

A:E-Commerce Bench是由阿里巴巴Qwen团队联合香港科技大学开发的一套评测基准,让AI模型在模拟的365天里经营最多四家网店,涵盖市场调研、供应商谈判、库存管理、订单履行等全流程,考核AI在长周期自主商业运营中的表现。

Q2:为什么GPT-5.6 Sol赚钱最多却排名靠后?

A:GPT-5.6 Sol年末总资产排名第一,达到143万元,但它在防骗能力上18个模型里排第16,每次工具调用的平均利润也不如排名第二的Fable5,说明赚钱多少和综合运营能力并非同一回事。

Q3:为什么大部分AI在多次采购同一商品时价格没有下降?

A:研究团队统计了8647次重复采购记录,发现16个模型没有表现出随经验积累而压价的能力,原因可能在于AI的上下文记忆窗口有限,过去的谈判记录容易被自动清理,而专门留出的持久记忆功能又很少被主动使用。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-