微信扫一扫,关注公众号

  • 科技行者

  • 算力行者

见证连接与计算的「力量」

首页 给电脑装个"嘴",AI才真正学会用电脑

给电脑装个"嘴",AI才真正学会用电脑

2026-10-09 14:37
分享至:
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-
2026-10-09 14:37 • 科技行者

你有没有想过一个问题:如果让你远程操作一台电脑,帮别人改一份Excel表格里几百行数据的格式,你会怎么做?

大概率你不会一个一个单元格去点右键改字体,你会打开一个脚本,写几行代码,唰地一下全改完了。可现在市面上大多数的AI电脑助手,干的却是前者的事。它们像一个只会用鼠标和键盘的实习生,一步一步地点击、拖拽、输入,17步才能改完一张表,还经常点错地方。

这就是这篇论文想解决的问题。

**当AI只会用手,不会用嘴**

先说说现在AI操作电脑的两条路子。

第一条路子最常见,叫"纯GUI"操作。

GUI(图形用户界面):就是我们平时看到的窗口、按钮、菜单这些可以用鼠标点击的界面。

AI通过截图看屏幕,然后模拟鼠标点击、键盘输入,跟人操作电脑的方式一模一样。这个办法的好处是通用,只要是个软件界面,理论上都能这么操作。但坏处也很明显:慢,而且容易出错。一个任务如果需要十几二十步操作,只要中间有一步点歪了,后面全乱套,这就是论文里说的"级联错误"。

第二条路子是给AI配上专门的工具或者API接口,让它可以直接调用软件提供的功能,不用一步步点。这样效率是高了,但代价是每个软件都得单独开发一套接口,费时费力,换个软件又得重新做一遍,根本没法规模化推广。

论文作者们的想法是:为什么不让AI也学会用命令行呢?

CLI:全称是Command-Line Interface(命令行界面),就是那个只有文字、没有图形按钮的黑框框,程序员写脚本、批量处理文件常用它。

命令行这东西是操作系统自带的,不需要额外开发,而且一行命令往往能顶几十次鼠标点击。你想批量把一百个文件改名,用鼠标一个个改可能要十分钟,用命令行一条命令几秒钟搞定。这就是论文标题里"HybridCUA"的核心思路:**让AI同时会用图形界面的手,也会用命令行的嘴,两者搭配着来。**

这就好比你请了一个家政阿姨,她既会用吸尘器一点点清理地板的犄角旮旯(这是GUI擅长的,处理那些必须靠"看"才能操作的视觉任务),也会用洗衣机一键洗完一大桶脏衣服(这是CLI擅长的,批量处理、重复操作)。如果这个阿姨只会用吸尘器吸衣服,那效率可想而知;如果她只会用洗衣机,那沙发缝里的灰尘她永远处理不了。真正厉害的阿姨,知道什么时候该用手,什么时候该按下那个"一键启动"的按钮。

**光给AI装个命令行,反而更差了**

这里有一件挺让人意外的事。

研究团队做了个实验,直接把命令行工具塞给几个现成的、挺厉害的AI模型,包括Qwen3.5-27B和EvoCUA-32B这些参数量不小的模型。按理说,工具多了应该更强吧?

结果恰恰相反。

四个测试的模型,在拿到命令行权限之后,在OSWorld这个基准测试上的准确率反而集体下滑,跌幅从2.5到11.5个百分点不等。

OSWorld:一个专门用来测试AI能不能像人一样操作真实电脑完成任务的评测基准,包含361个来自办公软件、系统设置、浏览器等各种场景的任务。

更有意思的是,即便给了命令行,这些模型也很少真正去用。Qwen3.5-27B只有15%的操作步骤用了命令行,而EvoCUA-32B干脆几乎不用,命令行使用率只有0.15%,等于形同虚设。

这说明了一个很关键的事实:**不是给AI一把新工具,它就自动会用。**

如果不搞清楚这一点会怎样?会出现"手里拿着螺丝刀,却还在用扳手拧螺丝"的尴尬场面。这些AI模型虽然理论上能访问命令行,但它们脑子里根本没有"这个任务应该用命令行来做"这根弦,也不知道命令怎么写才对,结果就是命令行成了摆设,甚至因为偶尔用错反而拖了后腿。瓶颈根本不在于"有没有工具",而在于"知不知道什么时候用、怎么用"。

**给AI"喂"三种不同的训练素材**

要让AI学会判断"这活儿该用手还是该用嘴",光靠现成的数据是不够的。

论文里提到一个很现实的困境:专门收集GUI操作的数据集里几乎全是点击拖拽,收集命令行和代码的数据集又完全脱离了图形界面的上下文。这两类数据像两条永不相交的平行线,谁也没法教会AI在真实的、图形化的电脑环境里,恰当地切换到命令行。

于是研究团队干了一件挺巧妙的事:**他们发现很多GUI操作序列,其实是能找到等价的命令行写法的。**这就好比你会发现,用鼠标一步步把文件从A文件夹拖到B文件夹,跟直接敲一行mv命令,效果是完全等价的,只是过程不同而已。既然如此,为什么不把现成的GUI操作"翻译"成命令行操作呢?

基于这个思路,他们搭建了一套数据生成流水线,产出了三种类型的轨迹(也就是AI完成一个任务的完整操作记录)。

第一种是纯GUI轨迹,来自开源的UI-MOPD数据集,把里面的每一步点击拖拽都改写成等价的PyAutoGUI代码(一种可以用代码模拟鼠标键盘操作的Python库),塞进统一的操作格式里。

第二种是纯CLI轨迹。研究人员先给每个应用(比如LibreOffice、GIMP这些软件)整理出一份专属的"命令行技能手册",列出这个软件有哪些命令行接口、常用命令是什么、典型用法长啥样。然后让一个叫Qwen3.8-27B的模型,只用命令行去完成任务,成功的记录就留下来。

第三种是最关键的混合轨迹,也就是GUI和CLI交替使用的操作记录。这里又分两条路:一条是让模型同时拥有两种工具,自己在执行过程中判断该用哪个;另一条是把之前纯GUI轨迹里适合改写的片段,直接转换成对应的命令行命令,重新跑一遍,只保留跑成功的版本。

最终这套流水线产出了5000条轨迹,加上3000个经过验证的强化学习任务,合称HybridCUA-8K。

值得一提的是,这些轨迹不是随便攒出来的。论文里给出了详细的应用领域分布:LibreOffice的三大件(Impress、Writer、Calc)各贡献了八百多条轨迹,多应用协同的场景贡献了786条。平均每条轨迹有10.4个逻辑步骤,最长的能到50步。

**训练分两步走:先学着模仿,再自己摸索**

光有数据还不够,怎么把这些数据"喂"给模型,让它真正学会判断,这是第二个技术难点。

论文里设计了一套两阶段训练框架。

第一阶段叫监督微调(SFT),说白了就是让模型照着已经验证过的正确操作轨迹去模仿学习。这一步教会模型两件事:一是统一的操作格式怎么写,二是在什么样的场景下切换接口是合理的。

第二阶段是强化学习(RLVR),这一步更有意思。传统的强化学习通常只看最后任务有没有完成,完成了就给奖励,这种做法有个明显的漏洞。

举个例子,如果一个任务本来三步命令行就能搞定,AI却绕了二十步GUI操作最后也蒙对了,传统的奖励机制照样给满分,因为它只认"结果"不认"过程"。反过来,如果AI在命令行上敲错了一个命令,只要最后瞎猫碰上死耗子把任务做完了,这次出错也不会受到任何惩罚。

**这种"唯结果论"的奖励方式,根本没法教会AI什么时候该用命令行、命令又该怎么写才靠谱。**

于是研究团队设计了两种"CLI感知"的奖励信号。

第一种是任务级别的CLI奖励,专门解决"该不该用"的问题。他们给3000个验证任务都打上了标签,标明这个任务用命令行是不是有明显优势(这个标签是怎么来的呢:对每个任务分别用纯GUI、纯CLI、混合三种方式各跑16次,比较成功率和步数,选出表现最好的方式作为标准答案)。如果AI跑出来的轨迹选择的接口跟标准答案对上了,而且任务也做成功了,就给额外奖励;选错了接口,哪怕蒙对了结果,也拿不到这份奖励。

第二种是步骤级别的执行奖励,专门解决"怎么用"的问题。每当AI执行的命令行命令报错了,这一步就会受到惩罚,不管最终任务有没有完成。这就像老师批改作业,不只是看最后的分数对不对,还要检查你解题过程中每一步的公式写得规不规范。

这个设计思路其实很像教小孩子学做家务。你不能只是在孩子把碗洗干净后夸一句"真棒",你还得告诉他,用洗碗机洗一大摞碗比手洗快,但洗那个祖传的手绘瓷碗最好还是手洗,别图省事扔进机器里洗坏了。如果只奖励"碗洗干净了"这个结果,孩子永远学不会判断什么时候该用什么方法,甚至可能因为某次手洗恰好蒙对了结果,而对该用洗碗机的场景也继续手洗。

**训练出来的模型到底强在哪**

说了这么多设计思路,最后还是得看数据说话。

研究团队用Qwen3.5-9B作为基础模型,经过前面说的两阶段训练,得到了最终的HybridCUA-9B。

先看最重要的对比:只用GUI跟GUI加CLI混合,效果差多少。基础模型Qwen3.5-9B在纯GUI模式下的准确率是38.8%,平均要走31.6步。有意思的是,如果只是简单粗暴地给这个基础模型加上命令行访问权限,不经过任何训练,准确率反而暴跌到18.4%,印证了前面说的"瞎给工具反而更差"的现象。

但是经过完整的两阶段训练之后,HybridCUA-9B的准确率飙升到53.6%,平均步数也压缩到了14.0步。这意味着相比训练前的基础模型,准确率提升了整整14.8个百分点,任务完成所需的步数几乎减半。

拿这个成绩去跟同规模的其他模型比一比。

|模型|接口类型|准确率|平均步数|

|---|---|---|---|

|Qwen3.5-27B|GUI|51.4%|25.7|

|EvoCUA-32B|GUI|56.7%|25.0|

|ToolCUA-8B|GUI+API|46.8%|14.9|

|AutoGLM-OS-9B|GUI+API|48.9%|-|

|UltraCUA-32B|GUI+API|43.7%|-|

|**HybridCUA-9B**|**GUI+CLI**|**53.6%**|**14.0**|

值得注意的是,HybridCUA-9B在参数量只有9B的情况下,超过了参数量四倍于它的UltraCUA-32B将近10个百分点,还比同样走"GUI加专用API"路线的ToolCUA-8B高出近7个百分点,而且步数更少。**这也印证了论文最初的判断:命令行这条路,比给每个软件单独开发专用接口的路子更划算。**

再来看一个很能说明问题的细节。前面提过,现成的模型即便有命令行也不太会用,比如EvoCUA-32B的命令行使用率只有0.15%。而HybridCUA-9B训练完之后,命令行使用率达到了64%,跟测试的模型里使用率最高的Claude-Opus5基本持平(67%)。但奇怪的是,Claude-Opus5虽然也大量用命令行,准确率却反而比它的纯GUI版本低了6.6个百分点。

这说明了一件事:**光是多用命令行不等于用得好,关键是知道该在哪些场景下用。**这就好比两个人都爱用计算器算账,一个人是心算能力不行,什么都依赖计算器,结果反而因为按错键出错更多;另一个人是清楚哪些复杂计算该用计算器、哪些心算更快更准,用得恰到好处。数量一样不代表质量一样。

**AI是怎么分配任务的**

论文里还做了一些很有意思的分析,看看训练好的HybridCUA-9B到底是怎么判断该用GUI还是CLI的。

结果显示,它的选择是有章法的,跟具体的应用场景和操作类型紧密相关。比如在操作系统相关的任务里(涉及文件、系统设置这类),命令行的使用率高达84%,因为这类任务本来就是命令行的强项,直接读写文件比在图形界面里翻箱倒柜快得多。而在浏览器相关的任务里,图形界面的使用率反而达到74%,毕竟网页内容主要靠"看",命令行很难替代视觉交互。

按操作类型细分也很有意思。内容编辑类操作有85.8%用了命令行,结果验证类操作更是高达98.4%都用命令行,因为这类任务本质上是直接的数据处理和状态检查,用脚本一条命令读出来比在界面里一个个点开检查快多了。相反,涉及空间位置调整的操作,58.4%还是靠图形界面完成的,因为这种"把这个东西挪到那个位置"的任务天然需要视觉反馈来判断对不对。

论文里还举了一个具体的例子,很能说明两种接口是怎么配合的。任务是给一篇作文的引言、正文、结论三个部分分别设置单倍行距、双倍行距和1.5倍行距,字号统一改成12号。

AI的操作是这样的:先用图形界面点击打开文档窗口和菜单(这一步必须靠"看"),然后切换到命令行,用python-docx这个库批量处理格式和行距,一次性把三个段落都改完并保存文件。到了验证环节更有意思,AI先用图形界面操作把菜单关掉,紧接着在同一个命令行动作里,重新打开保存好的文件,检查字号和行距设置是否正确,两个动作打包在一条命令里执行。

这个例子特别能体现"混合"的真正含义,不是简单地把GUI步骤和CLI步骤拼接起来,而是让两者在同一个任务里各自发挥所长,该看的时候看,该批量处理的时候批量处理,甚至在一步操作里就能把两种动作揉合在一起。

**跨平台会不会也好使**

一个方法如果只能在特定场景下管用,价值就要打折扣了。研究团队专门测试了HybridCUA-9B在两个陌生环境里的表现,看看它学到的这套"接口选择能力"能不能迁移。

第一个测试场景是OSWorld-MCP,这是在OSWorld任务基础上加了MCP工具支持的环境。

MCP:全称Model Context Protocol,一种让AI模型可以调用外部工具和服务的标准化协议。

结果HybridCUA-9B拿到了47.1%的准确率,比同样规模的Qwen3.5-9B高出9.1个百分点,跟专门做GUI-API集成的ToolCUA-8B基本打平。这说明训练时学到的"什么时候该用命令行"这套判断逻辑,即便换到一个带着全新工具生态的环境里,依然管用。

第二个测试场景更极端,直接换操作系统,跑到WindowsAgentArena(一个专门评测多模态智能体在Windows系统上表现的基准)上试试。

要知道,HybridCUA-9B训练的时候用的全是Linux环境的shell命令,Windows系统底层用的是完全不同的命令语法(PowerShell)。结果它在WindowsAgentArena上拿到了36.0%的成绩,比基础模型高出4个百分点,比ToolCUA-8B也高出2.2个百分点。更让人意外的是,论文里提到它甚至能自主写出PowerShell命令,虽然训练过程中它压根没见过一条PowerShell命令。

这个结果其实挺发人深省的。**它说明模型真正学到的,不是死记硬背某个操作系统的具体命令语法,而是一种更底层的判断能力,知道什么时候该把活儿交给命令行去干。**这就好比一个厨师如果只是背下了某个菜谱的具体步骤,换一家厨房、换一套厨具他可能就懵了;但如果他理解的是"炖肉需要小火慢煮、爆炒需要大火快炒"这套底层逻辑,那换到哪个厨房他都能照样掌勺。

**这套方法还有没有讲究**

论文里还做了几组对照实验,专门验证每个设计细节是不是真的有必要,这些细节挺值得说道说道的。

第一组实验测的是训练数据的搭配比例。如果只用纯GUI数据训练,准确率是43.2%;只用纯CLI数据训练,反而跌到31.7%;只用混合轨迹训练,是41.0%。而把三种数据混在一起训练,准确率达到46.0%,比单独用任何一种数据都要好。这说明三种类型的数据教给模型的是不同的能力,缺一不可,互相之间是互补而非替代的关系。

第二组实验拆解了强化学习阶段两种奖励信号各自的作用。如果去掉专门判断"该不该用CLI"的任务级奖励,模型的准确率影响不大,但命令行使用率只能达到58.9%(相比完整版的64%),效率提升也打了折扣,步数只缩短了18.2%(完整版能缩短29.3%)。反过来,如果去掉专门盯着"命令执行对不对"的步骤级奖励,准确率和步数看起来影响也不大,但命令行的执行错误率会慢慢回升到16.5%,甚至比训练前的基础模型还要差。

**这两组数据放在一起看,说明这两种奖励信号各管一段:一个负责教会模型什么时候伸手去够命令行,另一个负责教会模型伸手之后怎么把命令写对,两者缺了任何一个都会留下明显的短板。**

第三组实验测的是动作格式的设计。研究团队对比了两种做法:一种是把GUI和CLI分别做成两个独立的工具接口,让AI自己判断调用哪个;另一种是这篇论文采用的统一方案,把两种操作都塞进同一个叫bash的动作接口里。结果统一格式的准确率是46.0%,分离格式的准确率是38.8%,整整低了7.2个百分点。这说明把两种接口硬生生拆开反而会增加模型的认知负担,融合成一套统一语法,反而更容易学会灵活切换。

Q&A

Q1:HybridCUA是什么?

A:HybridCUA是一套让AI电脑助手学会同时使用图形界面操作和命令行操作的训练框架,核心思路是让AI既能像人一样点击鼠标,也能在合适的时候用一条命令代替几十次点击,从而提升任务完成的准确率和效率。

Q2:为什么直接给AI开放命令行权限反而会让效果变差?

A:因为现有的AI模型没有经过专门训练,不知道什么时候该用命令行、命令又该怎么写才对,实验显示四个代表性模型加了命令行权限后准确率反而下滑了2.5到11.5个百分点,说明问题不在于有没有工具,而在于会不会用。

Q3:HybridCUA-9B的实际表现如何?

A:在OSWorld基准测试上准确率达到53.6%,比基础模型提升14.8个百分点,平均操作步数也从31.6步降到14.0步,还在跨系统的WindowsAgentArena测试中取得36.0%的成绩,展现出较强的跨平台迁移能力。

分享至
0赞

好文章,需要你的鼓励

推荐文章
----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.- ----..---.-...-/--...-.-......./-...-....-..--../-............-.-