
这项由香港理工大学与杭州戴根斯生物技术有限公司联合完成的研究,以预印本形式发布于2026年7月14日,arXiv编号为2607.13027,感兴趣的读者可通过该编号在arXiv平台上查阅完整论文。
你有没有想过,手机里的AI助手为什么总感觉"隔了一层"?你让它帮你查日历、发消息、整理文件,它却要绕一大圈,先把你的屏幕截图传到远处的服务器,服务器再想办法"看懂"你的屏幕,然后指挥一根虚拟手指去点击按钮——就好像你想开冰箱拿瓶水,却要先给远在千里之外的助理发一张冰箱的照片,等他看完照片告诉你"往左数第二格",你再照着做。这整个过程,慢不说,还特别容易出错。
这项研究提出的框架叫做PalmClaw,它的核心思路是:把"管家"直接请进家里来住,而不是每次有事都打电话给外面的代理。PalmClaw让AI的大脑直接住在手机上,直接操作手机里的日历、联系人、文件、蓝牙等功能,而不是像以前那样对着屏幕截图反复猜测该点哪里。实验结果相当直观:与同类方案中表现最好的竞争者相比,PalmClaw的任务完成成功率提升了11.5%,而完成同一个任务所需的时间缩短了94.9%——换句话说,别人需要6分钟才能帮你加一条日历提醒,PalmClaw只需要不到20秒。
---
一、手机上的AI助手,为什么现在还这么"笨拙"
回到那个"冰箱拿水"的比喻。现有的绝大多数手机AI助手,本质上都是"远程遥控"模式。手机屏幕被截图,图片被传送到电脑或云端服务器,服务器上运行着AI大脑,AI看完图后告诉手机"在屏幕坐标(320, 450)的位置点一下",手机再执行这个点击动作。这种做法在技术上叫做"GUI操作",GUI是"图形用户界面"的缩写,通俗来讲就是通过模拟人手点击、滑动、输入来完成任务。
这套方案有三个根本性的毛病。第一,每完成一件事情都需要很多步骤。加一条日历提醒,AI要先找到日历图标,点进去,找到正确的日期,再点"新建",填写标题,填写时间,最后保存——每一步都要截图、传输、分析、再执行,像是在用放大镜一格一格地读地图。第二,屏幕的样子稍微变一变,AI就可能找不着北。手机系统更新了,按钮位置换了个地方,AI就傻眼了。第三,这种方式相当于给了AI一把万能钥匙,但没有告诉它哪些门该进哪些门不该进,缺乏明确的边界管控。
与此同时,手机其实是一个极其个人化的设备。全球大约80%的10岁以上人口拥有手机,手机里存着联系人、照片、文件、位置信息、日常应用——这些恰恰是一个真正有用的AI助手最需要接触的资源。然而,现有方案把AI的"大脑"放在遥远的服务器上,既增加了延迟,又让用户的隐私数据在传输过程中多了一道风险。
这就是PalmClaw要解决的核心矛盾:手机上有那么多有用的东西,AI助手却要绕远路才能用到它们。
---
二、PalmClaw的核心设计:把"管家"直接请进家
PalmClaw的设计哲学可以用一个更贴切的比喻来理解:把它想成一个直接住在你家的私人助理,而不是一个住在另一栋楼里、每次都要你开门让他进来的临时工。
这个"住在家里的助理"由几个关键部分组成,缺一不可。
第一个部分叫做"会话"。助理记得你们之间每一次对话的内容。你今天让他帮你整理文件,明天再提到"上次说的那个文件",他立刻知道你在说什么,不需要你重新解释。PalmClaw的会话系统支持三种输入来源:你直接在手机上聊天、通过连接的远程频道发来的消息,以及按照预设时间自动触发的任务。每个会话都有自己独立的历史记录、工具操作痕迹和一个专属的工作空间,用来存放任务期间生成的文档和临时文件。
第二个部分叫做"记忆"。PalmClaw维护两层记忆:一层是跨会话共享的长期记忆,比如你的偏好、常用联系人、写作风格;另一层是每个会话自己的摘要,记录这次任务进展到哪里了、结论是什么。当旧的对话积累太多,系统会自动调用一次AI来总结归纳,把精华保留下来,避免每次都把所有历史都塞进上下文里,既节省资源,又保持准确性。
第三个部分叫做"技能"。技能是一些可以反复使用的任务指南,存储在叫做SKILL.md的文件里,就像一本写好的操作手册。PalmClaw内置了一批技能,用户也可以自己安装新的。每次需要完成任务时,系统不会把所有技能说明都一股脑塞进AI的上下文,而是先看看当前任务的描述,再智能地选出最相关的技能加载进来,这样既能给AI提供专业指导,又不会造成信息过载。
第四个部分,也是最核心的创新,叫做"设备工具"。这是PalmClaw与所有竞争方案最本质的区别所在。
---
三、"设备工具":给AI一把有边界的钥匙
现有方案给AI的是"截图+点击"的操作方式,就像给一个不认识路的人一张模糊的地图,让他自己摸索着走。PalmClaw的设备工具则完全不同——它把手机上的每一项功能都包装成一个有清晰说明书的接口,就像一套专门定制的工具箱,每把工具的用法、参数和使用范围都写得清清楚楚。
以日历功能为例,PalmClaw不是让AI去找日历app的图标然后点进去,而是直接告诉AI:"你有一个叫calendar_create_event的工具,它需要你提供标题、开始时间、结束时间和时区,调用它就可以直接创建日历事件。"AI只需要把正确的参数填进去,工具自动去操作手机的日历系统,然后把结果(成功或失败)告诉AI。
PalmClaw内置的工具覆盖了手机上几乎所有常用功能。设备与媒体方面,有查询设备状态、控制媒体播放、管理蓝牙连接的工具。个人数据方面,有读写日历事件和联系人的工具。工作空间与文件方面,有列出文件、读文件、写文件、删除、移动、搜索内容的一整套工具。网络方面,有搜索网页、获取网页内容、查询天气的工具。频道与自动化方面,有管理会话、发送消息、设置定时任务的工具。还有专门的记忆管理工具,让AI可以主动读取或更新自己的长期记忆。
这套工具体系的精妙之处在于它如何处理"边界"问题。每次AI想要调用一个工具,PalmClaw会在实际执行之前进行三道检查。
第一道检查叫"参数校验":AI填写的参数格式对不对?有没有漏填必填项?数值有没有超出允许范围?这就像收银台在刷卡之前先核对一下你有没有签名。
第二道检查叫"权限核验":这个操作需要手机授权吗?需要用户亲自确认吗?如果AI想要访问你的日历但还没有日历权限,PalmClaw会弹出系统权限请求,等你点击"允许"之后才继续。如果是需要用户亲自参与的操作(比如拍照),系统会先发送确认请求,用户确认后才执行。
第三道检查叫"工作空间验证":AI想要读写的文件路径在不在允许的范围内?每个会话都有自己独立的工作空间,AI可以自由操作自己会话里的文件,但如果它想访问其他会话的文件或者手机上的公共路径,就需要经过专门的审批流程。这就像公司里每个员工有自己的办公抽屉,想要进入档案室就必须登记申请。
三道检查都通过之后,工具才真正去执行对应的手机操作,把结果以结构化的格式返回给AI,让AI决定下一步该做什么。任何一道检查失败,或者用户拒绝了权限请求,PalmClaw都会返回一个清晰的错误说明,而不是让AI去猜为什么没成功。
---
四、整个系统是怎么运转的
把上面这些部分拼在一起,PalmClaw的运作流程就像一个经验丰富的助理处理一项委托任务的过程。
当你发出一条指令,比如"帮我把明天上午10点与Alex的会议加到日历里",PalmClaw首先把这条消息分配到一个会话中。接着,系统开始组装这次任务所需要的完整上下文,这个上下文包含六个来源的信息:系统基本设定(AI的角色定位、行为准则、用户个人偏好)、当前运行环境(当前时间、时区、会话ID、工作空间路径)、长期记忆(你的日程偏好、常用联系人等)、当前激活的技能说明和可用技能摘要、最近的对话历史和工具操作记录,以及所有可用工具的说明和参数格式。这六部分信息拼在一起,形成AI这次思考所需要的完整背景,就像给助理一份详尽的任务简报。
拿到这份简报后,AI开始进行多轮推理与行动的循环。第一轮,AI根据上下文决定要调用calendar_create_event工具,填入标题"Meeting with Alex"、时间"明天上午10点"、时区等参数。PalmClaw拿到这个工具调用请求,先过三道检查——发现日历权限还没有授予,于是向你弹出权限请求。你点击"允许"之后,第二轮开始,工具调用重新进入流程,这次权限检查通过,日历事件被成功创建,工具返回"成功,事件已创建"的结果。AI收到这个结果,判断任务已完成,生成最终回复:"已为您安排了明天上午10点与Alex的会议。"整个循环结束。
这个过程的关键在于,整个循环都在手机上完成,唯一离开手机的是发给远程大语言模型API的"思考请求"——AI的具体推理过程确实还是在云端完成的,但所有的上下文管理、工具执行、会话记录都留在手机本地。这就是"原生在设备上运行"的真正含义。
---
五、实验结果:数字背后的故事
研究团队设计了两套评测来检验PalmClaw的实际表现。
第一套叫MobileTask,包含70个真实的手机操作任务,涵盖日历管理、天气查询、联系人操作、录音、记事、文件管理、蓝牙控制和媒体管理等场景,这些任务改编自学术界已有的三个知名手机AI基准测试数据集。第二套叫AssistantBench,包含19个需要在网络上搜索信息并给出可验证答案的任务,用来测试AI在信息检索方面的能力。
与PalmClaw对比的有三个开源的手机AI方案。MobileClaw的AI大脑运行在电脑上,通过屏幕截图观察手机然后发出点击指令;ClawMobile把AI运行环境放在手机上的Termux(一个在Android上模拟Linux终端的应用)里,混合使用手机API、命令行和GUI操作;ApkClaw是一个运行在手机上的Android应用,通过模拟点击、滑动等GUI操作来完成任务。
MobileTask的成绩单非常清晰。MobileClaw完成了60%的任务,平均每个任务需要94.3次AI调用、130万个token(可以理解为AI处理的文字量),花费1197秒,大约20分钟。ClawMobile表现好一些,成功率77.1%,平均51.4次调用、46.6万token、451秒。ApkClaw作为目前最强的竞争方案,成功率87.1%,但平均需要103.9次调用、206万token,完成时间348.8秒,将近6分钟。
PalmClaw的数字则完全是另一个量级:成功率97.1%,平均只需要2.8次调用、5.04万token,完成时间17.7秒。与ApkClaw相比,成功率的相对提升是11.5%,完成时间缩短了94.9%。换句话说,ApkClaw需要6分钟才能完成的任务,PalmClaw平均不到18秒就搞定了。
这种效率差距的根本原因在于:GUI方式的AI每次行动前都要"看清楚"屏幕,找到目标元素,再执行操作,一个简单的"新建日历事件"可能需要十几步甚至几十步GUI操作;而PalmClaw直接调用设备工具,一步到位,不需要在界面上来回导航。在AssistantBench的信息检索任务上,PalmClaw同样获得了最高的36.85%准确率,而最强竞争方对手ApkClaw只有25.79%。
---
六、部署门槛:普通人能不能用得上
一项技术再厉害,如果部署过程过于复杂,普通用户根本无从下手,那实用价值就大打折扣。研究团队专门对各个方案的部署门槛进行了比较。
对照组里加入了OpenClaw,这是一个典型的运行在电脑上的AI助手框架,作为"传统桌面方案"的代表。OpenClaw需要一台独立的电脑、命令行操作,可选择性地建立手机与电脑之间的连接桥梁,手动设置步骤有4个,大约需要5分钟。MobileClaw的情况更复杂,必须有电脑、必须用命令行、必须建立连接桥梁,8个步骤,大约15分钟。ClawMobile不需要额外的电脑,但需要在手机上使用命令行(通过Termux),6个步骤,由于Termux环境配置相对繁琐,实测约25分钟。ApkClaw不需要电脑也不需要命令行,3个步骤,约5分钟。
PalmClaw:不需要电脑,不需要命令行,不需要桥接,2个步骤,约2分钟。这2个步骤基本上就是安装应用,然后配置你想使用的AI服务提供商的API密钥,之后直接就可以开始用。
这种差距来自于PalmClaw的设计原则:用户入口和AI框架都在手机上,没有需要配置的外部环境,没有需要维护的连接,手机本身就是完整的运行环境。
---
七、边界管控的真实案例
执行边界这个概念听起来比较抽象,不如通过两个具体的真实案例来理解它在实践中是如何工作的。
第一个案例,用户说:"帮我在明天上午10点创建一个与Alex的会议。"PalmClaw接收指令,AI决定调用日历工具,工具执行到权限检查这一步,发现应用还没有被授权访问日历。系统不会假装成功,也不会直接报错结束任务,而是向用户发出日历权限请求。用户点击"允许",权限获得授予,工具重新被调用,这次成功创建了日历事件,AI回复"会议已创建"。整个过程透明可控,用户清楚地知道AI访问了什么、为什么需要这个权限。
第二个案例,用户说:"把我的购物清单保存到SDCard/list.txt。"这是一个涉及公共存储路径的写文件操作,超出了PalmClaw的当前会话工作空间。文件工具返回一个边界结果:目标路径在当前工作空间之外,需要"访问所有文件"的权限。与日历权限不同,这个权限无法通过普通的权限弹窗授予,需要用户手动进入系统设置页面开启。PalmClaw不会让AI猜测应该怎么办,而是直接打开应用设置页面,并告诉用户:"请开启'允许访问所有文件'选项后继续。"用户完成设置,任务继续执行。
研究团队还整理了另外两类边界场景。当用户请求拍照时,由于拍照属于需要用户直接参与的操作,PalmClaw会先发送确认请求,等用户确认后才真正触发相机;当用户说"打开Instagram查看朋友动态"时,由于PalmClaw的工具列表里没有直接操作Instagram的工具,它会如实告知用户"这个操作目前不受支持",而不是冒险尝试一些可能出错的操作。
---
说到底,PalmClaw解决的不只是一个技术问题,而是在重新思考AI助手和手机之间的关系应该是什么样的。过去的方案把手机当成一个被动的"被操作对象",通过截图和点击来间接控制;PalmClaw把手机当成一个主动的"运行环境",AI和手机的功能直接对话,效率自然不在一个量级。
当然,这个框架目前也有局限性。AI的核心推理仍然依赖远程API,意味着完全离线使用还无法实现。当用户请求的操作超出现有工具列表时,系统只能报告"不支持",而无法像GUI方案那样灵活尝试任何屏幕上可见的操作。此外,让AI直接访问手机的日历、联系人、文件等敏感数据,也需要用户在使用时仔细考虑信任边界——毕竟,提供AI推理服务的远程提供商是会接收到任务上下文信息的。研究团队在论文中也坦诚地提出了这一点,建议部署时向用户清晰说明数据流向。
手机里的AI助手能做到什么程度,或许这项工作给出了一个新的参考答案。有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.13027查阅完整论文,代码也以AGPLv3开源协议发布在GitHub上,搜索PalmClaw即可找到。
---
Q&A
Q1:PalmClaw和普通手机语音助手(比如Siri、小爱同学)有什么不同?
A:普通语音助手通常只能执行单步指令,比如"打开音乐"或"发短信给妈妈",背后逻辑相对固定。PalmClaw是一个多步骤的AI代理框架,可以把一个复杂任务拆解成多个步骤,调用多个工具,根据每一步的结果决定下一步怎么做,还拥有跨会话的长期记忆和可扩展的技能系统,更像一个能独立思考的任务执行者,而不是一个快捷指令响应器。
Q2:PalmClaw的"设备工具"和GUI点击操作相比,到底哪种方式更安全?
A:PalmClaw的设备工具在安全性上有明确优势,因为每次操作都经过参数校验、权限核验和工作空间边界三道检查,AI无法随意访问超出授权范围的资源,每个操作的范围是明确定义的。GUI点击方案则是给了AI对整个可见屏幕的"万能权限",它能点到哪里就能操作到哪里,边界模糊,出错时也更难追溯原因。
Q3:PalmClaw需要把手机数据上传到云端吗?
A:PalmClaw的会话记录、记忆、工具执行都在手机本地完成,但AI进行推理思考时需要调用远程的大语言模型API,这意味着任务相关的上下文信息(比如你的指令、工具返回的结果)会被发送给API提供商。研究团队在论文中明确建议:使用时应向用户清晰说明数据会流向哪个API服务商,用户在选择服务商时需要自行评估信任程度。
好文章,需要你的鼓励
ARCHead是一种专门压缩大语言模型输出层的方法,通过量化低秩核心与激活度量修正,将LM-head存储压缩至BF16的约25%,质量损失极小。
这项研究发现AI投票推理在多答案问题上会系统性失效,提出用因果数学规则直接验证候选答案的CALVER方法,准确率比投票提升约11至19个百分点,且差距随尝试次数持续扩大。
这项来自港科大与腾讯视频的研究提出WorldCycle框架,通过可逆动作循环构造无标注自验证奖励,将视频世界模型的长程漂移误差降低最高44%,复合动作准确率提升约四倍。
哥本哈根大学团队构建了首个同时覆盖三种引用粒度、屏蔽信息泄露、包含全量段落候选库的法律信息检索数据集LegalPincite,用于评估法律判决段落精确检索任务。