arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

浙大团队做跨设备个人Agent,手机电脑共用一段对话

作者:arXivDaily编辑部 arXiv 2610.08699 cs · cs.AI

论文导读

浙江大学团队提出nanoMuse,把手机、电脑和网页端组织成同一个个人Agent:多个设备共享会话,每台设备在自己的运行环境里执行任务。记忆保存成用户能读、改、撤回的文件,工具调用先经过规则检查。项目展示了跨设备对话与任务协作的系统结构,用户可自选模型或运行自己的中继。

手机上说一句,电脑接着执行

nanoMuse希望保留一段跨设备持续的对话,让任务不随某个窗口关闭而结束。手机、桌面和网页端共用账号,通过中继同步会话,用户在手边设备提出需求,另一台设备可以承担执行。

各设备的能力并不相同。Android与桌面端可以操作各自屏幕,iPhone与iPad不能直接操作其他应用,需要把相关任务交给其他设备。网页控制台则显示运行在用户电脑上的同一段会话。

论文的设备画面是系统示意图,不是真实任务截图。它说明消息与任务怎样串起来,不能单凭图中的填表或发送文件对白认定项目已经完成了这些真实测试。

图:手机、桌面与网页共享会话的设备示意,图中画面并非真实截图。

每台设备有自己的执行与检查

每台设备携带完整Agent运行环境,执行工具前要经过Sentinel检查。系统按规则决定放行、拒绝或要求确认,删除、发送和付款等动作要先停下来询问用户。

设备之间共享的部分被压缩成中继服务,负责连接与同步,而不是把所有执行都集中到一个不可见的云端。中继可由用户自行运行;有自己的模型密钥时,设备还可直接访问提供方。

这种设计让用户选择模型和部署位置,但规则检查并不是操作系统级隔离。论文明确指出,在单设备上检查器与Agent处于同一信任域,设备被攻破时,两者都可能受到影响。不能把界面上的确认按钮当成完整安全保证。

图:各设备的Agent、规则检查、文件记忆和可选中继的连接结构。

记忆是文件,操作成绩尚未给出

Agent的身份、用户信息与唤醒安排写成Markdown文件,用户可以查看和编辑。记忆文件修改有时间记录,也能撤回变化,减少信息只保存在不可见服务内部的问题。

当前记忆还没有完整记录是哪一个模型写下某条内容,也缺少逐条置信度和重新核查规则。旧模型猜出来的内容被后续模型继续读取时,仍可能被当成事实。这些差距直接关系到跨星期持续使用的可靠性。

项目页面列出了Android、Windows、macOS、Linux以及iPhone测试版等入口,但论文没有给出屏幕操作成功率或人工接管次数。文中的部分规模与费用数字属于估算,不能当作实验成绩。Linux屏幕操作当前还受X11会话条件约束。

论文还按行动、知识、学习、责任和付费治理五个问题,以现有能力、下一步和远期目标三层整理个人Agent的系统要求。

图:五个个人Agent问题与三层能力目标围绕用户形成的径向示意。

下一步给记忆和操作留下可核对证据

跨设备Agent的价值取决于它能否把同一个任务稳定地接续下去,以及每次操作有没有可检查的记录。现有系统结构提供了会话同步、规则确认和用户可编辑记忆的连接方式。

论文路线图包括带来源的记忆、屏幕操作评测和用于操作的开放模型。进一步记录记忆的产生者、日期与证据,再公布任务成功和接管统计,可以让使用者判断哪些流程适合自动执行,哪些还需要持续监督。个人部署者也应按自己的设备环境验证实际操作链路。

参考资料

https://arxiv.org/abs/2610.08699

https://nanomuse.cn

https://github.com/nano-muse/nanoMuse

↑