论文导读
上海交通大学与浙江大学团队提出CUA-Universe,让同一个电脑智能体在图形界面与命令行之间选择操作。9B模型在OSWorld上的成功率提升16.8个百分点,同时步骤减少57%。结果来自特定虚拟机应用和基准任务,说明混合工具有效,但不等于任意真实电脑都能稳定托管。
有些任务点鼠标直观,有些任务敲命令更快
把文件批量改名、搜索目录或转换格式,用命令行往往一步完成;编辑海报、检查视频画面或在电子表格里确认布局,则需要看图形界面。现有电脑智能体通常只擅长一边:纯GUI模型能看屏幕,却要经历大量点击;纯命令行智能体效率高,却看不到应用状态和视觉结果。
CUA-Universe把两套动作空间统一到一个模型中。智能体读取屏幕、任务描述与历史轨迹后,可以点击、输入,也可以打开终端执行命令,再回到GUI检查结果。核心判断不是预先写死“哪个应用用哪种工具”,而是在任务进程中选择下一步最合适的界面。
图:论文图7比较路径引导策略,展示智能体如何在GUI与命令行操作之间切换。
训练数据要告诉模型何时切换,而不只是怎么操作
团队从多种桌面应用构造任务与轨迹,既包含只靠鼠标键盘的解法,也包含GUI和CLI协作的路径。Path-Steer训练策略会保留任务目标与可验证结果,同时鼓励模型发现更短、更可靠的工具组合。这样,终端不是额外插件,而是与点击动作处于同一决策序列。
例如处理电子表格时,智能体可用命令快速生成或修改数据,再回到Calc确认公式和版式;图像与视频任务则可能先用命令处理文件,最后在应用中核验视觉输出。不同界面承担不同信息角色,减少了反复菜单导航。
图:论文图8展示混合界面与仅GUI方案的步骤差异及最终任务状态。
9B模型成功率增加,动作序列反而缩短
在OSWorld评测中,论文报告9B版本相对对应基线成功率提高16.8个百分点,平均步骤数减少57%。这组结果支持一个直接判断:减少低价值点击并没有牺牲任务完成,工具选择反而降低了长轨迹中的错误累积。
研究还比较不同训练路径、动作类型和模型规模,显示只加入终端能力而缺少合适轨迹监督并不足够。智能体需要学习何时信任命令结果、何时必须回到屏幕观察。标题中的提升是特定设置差值,不应被解读为对所有电脑基准统一增加16.8个百分点。
图:论文种子任务示例展示Calc工作簿,属于需要数据操作与视觉核验结合的桌面任务。
下一步是把效率优势变成可控执行
混合界面路线适合办公自动化、开发运维和内容制作,因为它接近熟练用户的真实工作方式。但命令行也扩大了风险:错误命令可能批量改写文件,屏幕上的正常结果又未必证明底层数据无误。
部署时应限制文件与网络权限,对高影响命令先模拟或确认,并记录GUI状态、命令文本和产物校验。还需在系统更新、弹窗、不同语言和真实用户文件上复测。CUA-Universe证明了“会选工具”能同时提高成功率与效率,安全边界则需要系统层补齐。