软件智能体常靠截图理解界面,再模拟鼠标点击和键盘输入。上海交通大学、北京通用人工智能研究院提出Agent-Software Interaction Layer,即ASIL,用结构化JSON状态替代像素观察,用可执行语义动作替代坐标点击。
ASIL接入15款应用,构建300项单应用任务和80项多应用任务。闭源模型得分超过80,平均每项任务执行少于5个动作;在修复后的运行环境和50步预算下,截图点击方案在两组相同任务上的严格成功率只有6.6和26.6。
截图既不完整,点击也缺少语义
截图只能显示当前可见区域,滚动区、隐藏状态、对象层级和精确数值可能都不在像素里。坐标点击还依赖窗口尺寸和布局,按钮移动几像素就可能让动作失效。
ASIL为每款应用寻找“最深且可行”的访问路径:能用文档对象模型就读取对象,能用应用脚本或内部API就调用稳定接口,再统一包装成状态观察和语义动作。智能体看到的是任务相关字段,而不是整块屏幕。
图1:左侧依赖GUI像素和坐标,右侧通过结构化状态、语义动作和结果检查完成任务。
380项任务覆盖单应用与跨应用流程
单应用任务包含编辑文档、处理音频、操作表格和修改三维场景;多应用任务要求在软件之间传递结果。ASIL为动作返回可检查状态,系统能判断文件、对象或属性是否真的改变。
闭源模型在ASIL下得分超过80,且动作数少于5。截图点击在完整任务带上的严格成功率为6.6和26.6;换成较容易、接近OSWorld的任务区间后,成绩升至15.0和53.3,但仍低于结构化接口。
图2:380项任务主结果显示,多种模型通过ASIL接口取得的总体成功率明显高于匹配的GUI控制行。
同一个任务,失败位置变得可追踪
GUI智能体可能在第八步仍停留于错误页面,继续点击只会扩大偏差。ASIL动作以“设置属性”“插入对象”或“导出文件”等语义表达,执行后再读取状态验证,长流程更容易发现哪一步没有生效。
图3:截图式智能体从可见界面开始推断控件和操作路径。
图4:多次GUI动作后仍可能停在错误状态,坐标级失败会沿流程累积。
在与应用原生接口的匹配任务中,ASIL比LibreOffice UNO API高28至38个严格分,但与同类内容契约表现相当。这个结果说明优势来自接口设计与任务覆盖,不能简单归因于模型本身变强。
结构化轨迹还能用于训练小模型
ASIL产生的状态—动作轨迹可以直接作为训练数据。小规模监督微调把Qwen3.5-2B从58.0提高到72.1,把9B模型从66.6提高到80.4;资源受限的在线强化学习又分别提高到74.4和82.2。
这些轨迹比鼠标坐标更可复用,因为动作保留了意图。不同分辨率或轻微界面改版后,“点击某坐标”会失效,“把单元格格式设为百分比”仍然成立。
扩展到更多软件需要统一接入规范
ASIL不是无需适配的通用开关。每款软件都要找到稳定访问路径,处理权限、撤销和异常状态。项目已公开代码、模型、训练数据和基准,下一步可以比较新增应用的接入成本,并建立危险动作确认与最小权限机制。
企业部署还需保留完整审计日志,让用户知道智能体读取了哪些状态、执行了哪些动作。对支付、删除和外发等高风险功能,应把结构化能力与明确授权绑定,而不是因为接口更可靠就扩大操作权限。
应用升级同样会考验接口稳定性。ASIL若绑定未公开内部对象,版本变化可能让动作失效;若只使用最表层自动化接口,又会丢失精确状态。项目后续需要公布不同软件版本的兼容率、适配工时和回退策略,才能衡量维护成本。
跨平台任务还要验证状态传递是否完整,避免在软件切换时丢失上下文。
参考资料
https://sharryxr.github.io/ASIL/