arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

百度让网页AI边运行边改:9B模型做到57.52%,超过万亿参数方案

作者:arXivDaily编辑部 arXiv 2609.02088 cs · cs.CV

论文导读

百度、华中科技大学联合提出RILA,让网页生成智能体把代码放进真实浏览器运行,重放参考操作后再按错误反馈修改。配套训练流程把Qwen3.5-9B在IWR-Bench上的得分从40.40%提高到57.52%,高于论文所测的Kimi-K2.6和GPT-5.5单次生成方案;比较只适用于这一基准和实验协议。

网页像截图,不代表按钮真的能用

从截图或操作视频生成网页时,常见评分关注颜色、布局和视觉相似度。页面可能看起来几乎一样,点击导航却没有响应,表单无法提交,弹窗顺序也可能错误。只比较最终截图,这些功能问题很难暴露。

RILA把浏览器执行放进生成循环。代码模型先写出初版网页,动作交互验证模块随后在真实浏览器中重放参考轨迹,记录页面状态、交互结果和视觉差异,再交给批评模型生成具体修改建议。

图:论文图2展示初版代码、浏览器重放、错误分析和再次修改组成的闭环。

每轮都保留当前最好版本

如果智能体只根据一次报错继续改,修好按钮时可能破坏原本正确的布局。论文设计的执行感知渲染分数同时衡量交互正确性和视觉保真度,并在多轮迭代中保存当前最佳实现,避免后续修改让总体表现倒退。

训练数据也采用执行验收。系统先从网站领域、交互能力和视觉风格的分类中采样方案,生成完整网页并补齐真实素材,然后逐项执行预定操作;只有每个交互都成功的页面才进入训练集。模型学到的不只是代码长什么样,还包含代码能否按操作轨迹运行。

图:论文图3展示网页方案生成、素材注入和逐项浏览器过滤。

9B模型在指定基准超过两种大模型

在IWR-Bench上,RILA的推理时闭环能持续改善多种基础模型的交互和视觉得分。加入执行验证的数据训练后,Qwen3.5-9B从40.40%升至57.52%;论文列出的Kimi-K2.6单次生成为55.61%,GPT-5.5单次生成为55.74%。

图:论文主要结果柱图比较一次生成与加入RILA后的IWR-Bench得分。

这组数字说明,在该任务里,执行反馈和训练数据质量可以弥补一部分模型规模差距。它不能推出9B模型普遍强于万亿参数模型:基线是一次生成,RILA获得了运行网页、观察结果和多轮修改的额外计算机会,评测网站类型也有限。

从基准走向前端部署

真实开发环境还需要接入登录状态、后端接口、网络失败、权限和跨浏览器差异。下一步可以把测试用例、控制台错误和可访问性检查一并放进反馈,让智能体区分视觉偏差、交互逻辑错误与外部服务故障。

工程团队若采用这类方法,应固定每轮允许的浏览器操作次数和修改预算,同时保留失败轨迹。这样才能判断提升来自更好的执行判断,还是单纯用了更多推理时间;也能防止智能体为了通过单个动作脚本,删掉页面里没有被测试到的功能。

参考资料

https://arxiv.org/abs/2609.02088