arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

AI少问两轮!微软港大让临时界面替代反复聊天

作者:arXivDaily编辑部 arXiv 2610.11123 cs · cs.AI

论文导读

香港大学、微软研究院提出GenUI Harness,让AI在任务进行时生成临时界面,用户通过选择项和按钮表达需求。100项界面可执行的人工评审任务中,平均对话轮数从3.4降至1.2。研究同时建立数据库操作基准,把界面交互和后台工具执行放进同一流程。

选航班,直接把选项摆出来

找一张合适的机票,聊天助手可能先问日期,再问预算,最后把几个航班写成长段文字。GenUI Harness让助手先查询候选数据,再生成能点选的临时界面。用户看到时间、价格和航班选项,选中后把结果交回后台执行。

论文首图把两条流程并排:左边逐轮聊天,右边一次展示航班卡片和选择控件。界面只围绕当前任务产生,用户不必读完一大段回复,再用另一句话说明自己选了哪一项。

这个入口还需要处理用户暂时没说清的条件。研究采用模拟用户补充需求,检查助手是否拿到了必要信息,再决定下一步。界面里的选择同样算交互,而不是把用户参与藏在后台。

图:左侧通过多轮聊天确认航班,右侧生成航班卡片与选择控件,让用户直接表达偏好。

先查数据,再做能执行的界面

系统由后台工具助手和界面编码助手配合。前者先从数据库取出任务需要的信息,后者使用查询结果写出界面,再把点击、选择等事件转成结构化结果。后台工具随后修改数据库,并继续检查任务状态。

生成一个漂亮页面并不意味着完成订票或更新记录。界面要能运行,选择要能传回去,数据库里的最终状态也要正确。评审环节因此同时检查界面可执行性、操作结果和是否满足任务要求。

研究把界面生成接在交互中间,而不是为每一项业务提前写好页面。数据、显示和执行仍各有明确入口,便于观察错误出在查询、控件还是实际操作。论文测试的是受控数据库任务,并未证明它能直接接管真实订票服务。

图:工具助手查询数据,界面助手生成控件,用户反馈再返回工具执行和结果评审。

少问两轮,测试范围要说清

人工评审随机选择100项任务,并限制在界面成功运行的情况。平均对话轮数从普通工具助手的3.4降到使用界面的1.2,相当于少了2.2轮。这个结论说明成功生成界面后可以减少往返,不能替未运行起来的界面计算收益。

基准另设300项Lite任务和1000项Full任务,覆盖十类数据库业务。训练后的4B模型在Lite的Pass@3达到58%,训练前为9.33%。Pass@3表示三次尝试中至少一次完成任务,不能写成单次成功率58%。

完整任务结果还取决于数据库查询、执行工具和模拟用户响应。不同系统同时改变这些环节时,整体提升不能全部归因于按钮比聊天更好。人工界面评审与端到端任务统计分别给出,能帮助判断交互收益和执行能力。

图:基准构建流程把数据库、工具、任务生成和用户模拟连接起来,并保留执行检查。

应用前景:临时界面也要通过任务检查

临时界面适合把候选项目、筛选条件和确认操作直接呈现给用户。论文已经将这套接口用于多种数据库任务,表明界面可以随任务生成,并进入后续工具调用。

后续产品验证可以保留这两层检查:先看控件能否正确收集需求,再看最终数据是否按要求改变。把界面运行失败、选择失效和工具执行错误分别记录,也能让省下的对话轮数有清楚的适用范围。

参考资料

https://arxiv.org/abs/2610.11123

https://github.com/bird-bench/GenUI-Agent

↑