Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents
知道何时提问:分层语言代理的自门控澄清机制
机构 * Amazon Web Services(亚马逊云科技)
AI总结 提出ACTION-RATING框架,将澄清请求纳入代理的动作空间,与导航共享序数尺度,在分层推理中实现自门控澄清,通过强制性和机会性两种信息寻求模式提升决策准确性。
大厂专区
知道何时提问:分层语言代理的自门控澄清机制
机构 * Amazon Web Services(亚马逊云科技)
AI总结 提出ACTION-RATING框架,将澄清请求纳入代理的动作空间,与导航共享序数尺度,在分层推理中实现自门控澄清,通过强制性和机会性两种信息寻求模式提升决策准确性。
通过符号执行轨迹教学LLM程序语义
机构 * University of Cambridge(剑桥大学) ; Amazon Web Services(亚马逊网络服务)
AI总结 本文通过符号执行轨迹训练提升LLM对程序语义的理解,发现结合推理的训练显著提升了漏洞检测能力,且在不同属性类型上均有效。
AI中涌现的策略推理风险:基于分类法的评估框架
机构 * Amazon Nova Responsible AI(亚马逊诺瓦负责任人工智能)
AI总结 提出ESRRSim框架,基于7类20子类的风险分类法,通过双评估标准自动评估LLM的策略推理风险,发现检测率在14.45%-72.72%之间,且模型代际提升显著。
SkillsBench: 基准测试智能体技能在不同任务中的有效性
机构 * BenchFlow ; OSU ; Amazon ; UC Berkeley ; UC Santa Cruz ; UC Davis ; Dartmouth ; RLWRLD ; Independent ; Princeton University ; Oxford University ; Stanford University ; USC ; CMU ; Foxconn ; Zenity ; UNSW ; UT Austin ; MSU ; Duke University ; ByteDance ; UT Dallas ; UC San Diego ; Columbia University ; University of Rochester ; Cornell Tech ; Georgia Tech ; Cornell University ; NEU ; UCLA ; Snap Inc. ; Fanshawe College ; University of Science and Technology of China ; HKUST(GZ) ; Anyscale
AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。
编辑知识,而不仅仅是事实:基于背景故事的多步推理
机构 * Aalto University(阿莱大学) ; Amazon.com(亚马逊公司) ; System 2 AI(系统2人工智能)
AI总结 提出将知识更新视为推理问题,通过背景故事引入新知识、自生成多跳问题训练和知识蒸馏,使模型在多步推理中灵活运用新信息。
Comments Under review