arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-08-25 至 2026-08-25 共收录 6
2608.19197 2026-08-25 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10420 2026-08-25 cs.AI 版本更新

Reasoning Shortcuts and Value Symmetries: What Symmetry Permits, Architecture Realizes, and Optimization Selects

推理捷径与价值对称性:对称性允许什么、架构实现什么以及优化选择什么

Xin Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 该研究分析神经符号系统的推理捷径,发现现有框架的关键定义不适用于其评估的基准,重新测量揭示无法解释的对比例与可证明结构相关,还明确了对称性惰性、自同构存在性等问题的计算复杂度,区分了对称性允许与优化选择的内容。

Comments 62 pages, 2 figures, 8 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-08-25 cs.RO cs.AI cs.LG 版本更新

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16615 2026-08-25 cs.LG 版本更新

Learning What Evaluators Value: A Reliable Approach to Modeling Evaluator Preferences

学习评估者所重视的内容:一种可靠建模评估者偏好的方法

Madeline Celi Kitch, Nihar B. Shah

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究了如何学习评估者偏好,提出了一种鲁棒算法,能够在模型不匹配的情况下有效学习偏好,通过合成数据和实际数据验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02208 2026-08-25 cs.AI cs.CL cs.LG 版本更新

Training Proactive and Personalized LLM Agents

训练主动且个性化的大语言模型智能体

Weiwei Sun, Xuhui Zhou, Weihua Du, Xingyao Wang, Sean Welleck, Graham Neubig, Maarten Sap, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) OpenHands

AI总结 该研究提出训练协作型LLM智能体的新范式,形式化PPP三维度,构建UserVille环境与多目标强化学习框架,在SWE-Bench等任务上使智能体性能优于GPT-5等基线,验证了以用户为中心反馈的重要性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00209 2026-08-25 cs.LG cs.CL 版本更新

Scaling Electronic Health Record Foundation Models for Population Health Management

面向人群健康管理的电子健康记录基础模型规模化研究

Liwen Sun, Hao-Ren Yao, Ophir Frieder, Xiang Qian, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgetown University(乔治城大学)

AI总结 该研究提出面向人群健康管理的电子健康记录基础模型,跨500万患者数据预训练,在11项慢性病预测任务及EHRShot基准中表现优于同类模型,将开源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏