arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Georgia Institute of Technology(佐治亚理工学院)

2026-02-13 至 2026-02-13 共收录 4
2602.12047 2026-02-13 cs.RO cs.LG cs.SY eess.SY math.OC

Safety Beyond the Training Data: Robust Out-of-Distribution MPC via Conformalized System Level Synthesis

超越训练数据的安全性:通过符合化系统级合成实现稳健的分布外规划与控制

Anutam Srinivasan, Antoine Leeman, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出一种基于符合预测和系统级合成的方法,用于在分布外情况下实现稳健的非线性模型预测控制,提升系统安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11170 2026-02-13 cs.CL

PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models

PRIME:基于策略强化的迭代多智能体执行框架用于大语言模型中的算法推理

Jiawei Xu, Zhenyu Yu, Ziqian Bi, Minh Duc Pham, Xiaoyi Qu, Danyang Zhang

机构 * Purdue University(普渡大学) University of Malaya(马来亚大学) Faculty of Information Technology, Beijing University of Technology(北京理工大学信息学院) School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院) Department of Industrial and Systems Engineering, Lehigh University(莱斯大学工业与系统工程系)

AI总结 PRIME通过多智能体框架提升大语言模型在算法推理中的性能,显著提高复杂任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09013 2026-02-13 cs.RO cs.CV

Dexterous Manipulation Policies from RGB Human Videos via 3D Hand-Object Trajectory Reconstruction

通过3D手-物体轨迹重建从RGB人类视频中学习灵巧操作策略

Hongyi Chen, Tony Dong, Tiancheng Wu, Liquan Wang, Yash Jangir, Yaru Niu, Yufei Ye, Homanga Bharadhwaj, Zackory Erickson, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

AI总结 VIDEOMANIP通过3D手-物体轨迹重建从RGB视频直接学习灵巧操作策略,实现无需设备的高效训练和高成功率抓取

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01511 2026-02-13 cs.CL cs.LG

Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training

交替强化学习用于非可验证大语言模型后训练的评分标准建模

Ran Xu, Tianci Liu, Zihan Dong, Tony Yu, Ilgee Hong, Carl Yang, Linjun Zhang, Tao Zhao, Haoyu Wang

机构 * Emory University(埃默里大学) Purdue University(普渡大学) Rutgers University(罗格斯大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

AI总结 Rubric-ARM通过交替强化学习优化评分标准生成与评判,提升非可验证领域大语言模型后训练的响应质量评估与策略对齐性能。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏