arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2025-12-22 至 2025-12-22 共收录 3
2512.17901 2025-12-22 cs.AI cs.CL

When Reasoning Meets Its Laws

当推理遇见其定律

Junyu Zhang, Yifan Sun, Tianang Leng, Jingyan Shen, Liu Ziyin, Paul Pu Liang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

AI总结 本文提出推理定律(LoRe)框架,通过单调性和组合性属性评估推理模型,开发微调方法提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17899 2025-12-22 eess.SY cs.LG cs.SY

Distributionally Robust Imitation Learning: Layered Control Architecture for Certifiable Autonomy

分布鲁棒模仿学习:用于可验证自主性的分层控制架构

Aditya Gahlawat, Ahmed Aboudonia, Sandeep Banik, Naira Hovakimyan, Nikolai Matni, Aaron D. Ames, Gioele Zardini, Alberto Speranzon

机构 * Department of Mechanical Science and Engineering, University of Illinois Urbana-Champaign(机械科学与工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Systems Engineering, University of Pennsylvania(电气与系统工程系,宾夕法尼亚大学) Mechanical and Civil Engineering, Control and Dynamical Systems, California Institute of Technology(机械与土木工程、控制与动态系统,加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Advanced Technology Labs, Lockheed Martin(洛克希德·马丁高级技术实验室)

AI总结 本文提出分布鲁棒模仿策略架构,通过整合泰勒级数模仿学习和ℓ₁-分布鲁棒自适应控制,解决分布偏移问题,实现可验证的自主性。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25123 2025-12-22 cs.AI cs.CL

From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones

从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能

Lifan Yuan, Weize Chen, Yuchen Zhang, Ganqu Cui, Hanbin Wang, Ziming You, Ning Ding, Zhiyuan Liu, Maosong Sun, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学)

AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏