arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-18 至 2026-02-18 共收录 3 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 3 篇

2406.03862 2026-02-18 cs.LG cs.AI 76%

Robust Deep Reinforcement Learning against Adversarial Behavior Manipulation

对抗性行为操控下的鲁棒深度强化学习

Shojiro Yamabe, Kazuto Fukuchi, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) University of Tsukuba(筑波大学) RIKEN AIP(理化学研究所AIP)

专题命中 模仿学习与强化学习 :manipulation(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于模仿学习的对抗性攻击方法,并通过时间折扣正则化提升强化学习对行为定向攻击的鲁棒性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16641 2026-02-18 quant-ph cs.AI cs.LG 62%

Hybrid Reward-Driven Reinforcement Learning for Efficient Quantum Circuit Synthesis

混合奖励驱动强化学习用于高效量子电路综合

Sara Giordano, Kornikar Sen, Miguel A. Martin-Delgado

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合奖励驱动强化学习方法,用于高效合成量子电路,通过结合静态奖励和动态惩罚,优化电路深度和门数,提升量子电路综合效率。

Comments 35 pages, 7 figures, color figures

Journal ref Quantum Mach. Intell. 8, 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15076 2026-02-18 cs.LG stat.ML 57%

Near-Optimal Sample Complexity for Online Constrained MDPs

在线约束马尔可夫决策过程的近最优样本复杂度

Chang Liu, Yunfan Li, Lin F. Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出了一种基于模型的对偶算法,解决了在线约束马尔可夫决策过程的安全性问题,证明了在允许小规模违规的情况下,算法能以近最优样本复杂度生成安全策略。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏