arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4134 篇

2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 60%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 模仿学习与强化学习 :分类 cs.AI、cs.CV、cs.LG;embodied AI(comments);world model(comments)

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03592 2026-03-17 cs.LG cs.AI cs.MA cs.RO 60%

Deep Reinforcement Learning for Multi-Agent Coordination

多智能体协调的深度强化学习

Kehinde O. Aina, Sehoon Ha

专题命中 模仿学习与强化学习 :robotics(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种基于信息素的多智能体深度强化学习框架,通过虚拟信息素模拟局部和社会交互,实现无通信的去中心化协调,解决狭窄环境中多机器人协作的挑战。

Comments 11 pages, 8 figures, 1 table, presented at SWARM 2022, to be published in Journal of Artificial Life and Robotics

Journal ref Artificial Life and Robotics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11433 2025-12-08 cs.RO cs.AI cs.LG cs.SY eess.SY 60%

Adaptive Torque Control of Exoskeletons under Spasticity Conditions via Reinforcement Learning

通过强化学习实现脊髓病变条件下外骨骼的自适应扭矩控制

Andrés Chavarrías, David Rodriguez-Cianca, Pablo Lanillos

机构 * Neuro AI and Robotics Group(神经人工智能与机器人组) Cajal International Neuroscience Center(卡贾尔国际神经科学中心) Spanish National Research Council(西班牙国家研究理事会) Rey Juan Carlos University (URJC)(雷奥恩卡洛斯大学(URJC))

专题命中 模仿学习与强化学习 :robotics(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种基于深度强化学习的膝外骨骼自适应扭矩控制器,通过数字双胞胎训练,有效降低痉挛状态下人体关节扭矩和交互力。

Comments Accepted for publication in IEEE 19th International Conference on Rehabilitation Robotics (ICORR2025)

Journal ref International Conference On Rehabilitation Robotics : [Proceedings]. 705-711 - 2025-01-01

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16575 2025-07-21 cs.AI cs.LG cs.RO 60%

Self-Improving Safety Performance of Reinforcement Learning Based Driving with Black-Box Verification Algorithms

Resul Dagdanov, Halil Durmus, Nazim Kemal Ure

机构 * ITU Artificial Intelligence and Data Science Research Center(伊斯坦布尔技术大学人工智能与数据科学研究中心) Department of Aeronautical Engineering(航空工程系) Eatron Technologies(Eatron技术公司) Department of Electronics and Communication Engineering(电子与通信工程系) ITU Artificial Intelligence and Data Science Application and Research Center(伊斯坦布尔技术大学人工智能与数据科学应用与研究中心) Department of Computer Engineering(计算机工程系)

专题命中 模仿学习与强化学习 :robotics(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

Comments 7 pages, 7 figures, 2 tables, published in IEEE International Conference on Robotics and Automation (ICRA), June 2, 2023, London, UK

Journal ref IEEE International Conference on Robotics and Automation (ICRA), 2023, pp. 5631-5637

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04399 2025-06-06 cs.LG cs.AI cs.RO 60%

Unsupervised Meta-Testing with Conditional Neural Processes for Hybrid Meta-Reinforcement Learning

Suzan Ece Ada, Emre Ugur

机构 * Department of Computer Engineering, Bogazici University(计算机工程系,博兹达奇大学)

专题命中 模仿学习与强化学习 :robotics(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

Comments Published in IEEE Robotics and Automation Letters Volume: 9, Issue: 10, 8427 - 8434, October 2024. 8 pages, 7 figures

Journal ref IEEE Robotics and Automation Letters Volume: 9, Issue: 10, 8427 - 8434, October 2024,

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.04775 2021-09-22 cs.LG cs.AI cs.RO 60%

LS3: Latent Space Safe Sets for Long-Horizon Visuomotor Control of Sparse Reward Iterative Tasks

Albert Wilcox, Ashwin Balakrishna, Brijen Thananjeyan, Joseph E. Gonzalez, Ken Goldberg

专题命中 模仿学习与强化学习 :robot learning(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

Comments Conference on Robot Learning (CoRL) 2021. First two authors contributed equally

Journal ref Conference on Robot Learning (CoRL) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03509 2020-09-17 cs.RO cs.AI cs.LG 60%

Driving Style Encoder: Situational Reward Adaptation for General-Purpose Planning in Automated Driving

Sascha Rosbach, Vinit James, Simon Großjohann, Silviu Homoceanu, Xing Li, Stefan Roth

专题命中 模仿学习与强化学习 :robotics(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

Comments To appear in Proceedings of the IEEE International Conference on Robotics and Automation (ICRA), Paris, France, June 2020 (Virtual Conference). Accepted version. Corrected figure font

Journal ref IEEE International Conference on Robotics and Automation (ICRA), Paris, France, 2020, pp. 6419-6425

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.03423 2020-05-19 cs.LG cs.AI cs.RO 60%

On-Policy Robot Imitation Learning from a Converging Supervisor

Ashwin Balakrishna, Brijen Thananjeyan, Jonathan Lee, Felix Li, Arsh Zahed, Joseph E. Gonzalez, Ken Goldberg

专题命中 模仿学习与强化学习 :robot learning(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

Comments Conference on Robot Learning (CoRL) 2019 Oral. First two authors contributed equally

Journal ref 3rd Conference on Robot Learning (CoRL 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.04799 2019-07-15 cs.RO cs.AI cs.LG 60%

RL-RRT: Kinodynamic Motion Planning via Learning Reachability Estimators from RL Policies

Hao-Tien Lewis Chiang, Jasmine Hsu, Marek Fiser, Lydia Tapia, Aleksandra Faust

专题命中 模仿学习与强化学习 :robotics(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG

Comments Accepted to Robotics and Automation Letters in June 2019

Journal ref Robotics and Automation Letters 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13029 2026-08-28 cs.CV 版本更新 57%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Yizhuang Peng, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-08-27 cs.CV 版本更新 57%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24479 2026-08-26 cs.LG 新提交 57%

WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation

WarpSAC:通过重新思考探索与利用,迈向可拓展离线强化学习的顶峰

Zihao Wu, Hongyao Tang, Yi Ma, Huizhong Song, Pengyi Li, Yifu Yuan, Fei Ni, Jinyi Liu, Wei Wei, Jianrong Wang, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学) Shanxi University(山西大学) Imperial College London(伦敦帝国学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 该研究针对大规模并行模拟下离线RL的数据 regime 变化问题,提出具 regime 感知的WarpSAC算法家族,适配不同数据规模场景,在多基准任务及现实部署上较FlashSAC实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23204 2026-08-26 cs.RO 版本更新 57%

Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers

引导式黎曼优化(GuRO):连接模型预测控制与决策Transformer

Hossein Abdi, Satya Prakash Dash, Mingfei Sun

机构 * The University of Manchester(曼彻斯特大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本研究提出GuRO框架,将MPC与RL整合到序列决策框架,利用黎曼优化解决非凸损失问题,在四足机器人控制任务上优于TRPO等基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22976 2026-08-25 cs.RO 新提交 57%

Privileged Critic Training Enables Sensor-Free Thruster Fault Adaptation in End-to-End RL

特权评论者训练实现端到端强化学习中无传感器推进器故障自适应

Ricard Marsal I Castan, Miguel A. Olivares-Méndez

机构 * University of Luxembourg(卢森堡大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 该研究提出RAFT策略,通过特权评论者训练实现无传感器推进器故障自适应,在浮动平台机器人多推进器故障场景下大幅提升容错导航成功率,缩小与神谕策略的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22629 2026-08-25 cs.RO cs.SY eess.SY 新提交 57%

Enhancing Sim2Real Transfer for Torque-Controlled Robots through Real2Sim Dynamics Estimation and Reinforcement Learning

通过Real2Sim动力学估计与强化学习增强力矩控制机器人的Sim2Real迁移

Davide Bargellini, Alex Pasquali, Andrea Govoni, Riccardo Zanella, Gianluca Palli

机构 * University of Bologna(博洛尼亚大学) University of Twente(特文特大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本研究提出Real2Sim2Real流水线,结合轨迹匹配等方法校准7自由度Franka Emika Panda机器人动力学,训练TQC智能体,实现力矩控制机器人Sim2Real迁移,提升了跟踪精度与鲁棒性。

Comments 6 pages, 8 figures. Presented at the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21740 2026-08-25 cs.RO 新提交 57%

CounterAlign: Counterfactual Supervision for Vision-Language-Action Models

CounterAlign:面向视觉-语言-动作模型的反事实监督

Haru Kondoh, Kei Ota, Asako Kanezaki, Yueh-Hua Wu

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 该研究提出CounterAlign方法,通过指令重标记从专家演示合成反事实元组,结合对抗判别器训练学习奖励模型,提升VLA模型在LIBERO-PRO基准及TX-G2机器人实验中的鲁棒性与性能。

Comments Project page: https://counteralign.airoa.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-08-25 cs.RO 版本更新 57%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新 57%

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02710 2026-08-24 cs.LG 版本更新 57%

Maximum Likelihood Reinforcement Learning

最大似然强化学习

Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 MaxRL是一种基于采样的强化学习框架,通过最大似然估计提升模型训练效率,实验显示其在多个任务中表现优于现有方法。

Comments ICML 2026. Project website: https://zanette-labs.github.io/MaxRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01476 2026-08-21 cs.LG cs.CL 版本更新 57%

From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering

当奖励黑客反弹时:通过表征层面信号理解与缓解它

Rui Wu, Ruixiang Tang

机构 * Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型强化学习中奖励黑客现象,通过环境操控设置分析其三阶段反弹模式,并提出基于表征工程的Advantage Modification方法以更有效抑制黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18079 2026-08-20 cs.AI 新提交 57%

Position: Profiling Game Worlds by Transition Complexity

Position:通过转移复杂度分析游戏世界

Lele Cao

机构 * Microsoft Research(微软研究院) DeepMind(深度思考(DeepMind))

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 该研究针对GWM与RL常被混淆的问题,提出转移复杂度剖面(TCP)指标,用于量化游戏环境的转移预测难度,呼吁其成为相关论文的标准基准元数据。

Comments Accepted by ICML 2026 Position Paper Track. https://icml.cc/virtual/2026/poster/67074

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17320 2026-08-19 cs.RO 新提交 57%

Robust Brachiation on a Life-Sized Dual-Arm Robot Using Waypoint-Guided Reinforcement Learning

使用路径点引导强化学习的真人大小双臂机器人的稳健摆臂运动

Ayumu Iwata, Kento Kawaharazuka, Keita Yoneda, Takahiro Hattori, Kei Okada

机构 * The University of Tokyo(东京大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本研究针对真人大小双臂机器人的稳健摆臂运动难题,提出路径点引导强化学习(WGRL)方法,结合路径点引导与任务成功、机械能奖励,经仿真与硬件实验验证,实现了含故障恢复的稳健摆臂,为机器人手臂运动设计提供指南。

Comments Accepted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15455 2026-08-19 math.NA cs.AI cs.NA math.AP 版本更新 57%

Solving nonconvex Hamilton--Jacobi--Isaacs equations with PINN-based policy iteration

用基于PINN的策略迭代求解非凸哈密顿-雅可比-艾萨克斯方程

Hee Jun Yang, Minjung Gim, Yeoneung Kim

机构 * National Institute for Mathematical Sciences(数学科学研究院) Department of Applied Artificial Intelligence(应用人工智能系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 本文提出结合PINN与策略迭代的无网格框架,可求解高维非凸HJI方程,在两类数值实验中表现优于直接PINN求解器,具理论依据与应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16264 2026-08-18 cs.RO 新提交 57%

Cyclops: LiDAR as a Camera That Dreams in Color

Cyclops:以彩色进行“梦境”的相机式激光雷达

Wei Gao, Jian Shu, Mingle Zhao, Maani Ghaffari, David Kong, Chengzhong Xu, Hui Kong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出Cyclops框架,将稀疏NRS-LiDAR强度转为RGB视频,通过LBM等技术缓解帧间闪烁,合成RGB可使感知模型在多任务上优于LiDAR基线与传统相机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15707 2026-08-18 cs.RO 新提交 57%

GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning

GAINS:在强化学习中利用不一致的人类干预信号

Xinyi Zhang, Yinuo Zhao, Pei Ren, Lechun Jiang, Huiqian Jin, Lei Sun, Dapeng Wu, Zhengping Che, Chi Harold Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本研究提出GAINS框架,采用带分位数Q网络的分布强化学习建模人类干预引发的回报变异性,结合悲观探索策略,在模拟与现实场景中使任务成功率较RLIF高22%,故障恢复成功率最高提升43%,凸显该建模对现实部署的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14498 2026-08-17 cs.LG cs.DC 新提交 57%

Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

Rollplex:面向视觉语言模型后训练的跨阶段GPU空间共享

Hanfeng Lu, Tianyu Feng, Suyi Li, Yuheng Zhao, Wei Gao, Shaopan Xiong, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Wei Wang

机构 * HKUST(香港科技大学) Alibaba Inc(阿里巴巴公司)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.LG

AI总结 Rollplex是一种跨阶段GPU空间共享运行时,通过解耦RL后训练的参考与训练阶段、优化内存与并行度,提升VLMs后训练的GPU利用率与训练速度。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14082 2026-08-17 cs.RO 新提交 57%

PILOT: Privileged Imitation Learning for End-to-End Motion Planning of Autonomous UAVs under Partial Observability

PILOT:部分可观测条件下自主无人机端到端运动规划的特权模仿学习方法

Qingrui Zhang, Feng Xue, Xiang Zhou, Chenghao Yu

机构 * School of Aeronautics and Astronautics, Sun Yat-sen University(中山大学航空航天学院) Sun Yat-sen University(中山大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出PILOT框架,通过特权模仿学习结合TCN时空感知融合模块,实现部分可观测下无人机端到端运动规划,性能接近最优控制专家且计算开销降超80%,零样本部署验证其可行性与泛化性。

Comments 13 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12995 2026-08-14 cs.AI cs.MA 新提交 57%

OGR-MARL: Option-Guided Residual Multi-Agent Reinforcement Learning for Heterogeneous USV Cooperative Pursuit in Constrained Port Waterways

OGR-MARL:面向受限港口水道中异构无人水面艇协同追踪的选项引导式残差多智能体强化学习

Jiayang Mao, Lanfeng Wang, Zhao-Han Peng

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出OGR-MARL框架,将其实例化为多款连续控制MARL算法,经厦门港水道实验验证,OGR-MASAC捕获率达75.0%,规则依从性与异构协同表现最优,且具备良好泛化潜力。

Comments 6 pages,5 figures, accepted by ICUS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06161 2026-08-14 cs.AI 版本更新 57%

iARCS: Iterative Agentic RL for Controllable 3D Scene Generation

iARCS:用于可控3D场景生成的迭代智能体强化学习

Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel

机构 * Tribhuvan University(特里布文大学) Pulchowk Campus, IOE, Tribhuvan University(特里布文大学工程学院普尔乔克校区) NAAMII(尼泊尔先进数学与信息学研究所) INSAIT, Sofia University “St. Kliment Ohridski”(索菲亚大学圣克莱门特奥赫里德斯基分校INSAIT)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 研究针对现有3D场景生成器无法满足任务约束的问题,提出iARCS迭代智能体强化学习框架,通过两阶段策略优化约束保真度,生成的数据可改进基础生成器,具实用价值。

Comments 15 pages, 9 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01891 2026-08-14 cs.LG 版本更新 57%

SEAR: Sample Efficient Action Chunking Reinforcement Learning

SEAR:样本高效的动作分块强化学习

C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

机构 * Autonomous Learning Robots, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院自主学习机器人实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 SEAR 是一种样本高效的在线强化学习算法,通过利用动作分块的时间结构和滚动时间 horizon,有效结合小和大分块大小的优势,在 Metaworld 上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏