arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4126 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4126 篇

2607.07753 2026-07-22 cs.LG cs.AI 版本更新 62%

A Transdiagnostic Space of Disorder Like Phenotypes in Reinforcement Learning Agents

强化学习智能体中类似障碍表型的跨诊断空间

Hari Prasad

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究在强化学习智能体中建模心理障碍,将其重新表述为对认知评估信号的剂量可控操纵,通过多个旋钮表示多种障碍,呈现分级剂量反应,还发现障碍自组织成二维空间、旋钮对不同障碍有不同影响及旋钮相互作用可预测共病等,且框架具有通用性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32017 2026-07-21 cs.LG cs.AI 版本更新 62%

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

TRIAGE:面向智能体强化学习的角色类型化信用分配

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出TRIAGE框架,通过角色类型化信用分配修正GRPO仅依赖结果信用的盲点,在ALFWorld等任务中提升成功率并减少交互步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07032 2026-07-21 cs.LG cs.AI 版本更新 62%

A Systematic Investigation of RL-Jailbreaking in LLMs

LLMs中RL越狱的系统性研究

Montaser Mohammedalamen, Kevin Roice, Reginald McLean, Alyssa Lefaivre Škopac

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统分解RL越狱框架,通过分析奖励函数、动作空间、回合长度等环境形式化因素和算法措施,发现密集奖励和延长回合长度是越狱成功的主要驱动因素,并提供了提升RL越狱效率及强化模型防御的工具。

Comments Warning: This paper may contain unfiltered and potentially offensive jailbreaking examples. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11624 2026-07-17 cs.RO cs.LG 版本更新 62%

SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning

SKooP:用于强化学习的更快、更通用的有腿机器人运动的对称库普曼预测

Evelyn D'Elia, Weishu Zhan, Giulio Turrisi, Giulio Romualdi, Giuseppe L'Erario, Raffaello Camoriano, Wei Pan, Daniele Pucci

机构 * Italian Institute of Technology (IIT)(意大利理工学院) University of Manchester(曼彻斯特大学) Dynamic Legged Systems Laboratory, IIT(意大利理工学院动态腿式系统实验室) Generative Bionics S.R.L(生成仿生学有限公司) DAUIN, Politecnico di Torino(都灵理工大学DAUIN) Rehab Technologies Lab, IIT(意大利理工学院康复技术实验室) Newcastle University(纽卡斯尔大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 研究针对强化学习样本效率低问题展开,提出SKooP方法,结合形态对称与库普曼模型优势,在学习策略时学习系统动力学模型,将其预测用于评论家,还纳入群对称,验证了该方法能减少收敛时间并增加学习奖励,且策略可转移。

Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12784 2026-07-15 cs.RO cs.LG 新提交 62%

Directional Constraints for Efficient Exploration in Safe Reinforcement Learning

安全强化学习中高效探索的方向约束

Paolo Magliano, Puze Liu, Jan Peters, Davide Tateo, Raffaello Camoriano

机构 * Dipartimento di Automatica e Informatica, Politecnico di Torino(自动控制与信息工程系,都灵理工大学) Tongji University, Shanghai Research Institute for Intelligent Autonomous Systems(同济大学,上海智能自主系统研究院) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Intelligent Autonomous Systems Group, TU Darmstadt(智能自主系统组,达姆施塔特工业大学) Lund University(隆德大学) Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对安全强化学习中约束学习降低速度和性能的问题,提出扩展ATACOM框架的ATACOM-DC方法,通过引入方向约束区分动作,改善安全与性能权衡,在模拟机器人控制任务中评估,分析约束违反成本和任务性能。

Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026. 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11653 2026-07-14 cs.LG cs.RO 版本更新 62%

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

简单配方有效:视觉-语言-动作模型通过强化学习成为自然持续学习者

Jiaheng Hu, Jay Shim, Chen Tang, Yoonchang Sung, Bo Liu, Peter Stone, Roberto Martin-Martin

机构 * University of Southern California(南加州大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 本文通过系统研究发现,对于大型预训练视觉-语言-动作模型,简单的顺序微调结合低秩适配在持续强化学习中表现出高可塑性、几乎无遗忘和强零样本泛化,优于复杂方法。

Comments Accepted at RLC 2026; Best paper award at ICRA26 RL4IL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09590 2026-07-13 cs.RO cs.AI 新提交 62%

PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

PAC-ACT:用于动作分块变换器的训练后演员评论家方法

Yujie Pang, Zudong Li

机构 * LeRobot

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对精密工业接触操纵问题,提出PAC-ACT框架,通过在块级别重新制定策略优化、构建特定架构并引入混合行为先验约束,提升了机器人策略在姿态扰动和接触力约束下的性能,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15136 2026-07-10 cs.LG cs.AI 版本更新 62%

Safe Flow Q-Learning: Offline Safe Reinforcement Learning with Reachability-Based Flow Policies

安全流Q学习:基于可达性的安全离线强化学习流策略

Mumuksh Tayal, Manan Tayal, Ravi Prakash

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Safe Flow Q-Learning,结合达性启发的安全价值函数和高效的一步流策略,通过自一致性Bellman递归学习安全价值,行为克隆训练流策略并转化为奖励最大化安全动作选择器,减少部署时的拒绝采样,提升实时安全应用性能。

Comments 21 pages, 6 figures, 3 tables; First 2 authors have contributed equally; Paper accepted at Reinforcement Learning Conference (RLC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07252 2026-07-09 cs.LG cs.RO 新提交 62%

Safe Reinforcement Learning using Ideas from Model Predictive Control

利用模型预测控制思想的安全强化学习

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德伦大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 针对强化学习在安全约束方面的挑战,提出结合深度强化学习与模型预测控制的通用框架,利用系统动力学模型定义可行状态 - 动作空间,经安全过滤器投影动作,在实验室试验台验证该方法可成功探索并稳定收敛。

Comments Accepted at Eurocast 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05296 2026-07-09 cs.RO cs.LG 版本更新 62%

Latent Policy Steering through One-Step Flow Policies

通过一步流策略实现潜在策略引导

Hokyun Im, Andrey Kolobov, Jianlong Fu, Youngwoon Lee

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Latent Policy Steering (LPS),通过一步流策略实现高保真的潜在策略改进,解决了离线强化学习中回报最大化与行为约束之间的权衡问题,实现了无需复杂超参数调整的鲁棒性能。

Comments Accepted to RSS 2026, Project Webpage : https://jellyho.github.io/LPS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05465 2026-07-08 cs.CV cs.AI 新提交 62%

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。

Comments 18pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03723 2026-07-07 cs.RO cs.AI 新提交 62%

OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies

OmniTacTune:用于视觉策略触觉残余适应的与策略无关的真实世界强化学习

Kelin Yu, Haode Zhang, Harish Ravichandar, Yunhai Han, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究针对视觉策略在接触丰富操作中不足的问题,提出OmniTacTune管道,通过残余校正让触觉反馈适应预训练视觉策略,经两阶段设计,实验证明其能跨任务等泛化,有效提升策略成功率。

Comments Project page: https://colinyu1.github.io/omnitactune-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03177 2026-07-07 cs.SE cs.AI cs.LG 新提交 62%

CRRL: A Causality-Based Reinforcement Learning Framework for Autonomous System Recovery

CRRL:一种用于自主系统恢复的基于因果关系的强化学习框架

Safia Fatima, Kai Olav Ellefsen, Leon Moonen

机构 * Simula Research Laboratory(Simula研究实验室) University of Oslo(奥斯陆大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究自主系统恢复中传统强化学习问题,引入基于因果关系的CRRL框架,利用驾驶日志因果关系塑造训练信号,使策略与基于规则的恢复有效协作,提升相关指标。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02073 2026-07-03 cs.AI cs.LG 新提交 62%

Evidence-State Rewards for Long-Context Reasoning

证据状态奖励用于长上下文推理

Ya Gao, Pekka Marttinen

机构 * Aalto University(阿alto大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出Maven框架,通过可编辑证据记忆和动作级状态转移奖励,优化长上下文推理中的证据导航,优于仅结果强化学习和证据识别基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21718 2026-07-03 cs.LG cs.AI 版本更新 62%

When Does Predictive Inverse Dynamics Outperform Behavior Cloning?

何时预测性逆动力学优于行为克隆?

Lukas Schäfer, Pallavi Choudhury, Abdelhak Lemkhenter, Chris Lovett, Somjit Nath, Luis França, Matheus Ribeiro Furtado de Mendonça, Alex Lamb, Riashat Islam, Siddhartha Sen, John Langford, Katja Hofmann, Sergio Valcarcel Macua

机构 * University of Cambridge(剑桥大学) Universitygrow

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析解释了预测性逆动力学模型(PIDM)为何在行为克隆(BC)失败时表现更优,归因于偏差-方差权衡,并实验验证了PIDM在样本效率上的显著优势。

Comments To be published in proceedings of the International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10263 2026-07-02 cs.RO cs.LG 版本更新 62%

From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning

从先验到专家:通过分布收缩强化学习微调实现高效技能掌握

Zhanyi Sun, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出DICE-RL框架,将强化学习作为分布收缩算子,通过在线反馈放大高成功行为,将预训练行为先验微调为高性能专家策略,实现稳定、样本高效的复杂操作技能掌握。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29867 2026-06-30 cs.LG cs.AI 62%

RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning

RoAd-RL:鲁棒对抗强化学习的统一库与基准

Adithya Mohan, Daniel Kriegl, Torsten Schön

机构 * Hightech-Agenda Bayern(巴伐利亚高科技议程)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出RoAd-RL开源基准框架,统一策略、攻击、防御和鲁棒性指标,评估192种配置下DQN/PPO/SAC的鲁棒性,发现常用防御可能比攻击更有害。

Comments Accepted at ICECCME'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06347 2026-06-30 cs.RO cs.AI 62%

Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning

多目标离线强化学习中的目标条件决策变压器

Paweł Gajewski, Dominik Żurek, Marcin Pietroń, Kamil Faber

机构 * Faculty of Computer Science, AGH University of Krakow(计算机科学学院,克拉科夫AGH大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种目标条件决策变压器,用于多目标离线强化学习,通过显式整合目标状态到序列建模框架中,有效解决不同任务,仅使用预收集数据,并在Franka Emika Panda平台上验证,优于现有在线基线。

Journal ref Computational Science -- ICCS 2026, Lecture Notes in Computer Science, vol. 16784, Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30719 2026-06-29 cs.LG cs.AI 版本更新 62%

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

何时LLMs足以作为序列RL任务的策略优化器?

Stephane Hatgis-Kessell, Emma Brunskill

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25978 2026-06-25 cs.MA cs.AI cs.LG 新提交 62%

Multi-Agent Goal Recognition with Team- and Goal-Conditioned Reinforcement Learning and Factorized Branch-and-Bound

基于团队与目标条件强化学习和因子化分支定界的多智能体目标识别

Thiago Thomas, Gabriel de Oliveira Ramos, Felipe Meneguzzi

机构 * Pontifícia Universidade Católica do Rio Grande do Sul (PUCRS)(里约格兰德杜斯阿伦斯天主教大学) Universidade do Vale do Rio dos Sinos (Unisinos)(里约斯inos大学) University of Aberdeen(阿伯丁大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出MAGR-BB方法,利用共享的团队与目标条件策略作为评分模型,结合因子化分支定界搜索,从轨迹中联合推断智能体分组及团队目标,在基准测试中大幅降低假设空间并缩短识别时间。

Comments 12 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25700 2026-06-25 cs.LG cs.RO 新提交 62%

Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning

基于低秩适配的强化学习内存高效策略库

Samuel Valland Lyngset, Tor Viljen Raanaas, Gard Sveipe, Eirik Møller Nilsen, Jim Torresen, Kai Olav Ellefsen, Tobias Lømo

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 研究将参数高效微调方法(如LoRA)迁移至机器人强化学习,通过PPO算法微调基线模型构建多任务策略库,实现内存占用降低20-160倍,存储节省90-95%,且成功率无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25337 2026-06-25 cs.RO cs.AI cs.HC 新提交 62%

AI Coaching for Accelerating Human Skill Development with Reinforcement Learning

AI教练:利用强化学习加速人类技能发展

Wei Wang, Enlin Gu, Antonio Loquercio, Haimin Hu, Rahul Mangharam

机构 * University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于非合作动态博弈和强化学习的AI教练框架,通过自适应共享控制和因果影响模型加速人类运动技能发展,在无人机竞速用户研究中显著提升学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25127 2026-06-25 cs.LG cs.AI math.OC 新提交 62%

Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

奖励条件注意力:奖励设计如何塑造自动驾驶代理的感知

Mohamed Benabdelouahad, Ahmed Djalal Hacini, Nadir Farhi, Aissa Boulmerka

机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究奖励设计如何影响自动驾驶强化学习代理的内部注意力模式,发现奖励内容直接决定编码器优先关注的场景元素,且连续碰撞时间惩罚会形成学习性警觉先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24039 2026-06-25 cs.RO cs.LG cs.SY eess.SY math.OC 新提交 62%

TurboMPC: Fast, Scalable, and Differentiable Model Predictive Control on the GPU

TurboMPC:GPU上快速、可扩展且可微分的模型预测控制

Gabriel Bravo-Palacios, Jianghan Zhang, Zachary Pestrikov, Brian Plancher, Thomas Lew

机构 * Dartmouth College(达特茅斯学院) Toyota Research Institute(丰田研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 提出TurboMPC,一种完全运行在GPU上的可微分MPC求解器,通过SQP、ADMM内求解器、隐式微分和JAX-CUDA协同设计,在约束规划、人形模仿学习和强化学习中实现高达15倍和58倍的加速,并在实车最小时间竞赛中通过贝叶斯优化调参显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15373 2026-06-25 eess.SY cs.AI cs.LG cs.SY math.OC nlin.AO 版本更新 62%

Safe Learning Control with Optimality and Stability Guarantees

具有最优性和稳定性保证的安全学习控制

Xinyang Wang, Hongwei Zhang, Shimin Wang, Wei Xiao, Martin Guay

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments, School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen, Guangdong 518055, China(深圳先进 motion 控制与现代自动化装备重点实验室,智能科学与工程学院,哈尔滨工业大学,深圳,广东 518055,中国) School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) MIT CSAIL

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对非线性系统在高相对度状态约束和未知扰动下的强化学习控制,提出高阶倒数型控制障碍函数处理约束,并通过梯度相似性概念和自适应机制在保证安全的同时提升性能。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23678 2026-06-23 cs.CV cs.AI 新提交 62%

AIR: Adaptive Interleaved Reasoning with Code in MLLMs

AIR: MLLMs中的自适应交错推理与代码

Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

机构 * Independent Researcher(独立研究员)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 提出自适应交错推理框架AIR,通过强化学习训练代码增强的复杂数值计算任务,采用分组约束奖励函数和两阶段数据构建,使性能平均提升6.1个百分点。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20376 2026-06-23 cs.LG cs.AI 新提交 62%

CRAX: Fast Safe Reinforcement Learning Benchmarking

CRAX:快速安全强化学习基准测试

Tristan Tomilin, Mourad Boustani, Mickey Beurskens, Thiago D. Simão

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出基于JAX加速的安全RL基准CRAX,利用MJX物理引擎实现高达100倍加速,包含6个环境套件和3个智能体任务,评估6种方法揭示性能与安全权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19752 2026-06-23 cs.RO cs.AI 新提交 62%

Temporal Self-Imitation Learning

时间自我模仿学习

Yinsen Jia, Boyuan Chen

机构 * Duke University(杜克大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出时间自我模仿学习框架,通过挖掘高效成功轨迹并转化为可重用监督信号,提升长时域机器人操作任务的学习效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17551 2026-06-17 cs.LG cs.AI 新提交 62%

Reversal Q-Learning

逆向Q学习

Aditya Oberai, Seohong Park, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出逆向Q学习(RQL)算法,通过扩展MDP框架和逆向流生成虚拟在线轨迹,结合偏差-方差缩减技术,实现基于流策略的离线强化学习,在50个机器人任务中取得最佳平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17518 2026-06-17 cs.LG cs.AI q-fin.CP stat.ML 版本更新 62%

Ensemble RL through Classifier Models: Enhancing Risk-Return Trade-offs in Trading Strategies

通过分类器模型进行集成强化学习:在交易策略中增强风险回报权衡

Zheli Xiong

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在金融交易策略中使用集成强化学习模型的全面研究,利用分类器模型来提升性能。通过将A2C、PPO和SAC等强化学习算法与传统分类器如支持向量机(SVM)、决策树和逻辑回归相结合,探讨不同分类器组如何整合以改善风险回报权衡。研究评估了各种集成方法的有效性,将其与单个强化学习模型在关键金融指标(包括累计回报率、夏普比率(SR)、卡勒姆比率和最大回撤(MDD))上进行比较。结果表明,集成方法在风险调整后的回报方面始终优于基础模型,提供了更好的回撤管理和整体稳定性。然而,我们发现集成性能对方差阈值τ的选择敏感,强调了动态调整τ以达到最佳性能的重要性。本研究强调了将强化学习与分类器结合在自适应决策中的价值,对金融交易、机器人和其他动态环境具有启示。

Comments 23 pages,10 figures, 9 table

详情

展开后加载摘要…

URL PDF HTML 收藏