arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4134 篇

2608.10204 2026-08-12 cs.LG 新提交 57%

Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

面向安全强化学习的边界搜寻策略梯度算法

Chenhua Fan, Jiahui Zhu, Yuhang Zhang, Honghao Wei

机构 * School of EECS, Washington State University(华盛顿州立大学电子工程与计算机科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出BSPG算法,针对安全强化学习中标准梯度法易收敛到可行域内部的问题,结合切向与法向分量,在Safety-Gymnasium导航任务中实现更高奖励与更紧密的边界跟踪。

Comments CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09258 2026-08-11 cs.RO 新提交 57%

Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm

面向任务的编队决策:通过强化学习实现对攻击型集群的驱赶

Zhaozong Wang, Guibin Sun, Jinyong Chen, Rui Zhou

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文针对攻击型集群驱赶任务,提出基于强化学习的编队决策方法,通过参数化编队形状缓解防御者机动性劣势,在仿真与物理平台上验证了方法的可行性与扩展性。

Comments Accepted for publication in IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07725 2026-08-11 cs.LG 新提交 57%

Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning

平均奖励强化学习的有限常数前沿与可审计后悔证书

Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文针对平均奖励强化学习,提出感知常数的比较协议,推导通信MDP的有限下界证书,改进已发表系数,给出跨度约束乐观学习者的可审计组合规则,完成相关形式化与诊断测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01151 2026-08-11 cs.LG 版本更新 57%

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

拉格朗日扰动扩散引导:用于生成策略的潜在强化学习

Hikmet Simsir, Ozgur S. Oguz

机构 * University of Michigan(密歇根大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。

Comments Accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06907 2026-08-10 cs.RO 新提交 57%

Spatiotemporal Agility: Time-Constrained Reinforcement Learning for Vision-Guided Dynamic Quadrupedal Interception

时空敏捷性:面向视觉引导的动态四足机器人拦截的时间约束强化学习

Yidong Zhu, Zibo Dai, Tongning Zhang, Leixin Chang, Hua Chen

机构 * Zhejiang University(浙江大学) LimX Dynamics Technology Co., Ltd.(灵蜥动力科技有限公司)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文针对四足机器人动态接球任务,提出结合视觉模块与直接目标条件RL策略的集成框架,构建实时闭环拦截系统,提升了接球成功率并减小了sim-to-real性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交 57%

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04934 2026-08-06 cs.CL cs.LG 新提交 57%

State2State: Environment-Derived Mid-Training for LLM Agents

State2State:面向大语言模型智能体的环境衍生式中间训练

Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute for AI, Tsinghua University(清华大学人工智能研究院) Institute of Intelligent Computing, Alibaba Group(阿里巴巴集团智能计算研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 该研究提出State2State环境衍生式中间训练方法,无需外部任务与监督,可提升LLM智能体性能及学习效率,具备跨环境泛化潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20985 2026-08-06 cs.LG 版本更新 57%

Distributional Active Inference

分布式主动推断

Abdullah Akgül, Gulcin Baykal, Manuel Haußmann, Mustafa Mert Çelikok, Melih Kandemir

机构 * University of Southern Denmark(丹麦南部大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种将主动推断整合到分布式强化学习框架中的形式抽象,以提升复杂环境机器人系统最优控制的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03872 2026-08-05 cs.RO 新提交 57%

EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning

EvoHIL:用于鲁棒交互式强化学习的自演化奖励与流匹配策略优化

Shuoqin Zhang, Tongtong Cheng, Xiru Gao, Jinzhuo Peng, Bin Zheng, Jiahao Tu, Ke Wang, Jia Pan, Zhe Hu, Kai Liu

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 EvoHIL是适配奖励模型、动作生成器和视觉域的统一交互式学习框架,在六类机械臂操纵任务中提升了成功率、运动平滑度等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 57%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20880 2026-08-05 stat.ML cs.LG stat.ME 版本更新 57%

Adversarial observations in probabilistic State-Space Models for robust Reinforcement Learning

概率状态空间模型中的对抗观测用于鲁棒强化学习

M. Santos-Pascual, D. Ríos Insua

机构 * Inst. Math. Sciences, Spanish Nat. Research Council, Madrid, Spain(西班牙国家研究委员会数学科学研究所,马德里)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 分析线性概率状态空间模型中受似然约束的对抗观测对潜在状态和策略决策的影响,为构建鲁棒强化学习系统提供理论基础,适用于机器人等安全关键领域。

Comments 42 pages, 10 figures, PREPRINT ONGOING: Revised version with additional theoretical results and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28663 2026-08-03 cs.NE cs.LG 新提交 57%

NeuroSynth: A Biologically Inspired Continual Reinforcement Learning Architecture for Mitigating Catastrophic Forgetting

NeuroSynth:一种受生物启发的持续强化学习架构,用于缓解灾难性遗忘

Yash Kini

机构 * James Madison High School(詹姆斯麦迪逊高中)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本研究提出受生物启发的持续强化学习架构NeuroSynth,通过双路径巩固机制缓解灾难性遗忘,实验显示其在多个顺序导航任务中相比PPO、EWC保留更多早期任务知识,改善了持续学习的稳定性-可塑性平衡。

Comments Disclaimer. This manuscript is provided as an arXiv preprint to establish a public record of the NeuroSynth continual reinforcement learning architecture and its evaluation on the NeuroMaze-CL benchmark. This full manuscript has been submitted to the Journal of High School Science for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28464 2026-07-31 cs.CV 新提交 57%

Can Vision-Language Models Reason about AI Edits in Images?

视觉-语言模型能否对图像中的AI编辑进行推理?

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28225 2026-07-31 cs.CV 新提交 57%

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

FaithEyes:通过多智能体过程图像验证实现可信的工具使用

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27967 2026-07-31 cs.AI 新提交 57%

MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation

MARS-RA:基于具身多智能体协作中多模态比较的信用分配排序聚合

Dawei Wang, Di Zhao, Xinyuan Liu, Marci Chi Ma, Xiaoyang Liu, Chengming Zhou, Gary Ushaw, Richard Davison

机构 * Newcastle University(纽卡斯尔大学) University of Auckland(奥克兰大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 本研究针对具身多智能体协作的信用分配难题,提出MARS-RA框架,将其转化为多模态模型生成的成对比较排序聚合问题,经理论与实验验证可引导智能体有效协作。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01110 2026-07-31 cs.RO 版本更新 57%

Compact Task-Aligned Imitation Learning for Laboratory Automation

紧凑的任务对齐模仿学习用于实验室自动化

Kanata Suzuki, Hanon Nakamura, Kana Miyamoto, Tetsuya Ogata

机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24672 2026-07-28 cs.LG 新提交 57%

Explainable Reinforcement Learning via Physics-Aware Policy Distillation

通过物理感知策略蒸馏实现可解释强化学习

Shaker Al-Tamari, Waled Kadour

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24577 2026-07-28 cs.LG cs.SE 新提交 57%

Evaluating Fuzz Testing for Reinforcement Learning Agents

评估强化学习智能体的模糊测试

Zhibin Kang, Hanmo You, Dong Wang, Haiming Zheng, Junjie Chen

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 研究针对强化学习智能体模糊测试评估差异问题,通过在三种环境下统一配置对五种方法及随机测试进行基准测试,从多角度评估,揭示不同方法特点,表明模糊测试能提升智能体鲁棒性等,还给出可操作指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24320 2026-07-28 cs.RO cs.SY eess.SY 新提交 57%

Continual-RL for Generalization in Autonomous Racing on the RoboRacer Platform

用于RoboRacer平台自主赛车中泛化的持续强化学习

Joel Siegert, Edoardo Ghignone, Michele Magno

机构 * Center for Project-Based Learning, D-ITET, ETH Zurich(基于项目的学习中心,分布式信息技术与电气工程学院,苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 针对现代机器人适应变化环境的挑战,提出基于持续反向传播的持续强化学习框架,仅用现实世界数据训练通用策略并微调超越经典控制器,还提出离线强化学习比较方法并进行模拟分析。

Comments 8 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24057 2026-07-28 cs.LG 新提交 57%

Constrained Reinforcement Learning Using Successor Representations

使用后继表示的约束强化学习

Michael Girstl, Alexander Mattick, Christopher Mutschler

机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) University of Technology Nuremberg (UTN)(纽伦堡工业大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。

Comments published in Transactions for Machine Learning Research 2026

Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21302 2026-07-28 cs.AI 版本更新 57%

Expert Behavior Prior Reinforcement Learning

专家行为先验强化学习

Gong Gao, Weidong Zhao, Xianhui Liu, Ning Jia

机构 * School of Computer Science, Tongji University(同济大学计算机科学与技术学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 研究针对行为先验强化学习依赖静态离线数据集的问题,提出专家行为先验算法,通过Q引导的条件变分自编码器生成专家策略先验,并结合专家策略引导和策略梯度校正模块,提升样本效率与收敛稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18985 2026-07-28 cs.AI 版本更新 57%

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction

雅典娜大脑技术报告:用于通用智能和具身交互的高效机器人大脑

Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 研究针对具身智能体对设备端紧凑模型需求,提出雅典娜大脑8B模型,经多阶段训练流程,使其兼具通用与具身交互能力,实验证明该模型在通用和具身评估中有效,能在保持性能同时生成更简洁回复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08757 2026-07-28 cs.RO 版本更新 57%

A Visuo-Tactile Data Collection System with Haptic Feedback for Coarse-to-Fine Imitation Learning

一种带有触觉反馈的视觉-触觉数据采集系统用于粗到细模仿学习

Yeseung Kim, Nayoung Oh, Jun Park, Teetat Thamronglak, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种视觉-触觉数据采集系统,生成时间结构丰富的接触密集演示,用于模仿学习。通过直接驱动夹具和触觉阵列,保留自然触觉反馈,结合实时注释,生成多模态数据集以支持粗到细学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20834 2026-07-24 cs.LG 新提交 57%

Offline RL with Hierarchical Action Chunking

基于分层动作分块的离线强化学习

Ahad Jawaid

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究离线目标条件强化学习中扩展到长期任务的挑战,提出HiQC算法,结合高级潜在规划与低级动作分块,实现无偏k步价值备份,理论证明其价值误差界限更紧,实证表明在OGBench套件中性能最佳。

Comments RLC/RLJ 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19628 2026-07-23 cs.LG 新提交 57%

HypEMBER: Hypernetwork-based Ensemble for Robust Policy Learning of Parametrized Dynamical Systems

HypEMBER:基于超网络的集成方法用于参数化动态系统的稳健策略学习

Nicolò Botteghi, Gabriele Pascali, Urban Fasel, Andrea Manzoni

机构 * MOX, Department of Mathematics Politecnico di Milano(米兰理工大学数学MOX系) Department of Aeronautics Imperial College London(伦敦帝国理工学院航空系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究在测量和模型不确定下参数化动态系统的稳健控制,提出基于超网络与集成学习结合的HypEMBER框架,通过超网络表示策略和价值函数实现参数泛化,用逼近器集成量化不确定性,实验表明该框架能提升训练稳定性等,增强对不确定性的稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19232 2026-07-22 cs.LG cs.MA 新提交 57%

S3: Stable Subgoal Selection by Constraining Uncertainty of Coarse Dynamics in Hierarchical Reinforcement Learning

S3:通过约束分层强化学习中粗粒度动力学的不确定性进行稳定子目标选择

Kshitij Kumar Srivastava, Kshitij Jerath

机构 * University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究分层强化学习中高层智能体子目标选择问题,提出用粗粒度动力学提供动力学感知内在动机,通过最小化预测不确定性稳定高层策略,经实验验证该方法在非平稳长期环境中表现优于现有方法。

Comments Manuscript accepted to the Eighteenth Workshop on Adaptive and Learning Agents (ALA), at the 25th International Conference of Autonomous Agents and Multi Agent Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17981 2026-07-21 cs.LG 新提交 57%

Information-Based Exploration via Random Features for Reinforcement Learning

基于随机特征的强化学习信息探索

Waris Radji, Odalric-Ambrym Maillard

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究如何在强化学习中进行信息探索,提出基于贝叶斯核方法理论的随机特征信息增益(RFIG),用随机傅里叶特征近似信息增益,给出误差界并避免黑箱问题,实践细节使其可扩展到深度RL场景,实验显示其性能有竞争力且理论解释优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17560 2026-07-21 cs.AI 新提交 57%

Reinforcement Learning: From Algorithms To Foundation Models

强化学习:从算法到基础模型

Zihan Ding

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。

Comments Princeton University PhD Thesis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17479 2026-07-21 cs.CV 新提交 57%

TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning

TraversRL:基于强化学习的可通行行人路径生成

Bin Han, Robert Wolfe, Bill Howe

机构 * University of Washington(华盛顿大学) Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 研究旨在从航拍图像生成行人路径,核心方法是用TraversRL视觉条件模型,通过特定动作空间和奖励机制迭代生长路径网络,主要贡献是相比基线提升交并比与连通性指标,结合奖励生成更优网络,证明该建模方法的有效性。

Comments Accepted to ECCV 2026, main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17038 2026-07-21 cs.AI 新提交 57%

Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正

Amez Amanj Ali, Kuo-Kun Tseng

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。

Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏