arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-02 至 2026-02-02 共收录 40 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 40 篇

2601.22623 2026-02-02 cs.AI cs.MA 92%

SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly

SYMPHONY:异构语言模型组装的协同多智能体规划

Wei Zhu, Zhiwen Tang, Kun Yue

机构 * School of Information Science and Engineering, Yunnan University, Kunming, China(信息科学与工程学院,云南大学,昆明,中国) Yunnan Key Laboratory of Intelligent Systems and Computing, Kunming, China(智能系统与计算云南重点实验室,昆明,中国)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract);autonomous agent(abstract)

AI总结 SYMPHONY通过整合异构语言模型的多智能体规划框架,提升探索能力与规划性能,实验证明其在复杂任务中的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11062 2026-02-02 cs.LG cs.MA 91%

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

Stronger-MAS: 多智能体强化学习用于协作大语言模型

Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

机构 * University of California, San Diego(加州大学圣地亚哥分校) Intel Corporation(英特尔公司)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);workflow(abstract)

AI总结 Stronger-MAS提出了一种针对多智能体强化学习的AT-GRPO算法,通过改进的分组策略和训练系统,在多个任务中显著提升了大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10460 2026-02-02 cs.SE cs.AI 90%

Understanding and Bridging the Planner-Coder Gap: A Systematic Study on the Robustness of Multi-Agent Systems for Code Generation

理解并弥合规划者-生成者之间的差距:对多智能体系统在代码生成中鲁棒性的系统研究

Zongyi Lyu, Songqiang Chen, Zhenlan Ji, Liwen Wang, Shuai Wang, Daoyuan Wu, Wenxuan Wang, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Lingnan University(岭南大学) Renmin University of China(中国人民大学)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文研究多智能体系统在代码生成中的鲁棒性问题,发现规划者与生成者之间的信息丢失是主要缺陷,并提出修复方法以提升系统鲁棒性。

Comments 18pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22311 2026-02-02 cs.AI cs.CL cs.LG 85%

Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents

为何推理无法规划:从规划角度分析LLM代理在长周期决策中的表现

Zehong Wang, Fang Wu, Hongru Wang, Xiangru Tang, Bolian Li, Zhenfei Yin, Yijun Ma, Yiyang Li, Weixiang Sun, Xiusi Chen, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Stanford University(斯坦福大学) Purdue University(普渡大学) University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) Yale University(耶鲁大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文从规划角度分析LLM代理在长周期决策中的失败原因,提出FLARE方法通过前瞻和价值传播提升规划能力,使LLaMA-8B在多个基准中超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17687 2026-02-02 cs.LG cs.AI 84%

Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis

代理强化学习赋能下一代化学语言模型用于分子设计与合成

Hao Li, He Cao, Shenyao Peng, Zijing Liu, Bin Feng, Yu Wang, Zhiyuan Yan, Yonghong Tian, Yu Li, Li Yuan

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Shenzhen Graduate School, Shenzhen, 518055, China(深圳研究生院,深圳,518055,中国) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) Peng Cheng Laboratory, Shenzhen, 518000, China(鹏城实验室,深圳,518000,中国)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 ChemCRAFT通过代理强化学习实现化学语言模型的高效分子设计与合成,突破传统模型在成本与隐私间的限制。

Comments Working in Progress, 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21558 2026-02-02 cs.CL 83%

ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement Arenas

ASTRA: 自动化合成代理轨迹与强化环境

Xiaoyu Tian, Haotian Wang, Shuaiting Chen, Hao Zhou, Kaichi Yu, Yudian Zhang, Jade Ouyang, Junxi Yin, Jiong Chen, Baoyan Guo, Lei Zhang, Junjie Tao, Yuansheng Song, Ming Cui, Chengwei Liu

机构 * Beike Language and Intelligence(北溪语言与智能)

专题命中 规划决策 :agentic(title,abstract);tool-use(abstract);分类 cs.CL

AI总结 ASTRA通过可扩展数据合成和可验证强化学习,自动化训练工具增强语言模型代理,实现多轮稳定学习和高性能工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22545 2026-02-02 cs.RO cs.AI 83%

Adapting Reinforcement Learning for Path Planning in Constrained Parking Scenarios

在受限停车场景中适应强化学习用于路径规划

Feng Tao, Luca Paparusso, Chenyi Gu, Robin Koehler, Chenxu Wu, Xinyu Huang, Christian Juette, David Paz, Ren Liu

机构 * Bosch Research(博世研究)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出了一种深度强化学习框架,用于在受限停车场景中实现高效的实时路径规划,通过序列决策问题建模和新基准的开发,实现了更高的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22491 2026-02-02 cs.CL 83%

SSL: Sweet Spot Learning for Differentiated Guidance in Agentic Optimization

SSL:在代理优化中差异化引导的甜蜜点学习

Jinyang Wu, Changpeng Yang, Yuhao Shen, Fangzhi Xu, Bolin Ni, Chonghua Liao, Yuchen Liu, Hongzhen Wang, Shuai Nie, Shuai Zhang, Haoran Luo, Jiaming Xu

机构 * Tsinghua University(清华大学) Xiaomi Corporation(小米公司) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);分类 cs.CL

AI总结 SSL通过分层奖励引导代理优化,提升解空间中的方向性优化,实现样本效率提升和跨任务迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11352 2026-02-02 cs.AI cs.FL 83%

Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces

物流领域的基础模型:迈向可验证、对话式规划界面

Yunhao Yang, Neel P. Bhatt, Christian Ellis, Samuel Li, Alvaro Velasquez, Zhangyang Wang, Ufuk Topcu

机构 * Neurosymbolic Intelligence(神经符号智能) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于神经符号框架的视觉-语言物流代理,通过自然语言对话和可验证保证实现可信赖的物流规划决策,模型在少量训练样本下实现了高效且准确的物流规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23266 2026-02-02 cs.RO cs.AI 79%

IRL-DAL: Safe and Adaptive Trajectory Planning for Autonomous Driving via Energy-Guided Diffusion Models

IRL-DAL:通过能量引导扩散模型实现自动驾驶的安全自适应轨迹规划

Seyed Ahmad Hosseini Miangoleh, Amin Jalal Aghdasian, Farzaneh Abdollahi

机构 * Department of Electrical Engineering, Amirkabir University of Technology (Tehran Polytechnic)(电气工程系,阿米尔卡比尔技术大学(德黑兰理工大学))

专题命中 规划决策 :planning(title);agent(abstract);分类 cs.AI

AI总结 本文提出IRL-DAL框架,通过能量引导扩散模型实现自动驾驶的安全自适应轨迹规划,结合模仿学习与强化学习,提升行驶安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18847 2026-02-02 cs.LG 79%

Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning

离线目标条件强化学习与投影拟度规划

Anthony Kobanda, Waris Radji, Mathieu Petitbois, Odalric-Ambrym Maillard, Rémy Portelas

机构 * Ubisoft la Forge University of Angers(昂热大学) Inria(法国国家科学研究中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 本文提出ProQ框架,通过学习非对称距离和结合拉格朗日检测器,实现目标条件强化学习中子目标生成与长期目标达成的稳健控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15950 2026-02-02 cs.DM 78%

Parameterized Algorithms for Coordinated Motion Planning: Minimizing Energy

参数化算法用于协调运动规划:最小化能量

Argyrios Deligkas, Eduard Eiben, Robert Ganian, Iyad Kanj, M. S. Ramanujan

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出参数化算法解决协调运动规划问题,通过最小化能量,证明了在特定参数下的可处理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22289 2026-02-02 cs.RO 78%

ReloPush-BOSS: Optimization-guided Nonmonotone Rearrangement Planning for a Car-like Robot Pusher

ReloPush-BOSS: 基于优化的非单调重排规划用于车式机器人推手

Jeeho Ahn, Christoforos Mavrogiannis

机构 * Department of Robotics, University of Michigan(机器人系,密歇根大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 ReloPush-BOSS通过优化预重排和深度优先搜索,实现高效非单调重排规划,适用于密集障碍环境中的车式机器人推手任务。

Comments Preprint of final version, accepted to RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15336 2026-02-02 cs.RO cs.SY eess.SY 78%

Adaptive Cost-Map-based Path Planning in Partially Unknown Environments with Movable Obstacles

在部分未知环境中基于自适应成本图的路径规划

Liviu-Mihai Stan, Ranulfo Bezerra, Shotaro Kojima, Tsige Tadesse Alemayoh, Satoshi Tadokoro, Masashi Konyo, Kazunori Ohno

机构 * Graduate School of Information Sciences, Tohoku University(东京大学信息科学研究生院) Tough Cyberphysical AI Research Center, Tohoku University(东京大学 Tough 联合人工智能研究中心) Sorbonne University(索邦大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种自适应成本图路径规划方法,通过识别可移动障碍物提升机器人在非结构化环境中的导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01409 2026-02-02 cs.RO 78%

Pedestrian-Aware Motion Planning for Autonomous Driving in Complex Urban Scenarios

面向复杂城市场景的行人感知自主驾驶运动规划

Korbinian Moller, Truls Nyberg, Jana Tumova, Johannes Betz

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出一种结合社会力原理和风险感知的运动规划算法,用于解决复杂城市环境中自动驾驶车辆与行人交互的安全高效规划问题。

Comments 13 Pages. Submitted to the IEEE Transactions on Intelligent Vehicles

Journal ref IEEE Open Journal of Intelligent Transportation Systems, vol. 7, pp. 365-378, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22208 2026-02-02 cs.SE 77%

Stalled, Biased, and Confused: Uncovering Reasoning Failures in LLMs for Cloud-Based Root Cause Analysis

停滞、偏见和困惑:揭示LLM在基于云的根本原因分析中的推理失败

Evelien Riddell, James Riddell, Gengyi Sun, Michał Antkiewicz, Krzysztof Czarnecki

专题命中 规划决策 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文通过实证评估揭示LLM在基于云的根本原因分析中的推理失败,评估六种LLM在两种工作流程下的表现,识别16种常见推理失败类型,为未来推理驱动的系统诊断提供指导。

Comments FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06822 2026-02-02 cs.AI cs.CL 73%

RAFFLES: Reasoning-based Attribution of Faults for LLM Systems

基于推理的LLM系统故障归因

Chenyang Zhu, Spencer Hong, Jingyu Wu, Kushal Chawla, Charlotte Tang, Youbing Yin, Nathan Wolfe, Erin Babinsky, Daben Liu

机构 * Capital One

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 RAFFLES通过整合迭代推理的离线评估架构,实现了对LLM系统中步骤级故障的自动化检测,显著提高了故障识别的准确率。

Comments Accepted at EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19299 2026-02-02 cs.AI 70%

Helios: A Foundational Language Model for Smart Energy Knowledge Reasoning and Application

Helios:一种面向智能能源知识推理与应用的基础语言模型

Haoyu Jiang, Fanjie Zeng, Boan Qu, Xiaojie Lin, Wei Zhong

机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15587 2026-02-02 cond-mat.soft cs.MA physics.bio-ph 67%

Learning to flock in open space by avoiding collisions and staying together

在开放空间中通过避障和保持在一起学习群体运动

Martino Brambati, Antonio Celani, Marco Gherardi, Francesco Ginelli

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 该研究通过多智能体强化学习框架,在开放空间中实现群体协同运动,通过避障和保持在一起的策略,产生高极性秩序的集体运动。

Comments 13 pages + appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22517 2026-02-02 cs.RO 67%

RoboStriker: Hierarchical Decision-Making for Autonomous Humanoid Boxing

RoboStriker: 为自主人形 boxing 的分层决策

Kangning Yin, Zhe Cao, Wentao Dong, Weishuai Zeng, Tianyi Zhang, Qiang Zhang, Jingbo Wang, Jiangmiao Pang, Ming Zhou, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 规划决策 :agent(abstract);multi-agent(abstract)

AI总结 RoboStriker通过分层三阶段框架实现自主人形拳击,结合动作跟踪学习与潜在空间正则化,提升竞争性能和现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04769 2026-02-02 cs.CV 67%

Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges

视觉-语言-动作(VLA)模型:概念、进展、应用与挑战

Ranjan Sapkota, Yang Cao, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 规划决策 :planning(abstract);agentic(abstract)

AI总结 本文综述了视觉-语言-动作(VLA)模型的概念、进展、应用与挑战,探讨了其在自动驾驶、医疗机器人等领域的应用及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22930 2026-02-02 cs.RO cs.AI cs.LG 62%

MTDrive: Multi-turn Interactive Reinforcement Learning for Autonomous Driving

MTDrive: 多轮交互式强化学习用于自动驾驶

Xidong Li, Mingyu Guo, Chenchao Xu, Bailin Li, Wenjing Zhu, Yangang Zou, Rui Chen, Zehuan Wang

机构 * Li Auto Inc.(利汽车公司) NVIDIA(英伟达)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 MTDrive通过多轮交互式强化学习框架,结合多模态大语言模型与强化学习,提升自动驾驶轨迹规划的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22352 2026-02-02 cs.LG cs.AI 62%

Recoverability Has a Law: The ERR Measure for Tool-Augmented Agents

可恢复性有定律:工具增强智能体的ERR度量

Sri Vatsa Vuddanti, Satwik Kumar Chittiprolu

机构 * Sri Vatsa Vuddanti(独立研究者) Satwik Kumar Chittiprolu(独立研究者)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种预测理论,通过预期恢复遗憾(ERR)与效率分数(ES)的关系,揭示了语言模型智能体在工具使用中的可恢复性遵循可测量的定律。

Comments Preprint for ICML Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10691 2026-02-02 cs.CL cs.AI 62%

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

从温和到动态对抗的评估:一个大型语言模型的鱿鱼游戏

Zijian Chen, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出鱿鱼游戏,一个动态对抗性评估环境,用于评估大型语言模型的多方面能力,并揭示静态基准中可能存在的评估范式污染问题。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23188 2026-02-02 cs.CL 57%

Deep Search with Hierarchical Meta-Cognitive Monitoring Inspired by Cognitive Neuroscience

受认知神经科学启发的深度搜索与分层元认知监控

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Jingxuan Yang, Haolang Lu, Jun Xu

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China School of Information Technology Search Applications Department, Tencent Beijing China Beijing University of Posts Gaoling School of Artificial Intelligence\ University of China Search Applications Department, Tencent

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 本研究提出DS-MCM框架,通过分层元认知监控机制提升深度搜索的性能和鲁棒性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21706 2026-02-02 cs.LG cs.SY eess.SY 57%

SmartMeterFM: Unifying Smart Meter Data Generative Tasks Using Flow Matching Models

SmartMeterFM: 通过流匹配模型统一智能电表数据生成任务

Nan Lin, Yanbo Wang, Jacco Heres, Peter Palensky, Pedro P. Vergara

机构 * Delft University of Technology(代尔夫特理工大学) Alliander N.V.(Alliander公司)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出通过流匹配模型统一智能电表数据生成任务,解决数据缺失和分辨率不足问题,提升生成数据的现实性和效率。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02662 2026-02-02 cs.LG 57%

Grounding Large Language Models in Interactive Environments with Online Reinforcement Learning

通过在线强化学习将大语言模型接地于交互环境

Thomas Carta, Clément Romac, Thomas Wolf, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Inria (Flowers)(Inria(Flowers)) University of Bordeaux(波尔多大学) Hugging Face Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) Sorbonne Université(索邦大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。

Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a

Journal ref PMLR 202 (2023):3676-3713

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.09861 2026-02-02 cs.AI cs.GT cs.MA cs.RO 57%

Generalized dynamic cognitive hierarchy models for strategic driving behavior

通用动态认知层次模型用于战略驾驶行为

Atrisha Sarkar, Kate Larson, Krzysztof Czarnecki

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出通用动态认知层次模型,用于建模自然驾驶行为和自动驾驶车辆的行为规划,通过自动机策略和稳健响应解决有限理性和共同知识假设问题。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 36(5), 5173-5182 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22662 2026-02-02 cs.AI cs.MA 57%

Task-Aware LLM Council with Adaptive Decision Pathways for Decision Support

具有自适应决策路径的任务感知大语言模型委员会用于决策支持

Wei Zhu, Lixing Yu, Hao-Ren Yao, Zhiwen Tang, Kun Yue

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 TALC通过任务感知的LLM委员会和自适应决策路径,提升决策支持任务的成功率和搜索效率。

Comments A shorter version of this work has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22512 2026-02-02 cs.LG 57%

DRL-Enabled Trajectory Planing for UAV-Assisted VLC: Optimal Altitude and Reward Design

基于深度强化学习的无人机辅助可见光通信轨迹规划:最优高度与奖励设计

Tian-Tian Lin, Yi Liu, Xiao-Wei Tang, Yunmei Shi, Yi Huang, Zhongxiang Wei, Qingqing Wu, Yuhan Dong

机构 * Department of Information and Communication Engineering, Tongji University(信息与通信工程系,同济大学) Department of Electronic Engineering, Shanghai Jiao Tong University(电子工程系,上海交通大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出基于深度强化学习的无人机辅助可见光通信轨迹规划方法,通过优化无人机飞行高度和奖励机制,显著提高数据收集效率。

详情

展开后加载摘要…

URL PDF HTML 收藏