arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-30 至 2025-12-30 共收录 53 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 53 篇

2308.03427 2025-12-30 cs.AI 89%

TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage

TPTU:基于大型语言模型的AI代理用于任务规划和工具使用

Jingqing Ruan, Yihong Chen, Bin Zhang, Zhiwei Xu, Tianpeng Bao, Guoqing Du, Shiwei Shi, Hangyu Mao, Ziyue Li, Xingyu Zeng, Rui Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学) SenseTime Research(商汤科技研究院) HKUST(香港科技大学)

专题命中 规划决策 :AI agent(title,abstract);planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于大型语言模型的AI代理框架,设计两种代理类型以提升任务规划和工具使用能力,并通过实验验证其在复杂任务中的有效性。

Comments Accepted in NeurIPS-2023 Workshop on Foundation Models for Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22895 2025-12-30 cs.AI 88%

SAMP-HDRL: Segmented Allocation with Momentum-Adjusted Utility for Multi-agent Portfolio Management via Hierarchical Deep Reinforcement Learning

SAMP-HDRL:通过分层深度强化学习实现多智能体投资组合管理的分段分配与动量调整效用

Xiaotian Ren, Nuerxiati Abudurexiti, Zhengyong Jiang, Angelos Stefanidis, Hongbin Liu, Jionglong Su

机构 * School of AI and Advanced Computing, XJTLU Entrepreneur College (Taicang), Xi’an Jiaotong-Liverpool University(人工智能与先进计算学院,XJTLU创业学院(太仓),西安交通大学利物浦大学) Department of Management Science and Engineering, School of Economics and Management, Xinjiang University(管理科学与工程系,经济管理学院,新疆大学)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 SAMP-HDRL通过分层深度强化学习实现多智能体投资组合管理,结合动态资产分组和动量调整效用,提升投资策略的适应性、鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22496 2025-12-30 cs.MA cs.AI 88%

Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring

层级教学监督:一种多智能体对抗框架用于可靠的AI辅导

Saisab Sadhu, Ashim Dhor

机构 * AAAI 2026 EGSAI Community Activity(AAAI 2026 EGSAI 社区活动)

专题命中 规划决策 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出层级教学监督框架,通过多智能体对抗机制提升AI辅导的可靠性与效率,实验结果显示其在资源受限环境下表现优异。

Comments Accepted for presentation at the AAAI 2026 EGSAI Community Activity (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22536 2025-12-30 cs.CV cs.AI 86%

CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation

CoAgent:协作规划与一致性代理用于连贯视频生成

Qinglin Zeng, Kaitong Cai, Ruiqi Chen, Qinhan Lv, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 规划决策 :agent(title,abstract);planning(title);分类 cs.AI

AI总结 CoAgent通过协作框架提升视频生成的连贯性与一致性,采用计划-合成-验证流程优化长视频的叙事质量与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23480 2025-12-30 cs.CR cs.AI 85%

Agentic AI for Autonomous Defense in Software Supply Chain Security: Beyond Provenance to Vulnerability Mitigation

面向软件供应链安全的代理AI:超越溯源到漏洞缓解

Toqeer Ali Syed, Mohammad Riyaz Belgaum, Salman Jan, Asadullah Abdullah Khan, Saad Said Alqahtani

机构 * Faculty of Computer and Information System(计算机与信息系统学院) Islamic University of Madinah(麦地那伊斯兰大学) Faculty of Computer Studies(计算机研究学院) Arab Open University-Bahrain(巴林阿拉伯开放大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的软件供应链安全框架,结合LLM推理、强化学习和多代理协调,实现主动漏洞缓解,提升检测准确率和响应效率。

Comments Conference paper, accept in ACCA IEEE Bahrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22883 2025-12-30 cs.CR cs.AI 85%

Agentic AI for Cyber Resilience: A New Security Paradigm and Its System-Theoretic Foundations

面向网络韧性的代理AI:一种新的安全范式及其系统理论基础

Tao Li, Quanyan Zhu

机构 * Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系)

专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的网络韧性新范式,通过系统理论框架设计自主工作流,利用博弈论实现网络防御与攻击的动态平衡,提升系统在攻击下的持续适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20981 2025-12-30 cs.CV cs.CL cs.RO 85%

RefAV: Towards Planning-Centric Scenario Mining

RefAV:面向规划导向的场景挖掘

Cainan Davidson, Deva Ramanan, Neehar Peri

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 RefAV通过视觉-语言模型改进场景挖掘,解决自动驾驶中复杂多智能体交互的定位问题。

Comments Project Page: https://cainand.github.io/RefAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23366 2025-12-30 cs.DB cs.AI 83%

AGRO-SQL: Agentic Group-Relative Optimization with High-Fidelity Data Synthesis

AGRO-SQL:基于高保真数据合成的群体相对优化

Cehua Yang, Dongyu Xiao, Junming Lin, Yuyang Song, Hanxu Yan, Shawn Guo, Wei Zhang, Jian Yang, Mingjie Tang, Bryan Dai

机构 * Sichuan University(四川大学) IQuest Research(IQuest研究院) Beihang University(北航大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 AGRO-SQL通过高保真数据合成和群体相对策略优化,提升文本到SQL系统的推理能力与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20491 2025-12-30 cs.CL 81%

Step-DeepResearch Technical Report

Step-DeepResearch 技术报告

Chen Hu, Haikuo Du, Heng Wang, Lin Lin, Mingrui Chen, Peng Liu, Ruihang Miao, Tianchi Yue, Wang You, Wei Ji, Wei Yuan, Wenjin Deng, Xiaojian Yuan, Xiaoyun Zhang, Xiangyu Liu, Xikai Liu, Yanming Xu, Yicheng Cao, Yifei Zhang, Yongyao Wang, Yubo Shu, Yurong Zhang, Yuxiang Zhang, Zheng Gong, Zhichao Chang, Binyan Li, Dan Ma, Furong Jia, Hongyuan Wang, Jiayu Liu, Jing Bai, Junlan Liu, Manjiao Liu, Na Wang, Qiuping Wu, Qinxin Du, Shiwei Li, Wen Sun, Yifeng Gong, Yonglin Chen, Yuling Zhao, Yuxuan Lin, Ziqi Ren, Zixuan Wang, Aihu Zhang, Brian Li, Buyun Ma, Kang An, Li Xie, Mingliang Li, Pan Li, Shidong Yang, Xi Chen, Xiaojia Liu, Yuchu Luo, Yuan Song, YuanHao Ding, Yuanwei Liang, Zexi Li, Zhaoning Zhang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Jiansheng Chen, Jing Li, Xiangyu Zhang, Yibo Zhu

机构 * Step-DeepResearch

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);planning(abstract);agentic(abstract)

AI总结 Step-DeepResearch通过原子能力数据合成策略和渐进式训练路径,实现低成本高效率的深度研究代理,实验表明其在Scale AI Research Rubrics和ADR-Bench上的表现优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23167 2025-12-30 cs.AI cs.LG cs.MA 81%

SPIRAL: Symbolic LLM Planning via Grounded and Reflective Search

SPIRAL:通过 grounded 和 reflective 搜索实现符号 LLM 规划

Yifan Zhang, Giridhar Ganapavarapu, Srideepika Jayaraman, Bhavna Agrawal, Dhaval Patel, Achille Fokoue

机构 * IBM T.J. Watson Research Center(IBM TJ沃森研究中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 SPIRAL 通过 grounded 和 reflective 搜索实现更稳健高效的 LLM 规划

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13461 2025-12-30 cs.LG cs.AI cs.CV cs.NE q-bio.NC 81%

Active Predictive Coding: A Unified Neural Framework for Learning Hierarchical World Models for Perception and Planning

主动预测编码:一种统一的神经框架,用于学习感知与规划的分层世界模型

Rajesh P. N. Rao, Dimitrios C. Gklezakos, Vishwas Sathish

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出主动预测编码框架,通过分层世界模型解决人工智能中感知与规划的两大核心问题。

Comments 15 pages, 10 figures, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23545 2025-12-30 cs.CV cs.AI 79%

PathFound: An Agentic Multimodal Model Activating Evidence-seeking Pathological Diagnosis

PathFound: 一种促进证据寻求病理诊断的代理多模态模型

Shengyi Hua, Jianfeng Wu, Tianle Shen, Kangzhe Hu, Zhongzhen Huang, Shujuan Ni, Zhihong Zhang, Yuan Li, Zhe Wang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院) Shanghai Innovation Institute(上海创新研究院) Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科) Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所) Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科) Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科) Institute of Pathology, Fudan University(复旦大学病理研究所) Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI

AI总结 PathFound是一种通过主动信息获取和诊断完善来提升病理诊断准确性的代理多模态模型,其在多种临床场景中表现出卓越的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23324 2025-12-30 cs.AI cs.LO 79%

On Conformant Planning and Model-Checking of $\exists^*\forall^*$ Hyperproperties

关于$\exists^*\forall^*$超属性的符合计划与模型检查

Raven Beutner, Bernd Finkbeiner

机构 * CISPA Helmholtz Center for Information Security, Germany(CISPA海德堡信息安全研究中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文研究了$\exists^*\forall^*$超属性的模型检查与符合计划问题之间的紧密联系,证明两者可以相互转换并建立完整的编码方法。

Comments ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22367 2025-12-30 cs.AI 79%

Subgoaling Relaxation-based Heuristics for Numeric Planning with Infinite Actions

基于子目标的放松启发式方法用于带有无限动作的数值规划

Ángel Aso-Mollar, Diego Aineto, Enrico Scala, Eva Onaindia

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种方法,将带有无限动作的数值规划问题转换为简单任务,利用子目标启发式方法进行有效求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22207 2025-12-30 cs.AI 79%

GamiBench: Evaluating Spatial Reasoning and 2D-to-3D Planning Capabilities of MLLMs with Origami Folding Tasks

GamiBench: 通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力

Ryan Spencer, Roey Yaari, Ritvik Vemavarapu, Joyce Yang, Steven Ngo, Utkarsh Sharma

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 GamiBench通过折纸任务评估多模态大语言模型的空间推理和2D到3D规划能力,引入新指标并揭示模型在复杂折叠任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23257 2025-12-30 cs.RO 78%

Beyond Coverage Path Planning: Can UAV Swarms Perfect Scattered Regions Inspections?

超越覆盖路径规划:无人机群能否完美检查散落区域?

Socratis Gkelios, Savvas D. Apostolidis, Pavlos Ch. Kapoutsis, Elias B. Kosmatopoulos, Athanasios Ch. Kapoutsis

机构 * Department of Electrical and Computer Engineering, Democritus University of Thrace(电气与计算机工程系,德摩克利特大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出多无人机不连通区域检查方法,用于高效检查散落区域,提升操作效率并保持高质量数据收集。

Journal ref Robotics and Autonomous Systems 197 (March 2026) 105297

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22893 2025-12-30 cs.DB 78%

Time Sensitive Multiple POIs Route Planning on Bus Networks

时间敏感的多POI公交网络路线规划

Simu Liu, Kailin Jiao, Junping Du, Yawen Li, Zhe Xue, Xiaoyang Sean Wang, Ziqiang Yu, Yunchuan Shi

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出EA-Star算法,用于在公交网络中高效规划时间敏感的多POI路线,通过改进的图结构和A*算法优化搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22832 2025-12-30 cs.MA 78%

MARPO: A Reflective Policy Optimization for Multi Agent Reinforcement Learning

MARPO:多智能体强化学习中的反思策略优化

Cuiling Wu, Yaozhong Gan, Junliang Xing, Ying Fu

专题命中 规划决策 :agent(title,abstract)

AI总结 MARPO通过反思机制和不对称截断机制提升多智能体强化学习的样本效率和训练稳定性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22626 2025-12-30 cs.CV 78%

Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion

Envision:通过目标图像视频扩散进行具身视觉规划

Yuming Gu, Yizhi Wang, Yining Hong, Yipeng Gao, Hao Jiang, Angtian Wang, Bo Liu, Nathaniel S. Dennler, Zhengfei Kuang, Hao Li, Gordon Wetzstein, Chongyang Ma

机构 * University of Southern California(南加州大学) ByteDance(字节跳动) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) MBZUAI

专题命中 规划决策 :planning(title,abstract)

AI总结 Envision 通过目标图像视频扩散模型实现具身视觉规划,提升目标对齐和空间一致性,支持下游机器人任务。

Comments Page: https://envision-paper.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22575 2025-12-30 cs.RO 78%

ParaMaP: Parallel Mapping and Collision-free Motion Planning for Reactive Robot Manipulation

ParaMaP: 并行映射与无碰撞运动规划用于反应式机器人操作

Xuewei Zhang, Bailing Tian, Kai Zheng, Yulin Hui, Junjie Lu, Zhiyu Li

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 ParaMaP通过并行映射与SMPC规划器实现未知环境中机器人操作的实时无碰撞运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25806 2025-12-30 cs.CR 78%

APThreatHunter: An automated planning-based threat hunting framework

APThreatHunter: 一种基于自动规划的威胁狩猎框架

Mustafa F. Abdelwahed, Ahmed Shafee, Joan Espasa

专题命中 规划决策 :planning(title,abstract)

AI总结 APThreatHunter通过自动规划生成目标假设,提升网络威胁狩猎的自动化水平和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17479 2025-12-30 cs.AI cs.CY cs.HC cs.LG 73%

Culturally-Attuned Moral Machines: Implicit Learning of Human Value Systems by AI through Inverse Reinforcement Learning

文化适应的道德机器:通过逆强化学习让AI隐式学习人类价值观系统

Nigini Oliveira, Jasmine Li, Koosha Khalvati, Rodolfo Cortes Barragan, Katharina Reinecke, Andrew N. Meltzoff, Rajesh P. N. Rao

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Institute for Learning and Brain Sciences, University of Washington(学习与脑科学研究所,华盛顿大学)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过逆强化学习让AI隐式学习不同文化的价值观,展示AI能从人类行为中习得文化适应的道德系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11143 2025-12-30 cs.MA cs.AI cs.LG 73%

Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework

在合作多智能体强化学习中实现全局最优的转换与蒸馏框架

Jianing Ye, Chenghao Li, Yongqiang Dou, Jianhao Wang, Guangwen Yang, Chongjie Zhang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TAD框架,通过将多智能体MDP转换为单智能体MDP并蒸馏策略,解决合作MARL中的优化问题,实现全局最优并提升执行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21257 2025-12-30 cs.IR cs.CL 70%

ReaSeq: Unleashing World Knowledge via Reasoning for Sequential Modeling

ReaSeq:通过推理解锁世界知识用于序列建模

Jiakai Tang, Chuan Wang, Gaoming Yang, Han Wu, Jiahao Yu, Jian Wu, Jianwu Hu, Junjun Zheng, Longbin Li, Shuwen Xiao, Xiangheng Kong, Yeqiu Yang, Yuning Jiang, Ahjol Nurlanbek, Binbin Cao, Bo Zheng, Fangmei Zhu, Gaoming Zhou, Huimin Yi, Huiping Chu, Jin Huang, Jinzhe Shan, Kenan Cui, Longbin Li, Silu Zhou, Wen Chen, Xia Ming, Xiang Gao, Xin Yao, Xingyu Wen, Yan Zhang, Yiwen Hu, Yulin Wang, Ziheng Bao, Zongyuan Wu

机构 * TaoRank Team(TaoRank团队)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 ReaSeq通过引入世界知识增强推理,提升推荐系统在物品表示和用户兴趣建模上的性能,实现IPV、CTR、订单和GMV的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23372 2025-12-30 cs.HC 67%

A Design Space for Intelligent Agents in Mixed-Initiative Visual Analytics

混合倡议式可视化分析中智能代理的设计空间

Tobias Stähle, Matthijs Jansen op de Haar, Sophia Boyer, Rita Sevastjanova, Arpit Narechania, Mennatallah El-Assady

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 本文提出了一种混合倡议式可视化分析中智能代理的设计空间框架,通过系统回顾90个系统,提出了六个维度来表征代理能力,并为未来研究提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19854 2025-12-30 cs.RO cs.HC 67%

Think, Act, Learn: A Framework for Autonomous Robotic Agents using Closed-Loop Large Language Models

思考、行动、学习:一种利用闭环大语言模型的自主机器人代理框架

Anjali R. Menon, Rohit K. Sharma, Priya Singh, Chengyu Wang, Aurora M. Ferreira, Mateja Novak

机构 * Dept. of Electronics & Comm. Eng.(电子与通信工程系) Government Engineering College(政府工程学院) Dept. of Electrical & Electronics Eng.(电气与电子工程系) Poornima College of Engineering(波奥尼玛工程学院) Dept. of Electronics & Telecom. Eng.(电子与电信工程系) Shivaji University College of Eng.(希瓦吉大学工程学院) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) Dept. of Electrical Eng.(电气工程系) Instituto Federal do Maranhão(马里兰联邦学院) Dept. of Electrical & Computer Eng.(电气与计算机工程系) Technical University of Košice(科希丘夫技术大学)

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 本文提出T-A-L框架,通过闭环大语言模型实现机器人自主学习与策略优化,显著提升复杂任务的成功率和泛化能力。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23028 2025-12-30 cs.CV cs.AI cs.SE 62%

An Architecture-Led Hybrid Report on Body Language Detection Project

以架构为导向的混合报告:身体语言检测项目

Thomson Tong, Diba Darooneh

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.SE

AI总结 本报告分析了两种视觉-语言模型的架构特性,并探讨了其在视频到制品管道中的应用及系统限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12808 2025-12-30 cs.LG cs.AI cs.LO 62%

Expressive Temporal Specifications for Reward Monitoring

用于奖励监控的表达性时间规范

Omar Adalat, Francesco Belardinelli

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于定量线性时间逻辑的奖励监控方法,用于提升强化学习中奖励密度和训练效率。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15965 2025-12-30 cs.LG cs.AI cs.DC 62%

RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation

RLinf: 通过宏到微流转换实现灵活高效的大型强化学习

Chao Yu, Yuanqing Wang, Zhen Guo, Hao Lin, Si Xu, Hongzhi Zang, Quanlu Zhang, Yongji Wu, Chunyang Zhu, Junhao Hu, Zixiao Huang, Mingjie Wei, Yuqing Xie, Ke Yang, Bo Dai, Zhexuan Xu, Jiakun Du, Xiangyuan Wang, Xu Fu, Letong Shi, Zhihao Liu, Kang Chen, Weilin Liu, Gang Liu, Boxun Li, Jianlei Yang, Zhi Yang, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Beihang University(北航) Shanghai Jiaotong University(上海交通大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 RLinf通过宏到微流转换范式,实现了高效灵活的大型强化学习训练系统,显著提升了训练吞吐量。

Comments GitHub Repo: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22733 2025-12-30 cs.LG cs.AI 62%

FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents

FoldAct: 长时间 horizon 搜索代理的高效且稳定的上下文折叠

Jiaqi Shao, Yufeng Miao, Wei Zhang, Bing Luo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Duke Kunshan University(杜克大学昆山学院) Microsoft AI(微软人工智能)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 FoldAct通过分离损失计算、全上下文一致性损失和选择性段训练,解决长时间 horizon 搜索代理中上下文折叠的非平稳观察问题,提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏