arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35614 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35614 篇

2603.15797 2026-03-19 cs.LG cs.AI 81%

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 规划决策 :agent(title);workflow(abstract);分类 cs.AI、cs.LG

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23592 2026-03-18 cs.RO cs.AI cs.SE 81%

KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning

KEEP: 一种面向高效具身规划的KV缓存中心化内存管理系统

Zebin Yang, Tong Xie, Baotong Lu, Shaoshan Liu, Bo Yu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究院) Microsoft Research(微软研究院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出KEEP系统,通过静态动态内存构建算法、多跳内存重计算算法和层平衡内存加载,提升具身规划效率,实验表明在ALFRED数据集上速度提升2.68倍,优于CacheBlend方法。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25140 2026-03-18 cs.AI cs.CL 81%

ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory

ReasoningBank: 通过推理记忆扩展智能体自我进化

Siru Ouyang, Jun Yan, I-Hung Hsu, Yanfei Chen, Ke Jiang, Zifeng Wang, Rujun Han, Long T. Le, Samira Daruki, Xiangru Tang, Vishy Tirumalashetty, George Lee, Mahsan Rofouei, Hangfei Lin, Jiawei Han, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究) Yale University(耶鲁大学) Google Cloud AI(谷歌云人工智能)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出ReasoningBank,通过整合智能体自我评估的成功与失败经验,提升其持续学习能力,并引入MaTTS加速学习过程,提升任务表现与效率。

Comments Accepted to ICLR 2026; Code: https://github.com/google-research/reasoning-bank

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14486 2026-03-17 cs.CL cs.AI 81%

Infinite Problem Generator: Verifiably Scaling Physics Reasoning Data with Agentic Workflows

无限问题生成器:通过代理工作流可验证地扩展物理推理数据

Aditya Sharan, Sriram Hebbale, Dhruv Kumar

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出IPG框架,通过公式-as-代码方法生成可解物理问题,解决大语言模型训练中高质量数据稀缺的问题,发布包含1335个经典力学问题的ClassicalMechanicsV1数据集,展示高结构多样性及复杂度与代码长度的强相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14312 2026-03-17 cs.AI cond-mat.dis-nn cs.LG cs.MA q-bio.BM 81%

Autonomous Agents Coordinating Distributed Discovery Through Emergent Artifact Exchange

自主代理通过涌现式物品交换协调分布式发现

Fiona Y. Wang, Lee Marom, Subhadeep Pal, Rachel K. Luu, Wei Lu, Jaime A. Berkovich, Markus J. Buehler

专题命中 规划决策 :autonomous agent(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出ScienceClaw + Infinite框架,通过自主代理在无中央协调下进行科学探究,展示异构工具链、代理间涌现式收敛及可追溯推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14229 2026-03-17 cs.AI cs.SE 81%

Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes

基于代理的DAG编排规划框架:用于混合数据湖中多模态、多跳问答系统

Kirushikesh D B, Manish Kesarwani, Nishtha Madaan, Sameep Mehta, Aldrin Dennis, Siddarth Ajay, Rakesh B R, Renu Rajagopal, Sudheesh Kairali

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出A.DOT规划框架,通过编译自然语言查询为DAG执行计划,实现多模态多跳问答,提升准确性和效率,并生成可追溯的证据链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13443 2026-03-17 cs.SE cs.AI cs.PL 81%

NormCode Canvas: Making LLM Agentic Workflows Development Sustainable via Case-Based Reasoning

NormCode Canvas:通过基于案例的推理使LLM代理工作流开发可持续

Xin Guan, Yunshan Li, Ze Wang

机构 * Psylens AI, China(Psylens AI,中国) Shenzhen University, China(深圳大学,中国) University College London, United Kingdom(伦敦大学学院,英国)

专题命中 规划决策 :agentic(title);planning(abstract);分类 cs.AI、cs.SE

AI总结 NormCode Canvas通过基于案例的推理实现多步骤LLM工作流的可持续开发,其核心是NormCode语言,确保每个执行检查点都是自包含的案例,从而消除隐含共享状态带来的问题。

Comments 16 pages, 5 figures. Submitted to ICCBR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11864 2026-03-13 cs.AI cs.SE 81%

Social, Legal, Ethical, Empathetic and Cultural Norm Operationalisation for AI Agents

社会、法律、伦理、共情和文化规范的AI代理操作化

Radu Calinescu, Ana Cavalcanti, Marsha Chechik, Lina Marsso, Beverley Townsend

专题命中 规划决策 :AI agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种系统性的SLEEC规范操作化过程,旨在解决AI代理行为与社会、法律、伦理、共情和文化规范一致的工程挑战,并定义了研究和政策议程。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11082 2026-03-13 cs.SE cs.AI 81%

Quality-Driven Agentic Reasoning for LLM-Assisted Software Design: Questions-of-Thoughts (QoT) as a Time-Series Self-QA Chain

以质量为导向的代理推理用于大语言模型辅助软件设计:问题-思考(QoT)作为时间序列自我QA链

Yen-Ku Liu, Yun-Cheng Tsai

专题命中 规划决策 :agentic(title);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文提出QoT框架,通过时间序列自我QA链提升大语言模型辅助软件设计的质量,通过多领域实验验证其在不同模型规模和复杂度下的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10800 2026-03-12 cs.LG cs.AI cs.SY eess.SY 81%

AI-Enhanced Spatial Cellular Traffic Demand Prediction with Contextual Clustering and Error Correction for 5G/6G Planning

基于上下文聚类和误差校正的AI增强型空间蜂窝交通需求预测用于5G/6G规划

Mohamad Alkadamani, Colin Brown, Halim Yanikomeroglu

机构 * Innovation, Science and Economic Development Canada (ISED) and Carleton University(创新、科学与经济发展的加拿大(ISED)和卡尔顿大学) Communications Research Centre (CRC)(通讯研究中心(CRC)) Carleton University(卡尔顿大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于上下文聚类和误差校正的AI框架,用于提高5G/6G规划中空间蜂窝交通需求预测的准确性与可靠性。

Comments 5 pages, 8 figures. Submitted to IEEE Wireless Communications Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10110 2026-03-10 cs.RO cs.AI cs.LG 81%

IMPACT: Intelligent Motion Planning with Acceptable Contact Trajectories via Vision-Language Models

IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划

Yiyang Ling, Karan Owalekar, Oluwatobiloba Adesanya, Erdem Bıyık, Daniel Seita

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03540 2026-03-06 cs.LG cs.AI 81%

Path Planning for Masked Diffusion Model Sampling

基于掩码扩散模型采样的路径规划

Fred Zhangzhi Peng, Zachary Bezemek, Sawan Patel, Jarrid Rector-Brooks, Sherwood Yao, Avishek Joey Bose, Alexander Tong, Pranam Chatterjee

机构 * Duke University(杜克大学) Atom Bioworks(Atom生物工坊) Mila – Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) The University of Oxford(牛津大学) Aithyra(Aithyra公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出路径规划策略,通过规划和去噪两个阶段提升掩码扩散模型的生成质量,实验表明在多个领域均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23589 2026-03-06 cs.AI cs.CV cs.LG 81%

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

BridgeDrive: 基于扩散桥的闭环轨迹规划扩散策略

Shu Liu, Wenlin Chen, Weihao Li, Zheng Wang, Lijin Yang, Jianing Huang, Yipin Zhang, Zhongzhan Huang, Ze Cheng, Hao Yang

机构 * Bosch (China) Investment Ltd(博世(中国)投资有限公司)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 BridgeDrive提出一种基于锚点的扩散桥策略,通过实时闭环轨迹规划提升自动驾驶的安全性和效率。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04289 2026-03-05 cs.LG cs.AI 81%

IPD: Boosting Sequential Policy with Imaginary Planning Distillation in Offline Reinforcement Learning

IPD: 通过离线规划蒸馏提升序列策略

Yihao Qin, Yuanfei Wang, Hang Zhou, Peiran Liu, Hao Dong, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 IPD通过引入离线规划蒸馏技术,提升离线强化学习中序列策略的决策稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10045 2026-03-03 cs.RO cs.AI cs.LG 81%

Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning

神经符号技能发现用于条件多级规划

Hakan Aktas, Yigit Yildirim, Ahmet Firat Gamsiz, Deniz Bilge Akkoc, Erhan Oztop, Emre Ugur

机构 * Department of Computer Science and Technology The University of Cambridge(计算机科学与技术系 剑桥大学) Department of Computer Engineering Bogazici University(计算机工程系 boazici大学) SISREC Osaka University(Osaka大学SISREC)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种神经符号学习架构,通过少量演示获取可推广的高级符号技能,并在多级规划中实现复杂任务的执行。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22603 2026-03-03 cs.AI cs.LG 81%

SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Reasoning

SideQuest: 为长时间范围代理推理的模型驱动KV缓存管理

Sanjay Kariyappa, G. Edward Suh

机构 * NVIDIA

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 SideQuest通过利用大型推理模型自身进行KV缓存压缩,有效减少代理任务中的内存使用,同时保持较高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23079 2026-02-27 cs.CL cs.CR cs.LG 81%

Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent

通过风格学辅助LLM代理评估去匿名化风险

Boyang Zhang, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SLA方法,通过风格学与LLM推理结合,评估和缓解文本去匿名化风险,实验表明其在各类场景中具有高推断准确性,并提出引导重组成策略以降低作者身份可识别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20528 2026-02-25 cs.CL cs.LG 81%

Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning

停止-思考-自动回归:结合潜在扩散规划的语言建模

Justin Lovelace, Christian Belardi, Sofian Zalouk, Adhitya Polavaram, Srivatsa Kundurthy, Kilian Q. Weinberger

机构 * Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL、cs.LG

AI总结 STAR-LDM通过引入思考阶段的潜在扩散规划,实现了更高效的全局规划和生成,显著提升了语言理解和叙事连贯性任务的表现。

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20422 2026-02-25 cs.AI cs.LG 81%

Diffusion Modulation via Environment Mechanism Modeling for Planning

通过环境机制建模进行扩散调制用于规划

Hanping Zhang, Yuhong Guo

机构 * School of Computer Science, Carleton University(计算机科学学院,卡尔顿大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过环境机制建模的扩散调制方法提升了离线强化学习中轨迹生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09708 2026-02-25 cs.CV cs.AI cs.LG cs.RO 81%

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

Fast-ThinkAct: 通过可言说的潜在规划实现高效的视觉-语言-动作推理

Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA(英伟达)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 Fast-ThinkAct通过可言说的潜在规划实现高效的视觉-语言-动作推理,显著降低推理延迟并保持长周期规划能力。

Comments CVPR 2026. Project page: https://jasper0314-huang.github.io/fast-thinkact/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19634 2026-02-24 cs.LG cs.AI stat.ML 81%

Compositional Planning with Jumpy World Models

基于跳跃世界模型的组合规划

Jesse Farebrother, Matteo Pirotta, Andrea Tirinzoni, Marc G. Bellemare, Alessandro Lazaric, Ahmed Touati

机构 * FAIR at Meta Mila -- Qu\'ebec AI Institute McGill University

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于跳跃世界模型的组合规划方法,通过学习多步动态预测模型提升长时间任务的规划性能,实现复杂任务的解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12066 2026-02-24 cs.AI cs.LG 81%

AI Agents as Universal Task Solvers

AI代理作为通用任务求解器

Alessandro Achille, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 规划决策 :AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出将AI代理视为随机动态系统,通过归纳推理框架,探讨学习推理的算法结构,揭示任务解决时间与算法信息的关系,并指出在无限制模型规模下,奖励信号可能导致暴力求解而非可转移策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18694 2026-02-24 cs.LG cs.AI 81%

In-Context Planning with Latent Temporal Abstractions

基于潜在时间抽象的上下文规划

Baiting Luo, Yunuo Zhang, Nathaniel S. Keplinger, Samir Gupta, Abhishek Dubey, Ayan Mukhopadhyay

机构 * Vanderbilt University(范德比大学) William & Mary(威廉与玛丽学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 I-TAP通过学习离散时间抽象空间,实现高效且鲁棒的上下文规划,在部分可观测和随机动态环境中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19412 2026-02-24 cs.LG cs.AI cs.CE econ.EM stat.CO 81%

Robust Time Series Causal Discovery for Agent-Based Model Validation

面向智能体模型验证的鲁棒时间序列因果发现

Gene Yu, Ce Guo, Wayne Luk

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出鲁棒交叉验证方法,用于提升智能体模型验证中因果结构学习的鲁棒性和准确性。

Comments A peer-reviewed version titled "VCDF: A Validated Consensus-Driven Framework for Time Series Causal Discovery" is accepted to Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD) 2026. Please cite the PAKDD version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07680 2026-02-19 cs.CV cs.AI cs.LG cs.RO 81%

Vision and Language: Novel Representations and Artificial intelligence for Driving Scene Safety Assessment and Autonomous Vehicle Planning

视觉与语言:新颖的表示方法和人工智能用于驾驶场景安全评估与自动驾驶规划

Ross Greer, Maitrayee Keskar, Angel Martinez-Sanchez, Parthib Roy, Shashank Shriram, Mohan Trivedi

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉-语言表示在自动驾驶安全评估和规划中的应用,提出轻量级危险检测、轨迹规划框架整合及自然语言约束方法,强调表示-任务对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13666 2026-02-17 cs.LG cs.AI 81%

ALMo: Interactive Aim-Limit-Defined, Multi-Objective System for Personalized High-Dose-Rate Brachytherapy Treatment Planning and Visualization for Cervical Cancer

ALMo:交互式目标-限制定义的多目标系统,用于宫颈癌高剂量率近距离治疗计划与可视化

Edward Chen, Natalie Dullerud, Pang Wei Koh, Thomas Niedermayr, Elizabeth Kidd, Sanmi Koyejo, Carlos Guestrin

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) Stanford University School of Medicine(斯坦福大学医学院) Paul G. Allen School of Computer Science & Engineering(保罗·G·艾伦计算机科学与工程学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 ALMo是一种用于宫颈癌高剂量率近距离治疗的交互式多目标系统,通过自动化参数设置和直观的剂量学权衡控制,提高治疗计划质量和效率。

Comments Abstract accepted at Symposium on Artificial Intelligence in Learning Health Systems (SAIL) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13616 2026-02-17 cs.AI cs.LG 81%

DiffusionRollout: Uncertainty-Aware Rollout Planning in Long-Horizon PDE Solving

DiffusionRollout:长时间尺度PDE求解中的不确定性感知 rollout 计划

Seungwoo Yoo, Juil Koo, Daehyeon Choi, Minhyuk Sung

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 DiffusionRollout通过自适应选择步长策略,提升长时间尺度PDE求解的预测可靠性与准确性。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12143 2026-02-13 cs.AI cs.LG 81%

STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction

STAR:连接统计推理与代理推理以提升大模型性能预测

Xiaoxiao Wang, Chunxiao Li, Junying Wang, Yijin Guo, Zijian Chen, Chunyi Li, Xiaohong Liu, Zicheng Zhang, Guangtao Zhai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 STAR框架通过结合统计推理与代理推理,有效提升大模型性能预测的准确性与可靠性,尤其在数据稀疏情况下表现突出。

Comments 10 pages, 8 figures, 17 tables. Code available at https://github.com/xiaoxiaostudy/star

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11882 2026-02-13 cs.LG cs.AI cs.CV cs.RO 81%

Where Bits Matter in World Model Planning: A Paired Mixed-Bit Study for Efficient Spatial Reasoning

位在世界模型规划中的作用:一种混合位研究以实现高效的空问推理

Suraj Ranganath, Anish Patnaik, Vaishak Menon

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过混合位方法探讨位分配对世界模型规划的影响,发现不同比特分配策略在空间推理中的表现差异显著,提出模块意识和预算意识的量化策略作为未来研究方向。

Comments Workshop submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11220 2026-02-13 cs.LG cs.CL 81%

Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT

修补分布不匹配:用于稳定离策略SFT的RL重写代理

Jiacheng Wang, Ping Jian, Zhen Yang, Zirong Chen, Keren Liao, Zhongbin Guo

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于强化学习的RL重写代理,通过优化分布对齐和多样性,提升下游SFT效果并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏