arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7434 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 2137 篇

2608.06735 2026-08-10 cs.AI cs.CL 新提交 62%

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

IB-RL:用于策略性对话智能体的孤立双边强化学习

Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对现有RL训练范式的静态对应智能体不匹配问题,提出IB-RL方法,在Vehicle TeleSales和Deal-or-NoDeal任务上较单边RL基线显著提升了策略对未见过对应智能体的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05806 2026-08-07 cs.CL cs.AI 新提交 62%

Hierarchical Latent Prediction for Language Models

语言模型的分层隐式预测

Chang Shi, Tim Pearce, Manan Tomar, Siddhartha Sen, John Langford

机构 * University of Texas at Austin(得克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对语言模型下一个token预测的误差累积问题,提出分层隐式预测方法,在编码、多步推理基准及推测解码上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05446 2026-08-07 cs.LG cs.CL 新提交 62%

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

EvoHarness-RL:为长视野大语言模型智能体学习自进化运行时管控器

Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI

专题命中 规划决策 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出 EvoHarness-RL 方法,通过学习管控器策略解决长视野 LLM 智能体的外部状态管理问题,在 ALFWorld 上达到 96.9% 的任务成功率,验证了可训练管控器策略的有效性。

Comments Accepted to LLA@COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05313 2026-08-07 cs.RO cs.AI cs.HC cs.LG 新提交 62%

Failing Gracefully: Mitigating Impact of Inevitable Robot Failures

优雅降级:缓解机器人不可避免故障的影响

Duc M. Nguyen, Saad A. Ghani, Andrew Marshall, Allison Andreyev, Gregory J. Stein, Xuesu Xiao

机构 * George Mason University(乔治梅森大学) RobotiXX Lab(RobotiXX实验室)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对家庭服务机器人不可避免的故障,本文提出一种评估故障影响概率与严重程度的安全公式,结合FailBench模拟框架,为开发更安全的机器人运动规划及学习策略提供基础。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04964 2026-08-06 cs.AI cs.LG 新提交 62%

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

WorldCycle:用于长时序视频世界模型的自验证强化学习

Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对交互式视频世界模型的误差累积问题,提出自验证RL框架WorldCycle,利用可逆动作循环实现无标注监督,在CycleBench基准上大幅降低状态返回漂移并提升复合动作准确率。

Comments https://nevsnev.github.io/Worldcycle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04037 2026-08-06 cs.CL cs.AI cs.GR cs.HC 新提交 62%

Reconstructing Persistent Worlds from Narratives for Narrative-Grounded Interactive Experiences

从叙事中重建持久世界以实现基于叙事的交互体验

Yi-Chun Chen

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出从叙事中重建显式持久世界的核心方法,开发原型实现可游玩环境,为AI辅助游戏创作等提供语义基础,验证了其可行性与应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04007 2026-08-05 cs.CL cs.AI 新提交 62%

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:面向工具集成推理的回合级事后自蒸馏方法

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03087 2026-08-05 cs.LG cs.AI 新提交 62%

SynEnergy: Anomaly Semantic-Guided Diffusion for Synthetic Energy Data Generation

SynEnergy:面向合成能源数据生成的异常语义引导扩散模型

Lin Jiang, Dahai Yu, Ravikumar Gelli, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SynEnergy,一种两阶段扩散框架,通过HG-ASL提取异常语义、AS-Diff生成数据,在四个真实能源数据集上较11种基线提升异常保留与下游质量,可扩展至城市级场景。

Comments 24 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02826 2026-08-05 quant-ph cs.AI cs.LG stat.ML 新提交 62%

Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model

生成模型下强化学习的改进量子算法

Joao F. Doriguello

机构 * HUN-REN Alfréd Rényi Institute of Mathematics(HUN-REN 阿尔弗雷德·雷尼数学研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对两类马尔可夫决策过程,提出结合值迭代与量子子例程的新型量子强化学习算法,其查询复杂度优于现有成果,接近量子下界。

Comments 22 pages. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02343 2026-08-04 cs.AI cs.LG 新提交 62%

Hard Constraints, Smooth Gradients: Learning Feasible Inventory Policies via Differentiable Projection

硬约束、平滑梯度:通过可微投影学习可行库存策略

Patrick Helm, Jan-Niklas Doerr, Joren Gijsbrechts, Stefan Minner

机构 * TUM School of Management, Technical University of Munich(慕尼黑工业大学TUM管理学院) Esade, Ramon Llull University(拉蒙·柳利大学ESADE商学院) Munich Data Science Institute (MDSI), Technical University of Munich(慕尼黑工业大学慕尼黑数据科学研究所)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出嵌入可微凸优化模块的DRL策略,以处理序列决策中的硬约束,在库存规划等场景中实现了优于基准方法的成本降低与最优性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02267 2026-08-04 cs.AI cs.LG 新提交 62%

Self-Certification of Representation Adequacy: Sequential Certification at Minimum Task Loss

表示充分性的自认证:最小任务损失下的序列认证

Zijie Huang

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对智能体历史压缩表示的混叠风险,提出四层自认证理论,构建序列认证策略并证明其成本渐近匹配下界,为表示充分性的认证提供了理论框架。

Comments 108 pages, 3 figures. Full proofs and appendices included. Independent researcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01604 2026-08-04 cs.AI cs.SE 新提交 62%

Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer

在办公工作上进行后训练可提升软件工程能力:跨域迁移的行为视角

Logan Ritchie, Sushant Mehta, Liudas Panavas, Edwin Chen

机构 * Surge AI

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究通过在办公工作流程的长程多工具智能体任务上后训练Qwen3.5-122B-A10B,发现模型在无相关训练的软件工程基准SWE-Bench Pro上性能提升,证实长程后训练可跨域强化目标导向执行行为。

Comments 20 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 62%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00175 2026-08-04 cs.LG cs.AI 新提交 62%

Inference-Time Policy Alignment for Fair Reinforcement Learning

用于公平强化学习的推理时策略对齐

Umer Siddique, Peilang Li, Conor Wallace, Yongcan Cao

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出乘法策略塑造框架,在不更新预训练RL策略参数的情况下,于推理时提升公平性,同时保留核心任务性能,适用于各类深度RL智能体。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 13 pages main + appendix, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29617 2026-08-03 cs.LG cs.AI stat.ML 新提交 62%

When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning

基于值函数的模仿学习中,何时在线交互是有帮助的?表示权衡研究

Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J. Foster

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对基于值函数的模仿学习,提出交互式在线算法OVI,发现专家交互可降低学习者的表示要求,且OVI在多数场景下性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28488 2026-07-31 cs.AI cs.LG 新提交 62%

SCOPE: Supply-Chain Operations through Coupled Policies for End-to-End Coordination

SCOPE:基于耦合策略的端到端协调供应链运营

Yunhao Liang, Xianqi Cao, Pujun Zhang, Yuan Qu, Yongzhi Qi, Ningxuan Kang, Max Z. J. Shen

机构 * Dingdong(叮咚)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SCOPE是将供应链实体建模为token的复合策略模型,在生鲜零售补货数据上验证了其比分阶段优化及传统基线更优的端到端供应链决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28415 2026-07-31 cs.LG cs.AI cs.CV cs.MM cs.RO 新提交 62%

QQWorld: Quantile-Quantile Matching for World Model Regularization

QQWorld:用于世界模型正则化的分位数-分位数匹配

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对潜在世界模型正则化中EP目标函数对尾部样本校正梯度不足的问题,提出QQWorld方法,通过分位数-分位数匹配目标函数及跨批次QQ技术,提升了LeWM在四个控制环境中的规划成功率与高斯对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27973 2026-07-31 cs.LG cs.AI 新提交 62%

TAPO: Transition-Aware Policy Optimization for LLM Agents

TAPO:面向大语言模型智能体的过渡感知策略优化

Cong Li, Peixi Peng, Yisen Zhao, Xinyu Hu, Shudong Liu, Zhan Su, Zhuojian Li

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Pengcheng Laboratory(鹏城实验室)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TAPO框架,通过策略优化与过渡监督交替训练,增强LLM智能体对环境过渡的敏感性,作为轻量即插即用模块,在WebShop和ALFWorld实验中提升任务性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28408 2026-07-31 cs.LG cs.AI math.ST stat.ML stat.TH 新提交 62%

On-Policy and Off-Policy Learning for Large Action Spaces

面向大动作空间的在线策略与离线策略学习

Imad Aouali

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本论文针对大动作空间交互式系统的策略学习挑战,提出meTS、dTS、sDM等结构化贝叶斯方法,解决在线与离线策略学习的关键问题并提供理论保证。

Comments PhD Thesis, 241 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24991 2026-07-29 cs.SE cs.AI 新提交 62%

Preliminary Guidelines for Using and Evaluating GenAI Tools to Support Systematic Literature Reviews

使用和评估生成式人工智能工具以支持系统文献综述的初步指南

Barbara Kitchenham, Sebastián Pizard, Lech Madeyski, Ronnie de Souza Santos, Martin Shepperd, David Budgen

机构 * Keele University(基尔大学) Universidad de la República(共和国大学) Wrocław University of Science and Technology(弗罗茨瓦夫理工大学) University of Calgary(卡尔加里大学) Brunel University of London(伦敦布鲁内尔大学) Durham University(杜伦大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨如何用GenAI支持系统文献综述,通过快速审查、思想实验等方法,识别评估GenAI用于SLRs的问题及过程要点,形成GUEST建议,助研究人员利用GenAI开展可靠综述与评估研究,强调其需人工监督及能提供成本效益帮助。

Comments 58 pages, 2 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24892 2026-07-29 cs.LG cs.AI 新提交 62%

LLM as Forecasting Planner: Training-Free Text Conditioning for Time-Series Foundation Models

大语言模型作为预测规划器:时间序列基础模型的免训练文本条件设定

Huu Hiep Nguyen, Dung Nguyen, Minh Hoang Nguyen, Dai Do, Hung Le

机构 * Deakin University(迪肯大学) Applied Artificial Intelligence Initiative(应用人工智能倡议)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究文本条件时间序列预测问题,核心方法是将预测设为TSFM生成轨迹上的规划问题,以冻结TSFM为模拟器、LLM为策略和价值函数,实例化\rc{}框架,主要贡献是通过实验证明该框架能带来持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22182 2026-07-27 cs.CL cs.AI 新提交 62%

From Isolated Tasks to Structured Capabilities: A Multilayer Taxonomy for Large Language Models

从孤立任务到结构化能力:大语言模型的多层分类法

Shixin Fang, Jiachen Wo, Wenjuan Qin, Sihang Jiang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出大语言模型多层分类法,含14个能力领域和91个子技能,以人类认知科学为指导。通过筛选和映射相关论文,分析研究关注情况,揭示领域及子技能分布,此分类法有助于大语言模型研究组织、评估等多方面工作。

Comments 34 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22153 2026-07-27 cs.AI cs.LG 新提交 62%

Industrial Tokenization for LLM-Based Health Intelligence: A Federated Architecture for Industrial Evidence Integration

基于大语言模型的工业健康智能的工业令牌化:一种用于工业证据集成的联邦架构

Deshui Li, Xiao-Ming Yuan, Zishun Wang

机构 * Mingyang Smart Energy Co., Ltd.(明阳智慧能源集团股份有限公司)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究工业健康管理中异构信息源集成问题,提出工业令牌化概念及联邦架构,将特定源分析输出转为工业令牌,以实现跨源推理。给出基于振动诊断输出等的端到端诊断令牌路径,定位工业令牌化为语义接口。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20459 2026-07-24 cs.CL cs.AI 新提交 62%

THOR: A Theta-Gamma Hierarchical Oscillatory Reasoning Framework for Multi-hop QA

THOR:用于多跳问答的θ-γ分层振荡推理框架

Ziyang Ling, Ronald X. Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 针对多跳问答中注意力衰减和错误积累问题,提出受大脑启发的θ-γ分层振荡推理框架THOR,经实验验证,该框架能提高答案准确性和鲁棒性,减轻相关限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19974 2026-07-23 cs.LG cs.AI 新提交 62%

Time Series Network Utilization KPI Forecasting Using Advanced AI/ML Models

使用先进人工智能/机器学习模型的时间序列网络利用率关键绩效指标预测

Niraj Gadhe, Kirti Bhardwaj, Moulik Jain, Shubhi Sharma, Vinay Saini

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对数据密集型应用等导致的网络性能问题,通过评估季节性分解等多种模型,利用通用接口数据集在MAPE等指标上进行基准测试,给出模型准确性与计算效率权衡的见解,助相关人员选最佳预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19532 2026-07-23 cs.LG cs.AI 新提交 62%

Trustworthy Privacy-Preserving Multimodal Federated Learning for Personalised Breast Cancer Prediction

用于个性化乳腺癌预测的可信隐私保护多模态联邦学习

Ruth Amey, Muhammad Arifur Rahman, Taha Osman, Nicholas Shopland, Andy Burton, Mufti Mahmud, David J. Brown

机构 * NTU(南洋理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨联邦学习能否兼顾四个关键支柱,支持乳腺癌患者肿瘤进展预测模型开发。通过多模态数据评估联邦学习框架,与集中式模型比较性能,并研究相关策略,结果助于理解隐私保护多模态预测建模可行性及支持未来应用。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19270 2026-07-22 cs.LG cs.AI 新提交 62%

GUIDED Network-Agnostic Feature Initialization for Spatial Transferability in GNN-based Models

基于GNN的模型中用于空间可迁移性的引导式网络无关特征初始化

Alessandro Scalese, Santhanakrishnan Narayanan, Constantinos Antoniou

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对交通分配问题中GNN模型空间泛化差的问题,提出网络无关初始化层GUIDED,通过在虚拟链路注入需求标量属性标准化输入空间。实验表明其能提升模型性能、鲁棒性及参数效率,减少训练时间,为相关空间问题提供通用蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19191 2026-07-22 cs.CV cs.AI cs.LG 新提交 62%

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

ABot-World-0:在单台桌面GPU上进行无限交互式世界展开

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 介绍ABot-World-0这一用于实时长视野闭环交互的动作条件视频世界模型,利用多源数据学习世界动态。通过多种技术提炼模型,设计控制界面与部署堆栈,在单台桌面GPU上实现高效视频流传输,实验验证其有竞争力的可控性和世界演变能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18604 2026-07-22 cs.RO cs.AI cs.LG cs.NI cs.SY eess.SY 新提交 62%

Intelligent Multi-UAV Navigation in ITNTNs: A Hierarchical LLM Approach

智能多无人机在综合陆地与非陆地网络中的导航:一种分层大语言模型方法

Zijiang Yan, Hao Zhou, Wael Jaafar, Jianhua Pei, Ping Wang, Halim Yanikomeroglu, Hina Tabassum

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对高速无人机在三维空中高速公路部署中面临的协调问题,提出分层大语言模型驱动控制框架,利用云端大语言模型管理全局负载平衡,边缘大语言模型转化局部观测为子目标,引导深度强化学习控制器执行轨迹,降低碰撞率并提高系统吞吐量。

Comments This paper has been accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18293 2026-07-22 cs.LG cs.CL 新提交 62%

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏

Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 规划决策 :tool use(abstract);分类 cs.CL、cs.LG

AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏