arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 408 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 78 篇

2608.25431 2026-08-27 cs.CR 新提交 89%

Here is a GIFT: Enforcing User Data Isolation in LLM Serving via GPU Information Flow Tracking

GIFT:通过GPU信息流跟踪在LLM服务中强制实现用户数据隔离

Jiacheng Shi, Xunjie Wang, Cheng Tan, Jinyu Gu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出GIFT(GPU信息流跟踪系统),通过按用户加密、静态流分析等技术在LLM服务中实现用户数据隔离,扩展版GIFT-CC集成机密计算,在vLLM等框架上仅产生4-10.7%吞吐量开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14069 2026-08-27 cs.AI 版本更新 89%

RADAR: Accelerate Large Language Model Inference With RL-Based Dynamic Draft Trees

RADAR: 通过基于强化学习的动态草稿树加速大语言模型推理

Junjie Ma, Jinlong Li, Jiajun Luo

机构 * School of Computer Science(计算机科学学院) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 RADAR通过基于强化学习的动态草稿树方法,有效提升大语言模型推理速度,实现3.17至4.82倍的加速效果。

Comments EMNLP 2026 Findings Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00282 2026-08-27 cs.CL cs.AI cs.LG 版本更新 89%

Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations

大语言模型还能自我解释吗?探讨量化对自我解释的影响

Qianli Wang, Nils Feldhus, Pepa Atanasova, Fedor Splitt, Simon Ostermann, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) University of Copenhagen(哥本哈根大学) Saarland Informatics Campus(萨尔州信息学校园) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨量化对大语言模型自我解释质量及可信度的影响,发现量化会导致中等程度的下降,但不影响其作为压缩技术的有效性。

Comments EMNLP 2026 Findings; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25761 2026-08-27 cs.CL cs.AI 新提交 88%

Beam Search, Self-Consistency, and the Limits of Inference-Time Scaling for Grammar-Constrained Text-to-SQL in Small Language Models

束搜索、自一致性以及小语言模型中语法约束下文本到SQL任务推理时间缩放的局限性

Ty Chermsirivatana, John MacCormick

机构 * Deep Network Understanding Lab(深度网络理解实验室) Dickinson College(狄金森学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对语法约束下的小语言模型文本到SQL任务,研究了模型规模与推理计算的权衡,发现受约束权衡表现不同,束搜索优于采样+投票,且增大模型规模比增加推理计算更有利。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24637 2026-08-27 cs.AR 版本更新 88%

Thermal Tuning Overhead in Wafer-Scale Optical Interconnects for LLM MoE Training: A Cross-Layer Analysis and Ferroelectric-Based Mitigation

面向大语言模型混合专家(MoE)训练的晶圆级光互连中的热调谐开销:跨层分析与基于铁电材料的缓解方案

Seongwon Yoon, Pin-Jun Chen, Shimeng Yu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对LLM MoE训练的晶圆级光互连,通过跨层分析发现热波动会引发调谐停滞,采用铁电电光调谐机制消除停滞,使三款MoE模型获2.7-3.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24662 2026-08-27 cs.AI cs.CL cs.CY 版本更新 88%

The Invisible Editorial Layer: Formalizing Undisclosed Inference-Time Steering, Probability Placement, and the Attribution Problem in Deployed Language Models

隐形编辑层:形式化部署语言模型中未公开的推理时调控、概率置放与归因问题

Augusto Camargo

机构 * Bluecore Consulting(蓝芯咨询)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);post-training(abstract);prompting(abstract)

AI总结 本文针对部署语言模型提出隐形编辑层概念,形式化推理归因问题、概率置放等核心概念,探讨其与相关监管框架的关联,揭示未公开推理调控的潜在影响。

Comments Substantially revised version with a formal non-identifiability result for the Inference Attribution Problem, expanded related work, and extended analysis of Probability Placement, auditing, and runtime transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14684 2026-08-27 cs.LG cs.AI 版本更新 88%

Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation

通过策略内自蒸馏缓解大语言模型评审员中的评分标准干扰

Dingyao Yu, Tong Zhang, Yutao Mou, Yunxiao Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Weixin Al, Tencent Inc(腾讯公司微信智能)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本研究针对LLM评审员多评分标准评估时的干扰问题,提出SARA方法,通过策略内自蒸馏提升评估一致性,且该一致性可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25062 2026-08-27 cs.AR cs.AI cs.DC 新提交 87%

FLINT: Efficiently Leveraging High Bandwidth Flash for Capacity-Scalable LLM Inference Acceleration

FLINT:高效利用高带宽闪存实现容量可扩展的大语言模型推理加速

Geraldo F. Oliveira, Arash Tavakkol, Xiangyu Zhu, Ahmet Caner Yüzügüler, Vamanan Arulchelvan, Lukas Cavigelli, Renzo Andri, Mohammad Sadrosadati, Jia Xinglei, Onur Mutlu, Zhou Ke, Shai Bergman, Ji Zhang

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 FLINT是一种工作负载驱动型HBF载体,通过三种机制解决现有HBF方案的三大挑战,实现高效利用HBF加速容量可扩展的LLM推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25188 2026-08-27 cs.LG cs.IT math.IT 新提交 87%

Transforms for LLM Quantization: The Great Inversion and Format Co-Design

大语言模型量化的变换:大逆变换与格式协同设计

Ehsan Jokar

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 本研究针对LLM量化的变换阶段,提出大逆变换原则,分析变换与数字格式的协同设计,综述200项研究分类43种变换方法,提炼部署指南并指出开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24957 2026-08-27 cs.CR cs.SE 新提交 87%

ToolMinimize: Auditing and Rewriting LLM Agent Tool Calls to Minimize Privacy Exposure

ToolMinimize:审计与重写大语言模型智能体的工具调用以最小化隐私暴露

Wenbiao Li, Yuqiao Xu

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 ToolMinimize是一款中间件,通过拦截并重写LLM智能体的工具调用参数,结合schema感知分析与四种操作,在保证100%任务有效性的同时大幅降低隐私暴露,可选层可进一步提升效果,延迟极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25977 2026-08-27 cs.CL 新提交 86%

When Personality Meets Quantization: A Layer-wise MBTI Analysis of Quantized LLMs

当人格遇见量化:量化大语言模型的分层MBTI分析

Yao Fu, Lijia Huang, Xiaomin Li, Runchao Li, Yu Yin, Kenneth A. Loparo

机构 * Case Western Reserve University(凯斯西储大学) Northeastern University(东北大学) Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究对跨多种精度(含4位、2位方法)的开源LLM进行分层MBTI分析,揭示LLM人格是依赖层的涌现决策过程,量化、解码会影响其人格,为量化LLM行为可靠性提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25336 2026-08-27 cs.CL 新提交 86%

Provenance Before Prose: Claim-Locked Reporting

证据先于文本:声明锁定式报告

Xiao Fan, Jingyuan Li, Hongbin Guo, Yubo Han, Yi Zhang

机构 * Xidian University(西安电子科技大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM生成统计报告时的数值漂移等问题,提出声明锁定式报告协议,在两类报告任务中提升了可复现性,还降低了token使用量与生成延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05158 2026-08-27 cs.CL 版本更新 86%

Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER

只需两次通过:利用LLM进行零样本命名实体识别的高效标记分类

Ahmed Ewais, Ahmed Hashish, Amr Ali

机构 * WitnessAI

专题命中 效率与部署 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出JPT方法,通过两次输入拼接实现双向上下文的标记分类,提升零样本NER性能,比现有方法快20倍,F1得分提升7.9%。

Comments 16 pages, 9 figures, 12 tables. Published in Proceedings of ACL 2026 (Volume 1: Long Papers), pages 11480-11497. Demo and API: https://witness-ai-jpt-ner.hf.space/

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 11480-11497, San Diego, California, United States, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07148 2026-08-27 cs.LG 版本更新 86%

Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing

面向移动边缘计算的任务卸载的多轮推理LLM

Ning Yang, Chuangxin Cheng, Haijun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Machano-Electronic Engineering, Xidian University(西安电子科技大学机电工程学院) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院)

专题命中 效率与部署 :LLM(title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出COMLLM框架,通过整合GRPO与LACS机制,实现移动边缘计算中的前瞻性决策,提升任务卸载效率与负载均衡公平性,支持零样本拓扑扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25661 2026-08-27 cs.SE cs.AI 新提交 81%

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

从通用智能体到RCA专家:一种用于根因分析的自演化框架

Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出自演化RCA框架OpsHarness,复用通用智能体能力,通过双门验证演化,在基准与工业场景中大幅提升RCA准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24588 2026-08-27 cs.LG 版本更新 81%

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents

IAPO:面向多轮服务智能体信用分配的感知影响策略优化

Bo Ren, Yirong Mao, Yi Yang, Wenhui Que

机构 * Fudan University(复旦大学) WeChat, Tencent Inc.(腾讯公司微信业务)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出IAPO方法,将轨迹转化为影响依赖图以优化多轮服务智能体的信用分配,在三个服务智能体基准及BFCL-v4多轮任务上,性能优于多轮RL基线。

Comments 12 pages, 3 figures, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19660 2026-08-27 cs.CR cs.CL 版本更新 81%

A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots

基于RAG的聊天机器人中针对提示注入的分层安全框架

Gulshan Saleem, Nisar Ahmed, Muhammad Imran Zaman, Ali Hassan, Umar Mujahid

机构 * ICCK Transactions on Information Security and Cryptography(信息安全与密码学国际会议交易)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出三层防御框架,通过输入过滤、上下文指令层级和输出审计,将提示注入攻击成功率从71.4%降至11.3%,误报率4.8%,延迟开销61.2毫秒。

Comments Submitted in ICCK Transactions on Information Security and Cryptography

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09586 2026-08-27 cs.AI 版本更新 81%

EvoCurr: Self-evolving Curriculum with Behavior Code Generation for Complex Decision-making

EvoCurr:面向复杂决策的、结合行为代码生成的自演进课程框架

Yang Cheng, Weiyu Ma, Zilai Wang, Wenhui Zhu, Tangjie Lv, Yujing Hu, Mohamed Elhoseiny, Yue Deng, Jian Zhao

机构 * Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出EvoCurr这一推理时框架,协同演进课程与可执行策略,在《星际争霸II》等任务上实现高胜率,且具有通用性,无需训练LLM参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26049 2026-08-27 cs.CR cs.AR 新提交 80%

RTLGuard: A Lightweight Teacher-Student Defense for Poisoned RTL Code Generation Models

RTLGuard:一种针对中毒RTL代码生成模型的轻量级师生防御方法

Mahshid Rezakhani, Kimia Azar, Hadi Kamali

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 RTLGuard是一种轻量级师生防御方法,通过小规模干净教师模型、复合师生目标及特征对齐等,降低中毒RTL代码生成模型的攻击成功率,同时保留代码功能正确性与可综合性。

Comments 8 pages, 4 figures, 7 tables. Accepted at the IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25332 2026-08-27 cs.CV 新提交 80%

Not All Attention Heads Contribute to Critical Visual Token Selection: Head-Aware Pruning Matters More

并非所有注意力头都有助于关键视觉标记选择:头感知剪枝更重要

Chaofang Ma, Lin Jiang, Carol Jingyi Li, Xingyu Liu, Zeyu Li, Jiang Xu, Wei Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对视觉-语言模型推理效率问题,提出无需训练的渐进式视觉标记剪枝框架ProViP,利用关键注意力头提升剪枝效果,在LLaVA-1.5-7B上实现高剪枝率下的性能保留与推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22932 2026-08-27 eess.SP 版本更新 80%

AirMoE: Realizing Over-the-Air Distributed Mixture-of-Experts Inference at the Wireless Edge

AirMoE:在无线边缘实现无线分布式混合专家(Mixture-of-Experts,MoE)推理

Huiling Yang, Zhanwei Wang, Kaibin Huang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 AirMoE是利用AirComp实现无线分布式MoE推理的框架,通过双时间尺度策略解决AirComp带来的挑战,在ARC-Easy基准上显著提升了E2E推理准确性,尤其适用于强设备异构场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25855 2026-08-27 cs.CE cs.AI 新提交 79%

Unlocking Multimodal Protein Language Models at Inference Time

在推理阶段解锁多模态蛋白质语言模型

Yi Zhou, Qipeng Wang, Yunqing Liu, Jun Xia, Qing Li, Wenqi Fan

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文建立三阶段研究框架,在不更新多模态蛋白质语言模型参数的前提下,通过优化推理阶段采样策略,揭示默认推理协议的次优性并提升其任务性能,得出与现有共识不同的基础模型相关结论。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25375 2026-08-27 cs.CY cs.CL cs.CV 新提交 79%

GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models

GGSS:用于生成式视觉语言模型推理时去偏的测地线门控球面引导

Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本研究提出GGSS方法,针对生成式VLMs设计推理时去偏方案,经实验验证其在降低人口统计学偏见的同时,能较好保留模型通用视觉语言能力。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-08-27 cs.CR cs.AI cs.CV 版本更新 79%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 17 pages; Previously this version appeared as arXiv:2510.15430 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交 78%

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25485 2026-08-27 cs.CV 新提交 78%

Semi-Supervised Adaptation of Vision-Language Models for Image Classification

面向图像分类的视觉-语言模型半监督适配

Mohamed L. Mekhalfi, Mohamad M. Al Rahhal, Yakoub Bazi, Salah E. Khenfer, Mingdeng Shi, Hua Zou, Mansour Zuair

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) King Saud University(沙特国王大学) Tarim University(塔里木大学) Wuhan University(武汉大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本研究针对视觉-语言模型适配遥感卫星图像时标注样本匮乏的问题,提出SE-CLIP半监督框架,通过双阶段流程与类平衡选择策略提升性能,在UCM、NWPU基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25990 2026-08-27 cs.LG 新提交 77%

Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon

频谱分配:为何Muon优于Adam,以及如何改进Muon

Xiaodong Wu, Wenyi Yu, Chao Zhang, Philip Woodland

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文通过频谱分析揭示Muon优于Adam的机制,提出SAMuon及其简化版SAMuon-lite,在多规模modded-nanogpt模型上,二者均优于AdamW和Muon,且SAMuon可减少13.3%-24.0%训练令牌。

Comments 34 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18098 2026-08-27 cs.CL 版本更新 77%

VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval

VDAR-Router:通过语言化查询难度分析检索实现自适应语言模型路由

Yu-Chien Tang, Jun-Chen Hung, Wen-Chih Peng, An-Zi Yen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对大语言模型路由中忽视查询潜在难度问题,提出VDAR-Router框架,通过生成难度分析、检索相似示例来估计模型适用性,经实验验证该方法能实现更好成本性能权衡,明确查询分析有助于做出更可靠路由决策。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-08-27 cs.LG cs.AI cs.CL 新提交 75%

Learning Mixtures of Plackett-Luce Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

专题命中 效率与部署 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21946 2026-08-27 cs.CL cs.AI cs.LG 版本更新 75%

EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning

EDGE:智能体强化学习中引导探索的经验蒸馏方法

Can Xie, Yuyi Zhou, Wen Yang, Ziyi zhang, Siyao Song, Yingzhuo Deng, Shuo Ren, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EDGE框架,将检索的经验内化到策略中,在ALFWorld和WebShop数据集7B规模下较GRPO提升8.3、12.5个成功率百分点,移除外部经验后仍保留96.0%支架性能。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏