arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 706 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 30 篇

2604.24357 2026-08-25 cs.LG cs.AI 版本更新 81%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Discrete Diffusion Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Si Wu, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

Comments Extended Version of ICML 2026 Fogen (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23020 2026-08-25 cs.CL cs.AI 新提交 79%

Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality

遗忘学习不只是擦除:通过生成不平等实现时间解耦

Xunlei Chen, Qirui Ye, Yuang Li, Yi Gong, Zhaokun Wang, Wenyi Li, Shiyao Guo, Jinyu Guo

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型遗忘学习的挑战,提出基于训练的细粒度框架ADU,通过解耦上下文注意力路径实现精准遗忘,在TOFU和WMDP基准上表现最优,同时保留高模型效用并减少副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21864 2026-08-25 cs.LG cs.AI cs.CV 新提交 79%

BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications

BioMed-Agent-RL:元学习,生物医学应用的一切所需

Md Asaduzzaman Jabin, Zihao Wu, Tianming Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对临床视觉大语言模型的缺陷,提出BioMed-Agent-RL医学智能体,整合多模态元学习与强化学习等技术,在多基准实验中准确率达约73%,较现有模型提升约5%,为临床智能体系统建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12969 2026-08-25 cs.LG cs.AI 版本更新 79%

Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

从对比视角重新审视基于可验证奖励的强化学习

Feng Zhang, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Beijing Institute of Technology(北京理工大学) Qwen Business Unit of Alibaba(阿里巴巴Qwen业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ConSPO方法,通过对比序列级策略优化,解决GRPO在目标函数上的似然错配和信用分配不敏感问题,在推理任务上超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21595 2026-08-25 cs.CV 新提交 78%

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

扰动思路而非像素:用于视觉语言模型强化学习的潜在空间展开多样化

Michael Jerge, Joseph Pelczar, Justin Downes

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 该研究提出 NC-GRPO 方法,通过在 VLM 潜在空间注入噪声实现展开多样化,提升了其数学推理与幻觉鲁棒性,且仅需少量代码修改即可整合进 RLVR 流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-08-25 cs.CL 版本更新 77%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23566 2026-08-25 cs.LG cs.AI cs.CL 新提交 75%

How to Train a Critic Stably and Efficiently

如何稳定且高效地训练评价模型

Penghui Qi, Xiangxin Zhou, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学) Tencent Hunyuan(腾讯混元)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22772 2026-08-25 cs.CL 新提交 74%

SPOC-SQL: Stage-wise Preference Optimization for Controllable Text-to-SQL

SPOC-SQL:用于可控文本到SQL的分阶段偏好优化

Yingnan Chen, Chun Ding, Tianshi Xu, Xu Yang, Si Wu

机构 * South China University of Technology(华南理工大学)

专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.CL

AI总结 该研究针对现有文本到SQL方法缺乏关键决策反馈和中间过程控制的问题,提出SPOC-SQL,通过分阶段偏好优化与结构化分解策略实现可控SQL生成,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21898 2026-08-25 cs.AI 新提交 70%

Training Needs Trustworthy Worlds: Verified Synthetic Web Environments for Agent Learning

训练需要可信的世界:用于智能体学习的经过验证的合成Web环境

Chenghao Zhang, Canran Xiao, SaiSai Hu, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Pace University(佩斯大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究构建可执行、可审计的合成Web环境,修复缺陷后用于训练Web智能体,提升了可行任务率与PPO策略性能,增强了向多个基准的迁移能力,为智能体学习提供了可靠训练基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21830 2026-08-25 cs.AI 新提交 70%

Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents

超越成功与失败:面向GUI智能体的长度感知对比学习

Chengyang Gu, Le Zhang, Jingbo Zhou, Yize Chen, Yu Shi, Siqi Bao, Zheng-Fan Wu, Hua Wu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Baidu Inc.(百度公司) University of Alberta(阿尔伯塔大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对GUI智能体现有对比RLVR方法无法捕获轨迹细粒度质量差异的问题,提出LACL-GUI框架,引入轨迹级质量信号,在基准测试中实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01160 2026-08-25 cs.AI 版本更新 70%

Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification

形式数学验证中生成式奖励建模的期望值对齐

Shihao Ji, Haotao Tan, Zihui Song, Mingyu Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出期望值对齐(EVA)方法,通过从模型词元分布中提取连续分数,在保持生成式奖励模型离散输出的同时实现连续评分,用于Lean 4形式验证。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16615 2026-08-25 cs.LG 版本更新 70%

Learning What Evaluators Value: A Reliable Approach to Modeling Evaluator Preferences

学习评估者所重视的内容:一种可靠建模评估者偏好的方法

Madeline Celi Kitch, Nihar B. Shah

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了如何学习评估者偏好,提出了一种鲁棒算法,能够在模型不匹配的情况下有效学习偏好,通过合成数据和实际数据验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19417 2026-08-25 cs.HC 版本更新 67%

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

MER 2026:从判别性情感识别到生成性情感理解

Zheng Lian, Xiaojiang Peng, Kele Xu, Ziyu Jia, Xinyi Che, Kuofei Fang, Zebang Cheng, Fei Ma, Laizhong Cui, Yazhou Zhang, Xin Liu, Liang Yang, Jia Li, Fan Zhang, Liumeng Xue, Erik Cambria, Guoying Zhao, Bjorn W. Schuller, Jianhua Tao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21919 2026-08-25 cs.LG 新提交 57%

Beyond Fixed Directions: Adaptive Representation Analysis of Reasoning and Memorization in LLMs

超越固定方向:大语言模型中推理与记忆的自适应表示分析

Shaheen Nabi

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 该研究以Qwen3-0.6B为对象,通过实验验证了推理与记忆可通过单一方向分离,但经GRPO后该方向几何结构显著重组,不过任务组的AUROC仍保持1.00,挑战了固定方向稳定性的假设。

Comments Preprint. Code and experimental resources are available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-25 cs.LG cs.CV 版本更新 57%

Continuous Adversarial MeanFlow Transfer

连续对抗平均流迁移

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本研究提出MeanFlow-Transfer与Continuous Adversarial MeanFlow,解决有限数据下新域生成器训练的适配与加速问题,在四个源模型适配五个目标域时,FID等指标相当或更优且NFEs最多减125倍,少步FID平均提29%。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18237 2026-08-25 stat.ML cs.LG math.OC 版本更新 57%

Sobolev Regularized Score Difference Estimation in Diffusion Models

扩散模型中的Sobolev正则化得分差估计

Chenghan Xie, Jose Blanchet, Renyuan Xu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文针对扩散模型得分差估计存在的统计一致性或可扩展性问题,提出Sobolev正则化的一致可扩展估计器,在小样本场景稳定性提升,真实任务性能优于非正则化方法。

Comments Accpeted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16473 2026-08-25 cs.LG cs.NA math.NA 版本更新 57%

Reference-free logged energy-oracle recovery for neural approximations of symmetric coercive variational problems: conforming Riesz reconstruction and archive-level selection

对称强制变分问题神经近似的无参考记录能量-神谕恢复:符合里泽重构与存档级选择

Karim Bounja, Lahcen Laayouni, Boujemaa Achchab, Abdeljalil Sakat

机构 * Laboratory for Analysis and Modeling of Systems and Decision Support (LAMSAD), Hassan 1st University of Settat(塞塔特哈桑一世大学系统与决策支持分析建模实验室) Al Akhawayn University in Ifrane(伊夫兰阿赫拉万大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对对称强制变分问题的神经近似,提出无参考的记录能量神谕恢复准则,通过符合里泽监测器实现存档级选择,在扩散、弹性等问题上验证了其有效性。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19514 2026-08-25 cs.LG 版本更新 57%

Do Sheaf Neural Networks Use Holonomy? A Measure--Intervene--Control Study

层神经网络是否使用和乐性?一项测量-干预-控制研究

Ankit Grover, Rémi Bourgerie

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 以层神经网络为测试平台,对训练后的三角循环积进行与基无关测量,通过神经层传播等方法区分几何变化等,在不同实验设置下观察其效果,研究层神经网络是否使用和乐性及相关特性。

Comments Accepted as an extended abstract at Geometric Intelligence @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13095 2026-08-25 cs.CV cs.LG 版本更新 57%

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

ADHint: 基于难度先验的自适应提示用于强化学习

Feng Zhang, Zezhong Tan, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 ADHint通过整合难度先验,改进强化学习中的探索与模仿平衡,提升推理能力和分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23549 2026-08-25 cs.CV 新提交 50%

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

FixAnything:基于视频生成先验的3D一致性渲染优化

Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。

Comments Appearing in ECCV 2026. Project page: https://fix-anything.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-25 eess.SY cs.SY 版本更新 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新 50%

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 37 篇

2605.26851 2026-08-25 cs.SE 版本更新 91%

LLM-based Low-Level Integration Test Generation for Java

基于LLM的Java无模拟单元测试生成

Qinghua Xu, Guancheng Wang, Lionel Briand, Zhaoqiang Guo, Kui Liu

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出MocklessTester方法,通过上下文增强生成和约束强制修复解决LLM生成无模拟单元测试时的幻觉问题,在Defects4J和Deps4J上显著提升覆盖率和变异得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17021 2026-08-25 cs.LG cs.CL 版本更新 90%

Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning

遗忘的遗忘:注意力汇作为大语言模型遗忘后门的网关

Bingqi Shang, Yiwei Chen, Yihua Zhang, Bingquan Shen, Sijia Liu

机构 * Michigan State University(密歇根州立大学) National University of Singapore(新加坡国立大学) IBM Research(IBM研究院)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM遗忘过程,提出利用注意力汇作为网关的后门攻击方法,可使模型在无触发器时正常遗忘,有触发器时恢复被遗忘知识,经实验验证有效。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22339 2026-08-25 cs.CL 新提交 90%

When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents

何时不应模仿:面向可靠工具使用大语言模型智能体的边界感知技能记忆

Zihan Lin, Zhenyu Chen, Jiawen Wei, Xiaohan Wang, Jie Cao, Jiajun Chai, Wei Lin, Guojun Yin, Ran He

机构 * Meituan(美团) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM智能体仅从成功轨迹提取技能会陷入「技能模仿陷阱」的问题,提出边界感知技能记忆(BASM),通过补充边界字段提升工具使用可靠性,在多基准测试中显著优于基线方法。

Comments Accepted by EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21867 2026-08-25 cs.AI cs.CL 新提交 88%

MemGuard: Persisting Verifier Signals for LLM-Agent Memory Governance

MemGuard:为大语言模型智能体记忆治理保留验证器信号

Haoyu Wang, Guangyuan Dong, He Liang, Zijing Zhang, Jiachen Luo, Chuang Liu, Chao Xue, Hao Tang

机构 * Nankai University(南开大学) National University of Singapore(新加坡国立大学) Shanghai Institute of Optics and Fine Mechanics, Chinese Academy of Sciences(中国科学院上海光学精密机械研究所) Peking University(北京大学) Technical University of Munich(慕尼黑工业大学) Queen Mary University of London(伦敦大学玛丽女王学院) Wuhan University(武汉大学) University of New South Wales(新南威尔士大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 针对LLM智能体记忆的不可靠准入与漂移问题,提出MemGuard方法,通过保留验证器的生命周期元数据提升多任务基准的成功指标与效率,效果优于现有基线。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23471 2026-08-25 cs.CR cs.AI 新提交 87%

InjecMEM: Memory Injection Attack on LLM Agent Memory Systems

InjecMEM:针对大语言模型智能体记忆系统的内存注入攻击

Hanling Tian, Gengyu Zhang, Zeyang Sha, Jingying Wang, Yuhang Liu, Zhehao Huang, Kun Yang, Xiaolin Huang

专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究提出InjecMEM内存注入攻击,无需访问LLM智能体内存存储,通过特定锚点与对抗性命令引导后续查询输出,在多模型上验证了其有效性,为智能体内存安全研究提供了可复现框架。

Comments 29 pages, 3 figures. Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22852 2026-08-25 cs.AI cs.CL q-fin.GN 新提交 87%

Your AI, On a Dial: Controlling Investment Bias in LLMs with a Single Neuron

你的AI,可调节的旋钮:用单个神经元控制大语言模型的投资偏差

Sahong Park, Suhwan Park, Hoyoung Lee, Gakyung Kwon, Wonbin Ahn, Jaewon Choi, Alejandro Lopez-Lira, Yoon Kim, Chanyeol Choi, Hyeongwoo Kong, Yongjae Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) UNIST(蔚山科学技术院) LG AI Research(LG AI研究院) Hanwha Life(韩华生命保险) University of Florida(佛罗里达大学) Massachusetts Institute of Technology(麻省理工学院) LinqAlpha

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出投资偏差旋钮这一推理时单个神经元干预方法,可在不修改提示或参数的情况下,稳定校准LLM的整体投资立场,且适用于不同场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10488 2026-08-25 cs.CL cs.AI 版本更新 87%

DeepRefine: Agentic Knowledge Refinement via Reinforcement Learning

DeepRefine: 通过强化学习进行代理编译知识的精炼

Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Huihao Jing, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song

机构 * HKUST(香港科技大学) HKBU(香港大学) Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22767 2026-08-25 cs.AI 新提交 86%

The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory

检索器应当记忆:面向智能体长期记忆的经验摊销重排序

Qi Feng, Chris Ding, Jicong Fan

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长期语言模型智能体检索器不积累经验的问题,提出EARM框架,结合观测与估计评分重排序,提升答案准确率并降低LLM重排序推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏