arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2605.16339 2026-05-19 cs.LG 70%

Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders

奖励模型中的偏好不稳定性:通过稀疏自编码器进行检测与缓解

Shunchang Liu, Xin Chen, Belen Martin Urcelay, Francesco Croce

机构 * ETH Zürich(苏黎世联邦理工学院) Georgia Institute of Technology(佐治亚理工学院) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿alto大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型中奖励模型的偏好不稳定性问题,提出通过稀疏自编码器检测并缓解这种不稳定性,通过隔离不稳定特征来提升模型的偏好准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15224 2026-05-18 cs.AI cs.MA 70%

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

ICRL: 通过强化学习学习内化自我批评

Jianbo Lin, Xiaomin Yu, Yi Xin, Yifu Guo, Zhuosong Jiang, Zhongqi Yue, Weishi Wang, Heqing Zou, Chengwei Qin, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) SAP Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ICRL框架,通过联合训练求解器和批评者,使求解器在无外部批评时也能自我改进,提升代理和数学推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15204 2026-05-18 cs.AI 70%

SDOF: Taming the Alignment Tax in Multi-Agent Orchestration with State-Constrained Dispatch

SDOF:通过状态约束调度驯服多智能体编排中的对齐税

Zhantao Wang

机构 * Digital China(数字中国)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 SDOF通过状态约束调度框架,利用强化学习和有限状态自动机提升多智能体任务执行的准确性和可控性,验证了其在招聘系统中的有效性。

Comments 12 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13307 2026-05-14 cs.CL cs.HC 70%

PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users

PRISM-X:基于人类和模拟用户的人个性化微调实验

Hannah Rose Kirk, Liu Leqi, Fanzhi Zeng, Henry Davidson, Bertie Vidgen, Christopher Summerfield, Scott A. Hale

机构 * University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mercor Meedan

专题命中 后训练与偏好优化 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究通过大规模内侧实验评估个性化语言模型在多轮对话中的表现,发现基于偏好微调的P-DPO方法优于通用模型和个性化提示,但个性化数据训练收益有限,且微调会放大趋炎附势行为,可能带来长期负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11679 2026-05-14 cs.AI 70%

Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion

通过偏好维度扩展解释并打破安全与有益性天花板

ShiYing Huang, Liang Lin, Yuer Li, Kaiwen Luo, Zhenhong Zhou, An Zhang, Junhao Dong, Kun Wang, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Chongqing University(重庆大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MORA方法,通过多维奖励整合解决多目标对齐中的安全与有益性矛盾,实验显示在序列对齐中提升5%-12.4%,同时对齐中整体奖励提升4.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00066 2026-05-14 cs.LG 70%

Sharpness-Guided Group Relative Policy Optimization via Probability Shaping

通过概率塑造的锐度引导组相对策略优化

Tue Le, Linh Ngo Van, Trung Le

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GRPO-SG,通过降低可能引起过大梯度的token权重,提升RLVR的泛化能力,实验显示在数学推理、逻辑谜题和工具增强问答中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10797 2026-05-14 cs.LG math.OC stat.ML 70%

Multi-Armed Sampling Problem and the End of Exploration

多臂采样问题与探索的终结

Mohammad Pedramfar, Siamak Ravanbakhsh

机构 * Mila - Quebec AI Institute, McGill University(魁北克AI研究所,麦吉尔大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出多臂采样框架,探讨采样场景下的探索-利用权衡,建立 regret 下界并提出近优算法,表明采样几乎无需探索,通过温度参数统一采样与多臂老虎机问题。

Comments 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09548 2026-05-12 cs.CL 70%

Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

跨语言在线策略自蒸馏用于多语言推理

Yihong Liu, Raoyuan Zhao, Michael A. Hedderich, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出COPSD方法,通过将高资源语言的推理行为迁移到低资源语言,提升多语言推理能力,实验显示其在17种低资源非洲语言上表现优异,优于GRPO。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09291 2026-05-12 cs.LG stat.AP 70%

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

dFlowGRPO:面向离散流模型的速率感知策略优化

Zhengyan Wan, Yidong Ouyang, Panwen Hu, Qiang Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Toronto(多伦多大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出dFlowGRPO框架,用于离散流模型的强化学习,支持多种概率路径和非掩码源分布,通过轨迹概率推导和去噪马尔可夫决策过程,提升文本到图像生成和多模态理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08354 2026-05-12 cs.AI 70%

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

Auto-Rubric as Reward:从隐含偏好到显式多模态生成标准

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li

机构 * Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) UIUC(伊利诺伊大学香槟分校)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Auto-Rubric as Reward框架,通过显式标准分解替代隐含权重优化,提升多模态生成模型对人类偏好的对齐效果,实验证明显式标准能更可靠地实现数据高效对齐。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07545 2026-05-11 cs.CV cs.AI 70%

Implicit Preference Alignment for Human Image Animation

隐式偏好对齐用于人类图像动画

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Tencent Hunyuan(腾讯文脉)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出隐式偏好对齐框架,通过最大化自动生成高质量样本的似然并惩罚与预训练先验的偏差,提升手部生成质量并降低偏好数据构建门槛。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07394 2026-05-11 cs.CV cs.AI 70%

BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning

BalCapRL:一种基于RL的MLLM图像描述的平衡框架

Shaokai Ye, Vasileios Saveris, Yihao Qian, Jiaming Hu, Elmira Amirloo, Peter Grasch

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BalCapRL框架,通过联合优化正确性、参考覆盖和语言质量,解决图像描述中因评价指标狭窄导致的权衡问题,并通过改进的奖励解耦归一化和长度条件奖励遮蔽提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07114 2026-05-11 cs.LG 70%

Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR

在何处分配 rollout:用于基于组的 RLVR 的 hit-utility 优化 rollout 分配

Tao Wang, Shuo Li, Yan Sun, Dongsheng Ding, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出 HORA 方法,通过最大化 hit-utility 提升 RLVR 的效率,实验证明其在多个基准上优于 GRPO,且兼容其他组基估计器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06987 2026-05-11 cs.LG cs.GT econ.TH stat.ML 70%

Response Time Enhances Alignment with Heterogeneous Preferences

响应时间增强异质偏好对齐

Federico Echenique, Alireza Fallah, Baihe Huang, Michael I. Jordan

机构 * Department of Economics, University of California, Berkeley(加州大学伯克利分校经济系) Department of Computer Science and Ken Kennedy Institute, Rice University(休斯敦大学计算机科学系和肯尼迪研究所) Departments of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Departments of Electrical Engineering and Computer Sciences and Statistics, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系和统计学系;巴黎Inria) Inria Paris

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过引入用户响应时间信号来纠正传统偏好数据中对异质偏好的估计偏差,证明该方法能准确识别群体平均偏好,提升大型语言模型对人类偏好的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06200 2026-05-08 cs.CL 70%

A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

A$^2$TGPO: 基于自适应回合裁剪的代理回合策略优化

Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) The Chinese University of Hong Kong(香港中文大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出A$^2$TGPO,通过自适应回合裁剪和改进的归一化与累积方法,解决强化学习中代理大语言模型的回合级信用分配问题,提升多轮交互中单个工具调用的评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05781 2026-05-08 cs.CV cs.AI 70%

Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

通过理解监督引导统一多模态模型的视觉生成

Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手技术团队)

专题命中 后训练与偏好优化 :post-training(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05742 2026-05-08 cs.LG 70%

Weak-to-Strong Generalization is Nearly Inevitable (in Linear Models)

弱到强的泛化几乎是不可避免的(在线性模型中)

Scott Geng, Dutch Hansen, Jerry Li

机构 * University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究显示在线性逻辑回归中,在轻微的数据分布假设下,弱到强泛化现象几乎不可避免,挑战了传统理论中关于模型容量不匹配是关键机制的观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28036 2026-05-01 cs.LG cs.IT math.IT 70%

Exponential families from a single KL identity

从单个KL恒等式出发的指数族

Marc Dymetman

机构 * Scientific Consultant(科学顾问)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过一个简单的指数族KL差恒等式,推导出多项经典结果,包括三点恒等式、I投影定理、对数分区函数的凸性等,无需复杂推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11119 2026-05-01 stat.ML cs.LG 70%

DDO-RM: Distribution-Level Policy Improvement after Reward Learning

DDO-RM:奖励学习后基于分布的策略改进

Tiantian Zhang, Jierui Zuo, Michael Chen, Wenping Wang

机构 * Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学) Department of Management Science and Engineering(管理科学与工程系) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 DDO-RM通过将奖励评分转化为显式目标分布,改进策略在分布层面的性能,实验显示其在准确性与边际均值上优于DPO。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26120 2026-04-30 cs.AI 70%

Hierarchical Multi-Persona Induction from User Behavioral Logs: Learning Evidence-Grounded and Truthful Personas

层级多角色诱导从用户行为日志:学习证据导向且真实的角色

Nayoung Choi, Haeyu Jeong, Changbong Kim, Hongjun Lim, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Naver Corporation(Naver公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);preference optimization(abstract);分类 cs.AI

AI总结 本文提出层级框架,通过聚类和标注用户行为记忆,诱导多个证据支撑的角色,提升角色的连贯性、证据性和可信度,同时提高未来交互预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25832 2026-04-29 cs.AI 70%

TrialCalibre: A Fully Automated Causal Engine for RCT Benchmarking and Observational Trial Calibration

TrialCalibre:一种完全自动化的因果引擎用于RCT基准测试和观察性试验校准

Amir Habibdoust, Xing Song

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TrialCalibre,一种多智能体系统,用于自动化和扩展BenchExCal流程,通过专门的智能体协调整个过程,实现适应性、可审计和透明的因果效应估计。

Comments 5 pages , 2 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025. Copyright 2025 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23380 2026-04-28 cs.LG cs.CV 70%

V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think

V-GRPO:去噪生成模型的在线强化学习比你想象的更容易

Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao, Ludwig Schmidt, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学) Amazon FAR(亚马逊FAR) University of Pennsylvania(宾夕法尼亚大学)

专题命中 后训练与偏好优化 :pretraining(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出V-GRPO方法,通过结合ELBO近似与GRPO算法,实现稳定高效的去噪生成模型在线强化学习,优于传统MDP方法,在文本到图像合成中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03248 2026-04-24 cs.CL 70%

STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning

STReasoner: 通过空间感知强化学习赋能LLMs进行时间序列的时空推理

Juntong Ni, Shiyu Wang, Qi He, Ming Jin, Wei Jin

机构 * Emory University(埃默里大学) Microsoft(微软) Griffith University(格里菲斯大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出STReasoner,通过整合时间序列、图结构和文本,提升LLMs的时空推理能力,采用S-GRPO算法增强空间逻辑,实验显示在低成本下取得显著准确率提升。

Comments ACL 2026 Main, we release our code publicly at https://github.com/LingFengGold/STReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05747 2026-04-22 cs.CL 70%

Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning

通过GRPO微调捕捉经典作者风格在长篇故事生成中的风格

Jinlong Liu, Mohammed Bahja, Venelin Kovatchev, Mark Lee

机构 * School of Computer Science, University of Birmingham, United Kingdom(英国伯明翰大学计算机科学学院)

专题命中 后训练与偏好优化 :preference optimization(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出两阶段流程,通过GRPO微调8B故事生成器,实现基于风格的可控生成,优于开放模型基线。

Comments Accepted to CoNLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18091 2026-04-21 cs.CL cs.CV 70%

Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts

具有文化意识的幽默标题生成:跨文化多模态幽默生成

Run Xu, Lu Li, Rongzhao Zhang, Jie Xu

机构 * Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种多模态幽默生成任务,通过文化意识标题生成模型在不同文化背景下生成幽默标题,改进了文化背景下的图像相关性、语境适配性和幽默质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18003 2026-04-21 cs.AI 70%

SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

SELF-EMO:从识别到一致表达的情感自我进化

Shaowei Zhang, Faqiang Qian, Yan Chen, Ziliang Wang, Kang An, Yong Dai, Mengya Gao, Yichao Wu

机构 * SenseTime Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) X-Humanoid

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SELF-EMO通过引入情感理解和表达辅助任务,结合角色自博弈机制和数据飞轮机制,实现情感识别与表达的自我进化,实验表明其在多个数据集上均取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07160 2026-04-21 cs.CL 70%

GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization

GeometryZero:通过群体对比策略优化推进几何求解

Yikun Wang, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GeometryZero,通过群体对比策略优化训练小型模型,实现高效的几何推理,实验表明其在Geometry3K和MathVista上优于RL基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 70%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08046 2026-04-16 cs.CL 70%

Guaranteeing Knowledge Integration with Joint Decoding for Retrieval-Augmented Generation

通过联合解码实现知识整合的检索增强生成

Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Yuxi Zhang, Huimin Wang, Yutian Zhao, Yefeng Zheng, Binyang Li, Kam-Fai Wong, Xian Wu

机构 * The Chinese University of Hong Kong(香港中文大学) University of International Relations(国际关系大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Westlake University(西湖大学) Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GuarantRAG框架,通过分离推理与证据整合,提升检索增强生成的准确性和事实性,实验显示在五个问答基准上准确率提升12.1%,幻觉减少16.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06794 2026-04-15 cs.AI 70%

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning

不再有陈旧的反馈:为开放世界智能体学习的共进化批评者

Zhicong Li, Lingjie Jiang, Yulan Hu, Xingchen Zeng, Yixia Li, Xiangwen Zhang, Guanhua Chen, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 赛洛岭人工智能学院) Amap, Alibaba Group(阿里巴巴集团 阿里地图) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ECHO框架,通过同步共进化循环联合优化策略和批评者,解决开放世界环境中策略演变导致的反馈过时问题,提升长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏