arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2608.18531 2026-08-20 cs.AI cs.LG 新提交 82%

Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson

离线解释选择中, pairwise 排序优于单动作强化学习:一个实践经验

Tanay Chowdhury, Saeideh Shahrokh Esfahani

机构 * Amazon(亚马逊公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对工业可解释推荐系统的高成本问题,提出将 LLM 解释生成与选择分离的方案,发现 pairwise 排序方法在离线解释选择中优于单动作强化学习,且构建成本低、延迟小。

Comments This is an extended version of a 3-page paper accepted to the RecSys 2026 Research and Practice Notes track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16316 2026-08-17 cs.IR cs.AI cs.LG 版本更新 82%

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Yuchen Zhuang, Wenqi Shi, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17299 2026-08-14 cs.CL cs.AI 版本更新 82%

Cat-DPO: Category-Adaptive Safety Alignment

Cat-DPO:基于类别的安全对齐

Tiankai Yang, Yi Nian, Xinyuan Li, Ruiyao Xu, Henry Peng Zou, Kaize Ding, Xiyang Hu, Yan Liu, Yue Zhao

机构 * University of Southern California(南加州大学) Northwestern University(西北大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Cat-DPO通过将安全对齐转化为类别约束优化问题,为每个有害类别设置独立的适应性安全边际,提升整体帮助性和无害性,减少类别间的安全方差和最佳至最差差距。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19395 2026-07-23 cs.LG cs.AI 新提交 82%

From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation

从轨迹到前缀:通过重放前缀和在线延续复用教师轨迹

Yihan Wang, Zhong Guan, Haoran Sun, Jiale Huang, Likang Wu, Hongke Zhao

机构 * Tianjin University(天津大学) Peking University(北京大学) Tianjin University of Technology(天津工业大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对小语言模型蒸馏低效问题,提出Prefix-GRPO强化学习框架,将教师轨迹分解,通过重放前缀恢复中间状态并在线延续,统一前缀与延续学习,实验证明其优于蒸馏和标准RL基线,凸显前缀令牌优化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19243 2026-07-22 cs.CL cs.AI 新提交 82%

Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs

大语言模型中跨语言事实一致性的推理时引导

Alexander Manev

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 研究大语言模型跨语言事实不一致问题,评估零样本上下文引导、CAA、DPO四种干预策略,通过实验发现角色提示是最强干预方式,CAA对配置敏感,DPO适配器收益窄且可转移性低,表明跨语言不一致部分是选择问题,简单干预可能更优。

Comments 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07993 2026-07-10 cs.CL cs.LG 新提交 82%

Hallucination Self-Play: Bootstrapping Reinforced Detector via Evolved Generator

幻觉自我博弈:通过进化生成器引导强化检测器

Shiping Yang, Shining Liang, Weihao Liu, Wenbiao Ding, Linjun Shou, Lu Cheng, Angel X. Chang

机构 * Simon Fraser University(西蒙 Fraser大学) Microsoft(微软) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对高质量标注数据稀缺致识别LLM生成输出中幻觉困难及现有方法局限,提出幻觉自我博弈框架,含检测器和生成器,经多轮训练优化,能在无外部监督下提升小型LLM性能。

Comments Accepted to COLM 2026. Camera-ready version to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07178 2026-07-09 cs.LG cs.AI 新提交 82%

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

多任务智能强化学习的熵步长策略优化

Zetian Hu, Shunyu Liu, Junjie Zhang, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 82%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00531 2026-07-02 cs.LG cs.AI q-bio.BM stat.ML 新提交 82%

Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization

Active-GRPO:用于分子优化的自适应模仿与自我改进推理

Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong

机构 * School of Medicine, Stanford University(斯坦福大学医学院) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Active-GRPO方法,通过主动模仿-强化和主动参考机制,在分子优化中自适应平衡模仿与自我改进,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30851 2026-07-01 cs.CL cs.AI cs.DB 新提交 82%

Test-Time Verification for Text-to-SQL via Outcome Reward Models

基于结果奖励模型的文本到SQL测试时验证

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出结果奖励模型(ORM)作为学习型语义评分函数,用于Text-to-SQL的测试时验证,通过自动化候选生成和执行标签训练ORM,在BIRD和Spider基准上优于执行优先和多数投票方法。

Comments Accepted to the SURGeLLM Workshop at ACL 2026, San Diego, US

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27681 2026-06-29 cs.LG cs.CL 新提交 82%

Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation

用于世界模型的文本信念状态:严格中介下的可识别表示学习

Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出严格中介原则解决LLM中历史旁路导致的潜在状态不可识别问题,引入离散文本潜在状态和因子化GRPO方法,在TextWorld和ScienceWorld上实现表示质量和滚动性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26387 2026-06-26 cs.CV cs.CL cs.LG 新提交 82%

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

机构 * UAB(阿拉巴马大学伯明翰分校) Yale(耶鲁大学) UNSW(新南威尔士大学) Tulane(杜兰大学) Georgia Tech(佐治亚理工学院) NEU(东北大学) OSU(俄亥俄州立大学) UIowa(爱荷华大学) Harvard(哈佛大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26327 2026-06-26 cs.LG cs.AI 新提交 82%

EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning

EVOM:用于强化学习的演员-评论家架构的智能体元进化

Boyun Zhang, Chao Wang, Kai Wu

机构 * Xidian University(西安电子科技大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出EVOM框架,通过双层优化(内环低保真PPO训练权重,外环LLM设计智能体驱动元进化)自动搜索高性能演员-评论家架构,在Ant-v4和HalfCheetah-v4上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23740 2026-06-24 cs.LG cs.AI 新提交 82%

Weight-Space Geometry of Offline Reasoning Training

离线推理训练的权重空间几何

Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 通过余弦相似度、主角度子空间分析等方法,研究六种离线强化学习方法在数学推理任务中的权重更新几何,发现SFT、RFT、RIFT几乎共线,DFT方向偏离,Offline GRPO添加正交分量,DPO位于近正交子空间且准确率最高。

Comments accepted for ICML 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20740 2026-06-23 cs.CL cs.LG 新提交 82%

VeriBound: PAC-Bayesian Generalization Bounds for Process Reward Models Trained with Formal Verification Tools

VeriBound: 使用形式验证工具训练的过程奖励模型的PAC-Bayesian泛化界

Amirul Rahman, Mohammed Sabih Alsharari

机构 * University of Malaya(马来亚大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对形式验证工具标注的过程奖励模型(PRM)缺乏理论解释的问题,提出VeriBound框架,给出PAC-Bayesian泛化界、样本复杂度、收敛速率及下游Best-of-K性能的误差传播界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20508 2026-06-19 cs.AI cs.LG 新提交 82%

What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?

安全对齐的LLM从混合顺从演示中学到了什么?

Sihui Dai, Mann Patel

专题命中 后训练与偏好优化 :LLM(title_cn);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究通过混合良性顺从演示和有害顺从演示,探究演示组成如何驱动有害顺从,发现演示内容、顺序和训练方法影响模型提取的信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09046 2026-06-18 cs.LG cs.AI cs.MA 版本更新 82%

Self-Evolving Multi-Agent Systems via Textual Backpropagation

通过文本反向传播的自进化多智能体系统

Xiaowen Ma, Yunpu Ma, Chenyang Lin, Sikuan Yan, Jinhe Bi, Zixuan Cao, Yijun Tian, Volker Tresp, Hinrich Schuetze

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Notre Dame(诺丁汉大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出Agentic Neural Network框架,将多智能体协作建模为分层神经网络,通过前向分解任务和反向传播反馈实现智能体角色、提示和协作的自进化,在七个基准数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12365 2026-06-16 cs.IR cs.AI cs.CL 82%

TaoSR1: The Thinking Model for E-commerce Relevance Search

TaoSR1:电商相关性搜索的思考模型

Chenhe Dong, Shaowei Yao, Pengkun Jiao, Jianhui Yang, Yiming Jin, Zerui Huang, Xiaojiang Zhou, Dan Ou, Haihong Tang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 本文提出TaoSR1框架,通过CoT引导的监督微调、离线采样与DPO优化,解决电商搜索中相关性预测的推理误差与幻觉问题,实现高效部署。

Journal ref KDD '26: Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14211 2026-06-15 cs.AI cs.LG 新提交 82%

Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL

缩小反思差距:面向智能体强化学习的免费校准奖励

Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体在环境反馈后自我评估不准确的问题,提出RefGRPO方法,通过对比反思与实际结果计算免费校准奖励并动态调整系数,同时提升反思校准和任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13707 2026-06-15 cs.AI cs.CL cs.CV 新提交 82%

Orchestra-o1: Omnimodal Agent Orchestration

Orchestra-o1: 全模态智能体编排

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Hao Wu, Jinyang Wu, Donghao Zhou, Zhihong Zhu, Zheng Lian, Xin Wang, Pheng-Ann Heng

机构 * CUHK(香港中文大学) LIGHTSPEED PKU(北京大学) THU(清华大学) Tongji University(同济大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Orchestra-o1全模态智能体编排框架,通过统一编排机制实现模态感知任务分解、在线子智能体专业化和并行子任务执行,在OmniGAIA基准上准确率超第二名10.3%,并引入DA-GRPO强化学习方法训练Orchestra-o1-8B达到开源全模态智能体最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10569 2026-06-10 cs.CL cs.AI 新提交 82%

Hidden Consensus:Preference-Validity Compression in Human Feedback

隐藏共识:人类反馈中的偏好有效性压缩

Dorcas Chia Ern Chua, Karen Myn Hui Lee, Jia Yue Tan, Zhen Xue Gue, Norzalena Abdul Hamid, Azima Binti Azmi, Keat Mei Yeong, Aizat Izyani binti Mujab, Hafsah Noor Azam, Chee Guo Khoo, Han Ying Lim, Chee Seng Chan

机构 * YTL AI Labs Universiti Malaya(马来亚大学) Monash University Malaysia(莫纳什大学马来西亚校区) Universiti Malaysia Sarawak(马来西亚沙捞越大学)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出偏好有效性压缩问题,即RLHF将多元有效反馈压缩为单一奖励目标,导致对齐测量偏差。通过马来西亚语料分析,79%的提示存在多个多数支持响应,表明多数聚合测量的是argmax可接受性而非多元对齐。

Comments 28 pages. When AI learns from human feedback, it forces a single "correct" answer, but sometimes multiple answers are all genuinely valid, and that nuance gets thrown away

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10528 2026-06-10 cs.LG cs.CL 新提交 82%

Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output

表示感知优势估计:你的奖励模型提供的不仅仅是标量输出

Guozheng Li, Xiyan Fu, Yiwen Guo

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出表示感知优势估计方法,利用奖励模型隐藏状态作为辅助信号,通过图传播计算优势值,提升RLHF的样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19327 2026-06-05 cs.LG cs.AI 82%

Soft Sequence Policy Optimization

软序列策略优化

Svetlana Glazyrina, Maksim Kryzhanovskiy, Roman Ischenko

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Institute for Artificial Intelligence(人工智能研究所)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软序列策略优化方法,通过引入软门控函数改进序列级重要性权重,提升大语言模型对齐任务的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27382 2026-05-29 cs.HC cs.AI cs.CL 82%

The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs

对齐下限:角色定制如何破坏弱对齐大语言模型的安全性

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过对比强对齐与弱对齐模型在不同角色条件下的谄媚率变化,定义对齐下限Δ_floor作为评估模型角色定制安全性的审计指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26958 2026-05-27 cs.CL cs.AI 82%

Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励

Zixuan Yang, Yiqun Chen, Wei Yang, Erhan Zhang, Zihan Shen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) University of Southern California(南加州大学) Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26784 2026-05-27 cs.LG cs.AI 82%

Ratio-Variance Regularized Policy Optimization

比率方差正则化策略优化

Yu Luo, Shuo Han, Yihan Hu, Lei Lv, Huaping Liu, Fuchun Sun, Jianye Hao, Dong Li

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门,2012实验室) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出R²VPO方法,通过约束策略比率方差作为信任区域的局部近似,替代启发式裁剪,在LLM和机器人控制任务中提升性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25036 2026-05-26 cs.CL cs.AI 82%

Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation

LVLMs中的语言偏差:从深入分析到简单有效的缓解方法

Yangneng Chen, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);instruction tuning(abstract);preference optimization(abstract)

AI总结 本文系统研究了大视觉语言模型中的语言偏差问题,发现其根源在于训练中的模态未对齐,并提出了两种简单有效的缓解方法:语言偏差正则化(LBR)和语言偏差惩罚(LBP)。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24366 2026-05-26 cs.CL cs.LG 82%

Structure-Aware RAG: Structured Retrieval Augmented Generation from Noisy Data for Conversational Agents

结构感知检索增强生成:面向对话代理的噪声数据结构化检索增强生成

Kaiqiao Han, LuAn Tang, Renliang Sun, Peng Yuan, Wei Cheng, Haoyu Wang, Wei Wang, Yizhou Sun, Haifeng Chen

机构 * UCLA(加州大学洛杉矶分校) NEC Labs(日本电装实验室)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出结构感知检索增强生成(SA-RAG),通过表格作为中间结构化表示来减少噪声并保留关键信息,结合质量感知的表格元数据生成框架和优化方法,在噪声真实数据集上显著优于现有RAG基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12058 2026-05-22 cs.LG cs.AI 82%

Holder Policy Optimisation

Hölder Policy Optimisation

Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

机构 * University College London(伦敦大学学院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 后训练与偏好优化 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出HölderPO框架,通过Hölder均值统一token级概率聚合,解决固定聚合机制导致的训练崩溃与性能不足问题,理论证明不同p值对梯度集中度和方差的平衡作用,并通过动态退火算法实现训练周期内的p值调度,实验表明其在多个数学基准测试中取得更优的稳定性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15573 2026-05-18 cs.CL cs.LG cs.MA 82%

Response-Conditioned Parallel-to-Sequential Orchestration for Multi-Agent Systems

响应条件化的并行到顺序 orchestration 用于多智能体系统

Nurbek Tastan, Alex Iacob, Lorenzo Sani, Meghdad Kurmanji, Nicholas D. Lane, Samuel Horvath, Karthik Nandakumar

机构 * MBZUAI(马克斯·普朗克智能系统研究所) University of Cambridge(剑桥大学) Flower Labs(Flower实验室) Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Nexa框架,通过响应条件化的策略结合并行与顺序执行,减少通信和延迟同时提高最终响应准确性,展示了其通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏