arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2608.27505 2026-08-31 cs.CL cs.AI 新提交 91%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27351 2026-08-31 cs.LG 版本更新 91%

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

理解用于大语言模型推理的进化策略:比GRPO更广泛的推理覆盖范围

Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract_cn);language model(abstract_cn);post-training(abstract)

AI总结 本文研究用于LLM推理的进化策略(ES),发现ES比GRPO有更广泛的推理覆盖范围,开发了结合两者优势的GRPO-ES策略,还揭示了ES的功能稀疏性等特性,确立其为独特的推理后训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09260 2026-08-31 cs.CR cs.LG 版本更新 91%

GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis

GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击

Subrat Kishore Dutta, Yuelin Xu, Piyush Pant, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);prompting(abstract);分类 cs.LG

AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27750 2026-08-31 cs.LG cs.CL 新提交 88%

The Calls are Coming from Inside the Model: Investigating Probe-based Detection of Tool-Calling Errors in LLMs

调用来自模型内部:研究基于探针的大型语言模型工具调用错误检测方法

Eric Yeats, Brendan Kennedy, Loc Truong, John Buckheit, Jung Lee, Jesse Friedbaum, John Emanuello, Henry Kvinge

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) National Security Agency(美国国家安全局)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究探究基于线性探针的工具调用错误检测方法,在18个工具调用LLM上验证其效能,发现探针可捕捉多种工具调用错误,还能泛化到新型错误,为LLM工具调用错误检测提供有效手段。

Comments 4 main pages, 8 pages of references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-08-31 cs.CL cs.AI 版本更新 88%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-08-31 cs.CV 版本更新 88%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract)

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments ECCV 2026 camera-ready version. Project page: this https URL (https://vision.cs.utexas.edu/projects/acpo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30504 2026-08-31 cs.CL 版本更新 87%

Auditing LLM Benchmarks with Item Response Theory

使用项目反应理论审计LLM基准测试

Sander Land, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL

AI总结 本文引入基于项目反应理论的指标,通过114个模型的响应在七个偏好和多选基准测试中识别出前200个示例中95%精度的可能错误标签,并追踪错误来源,同时揭示奖励模型在风格偏好而非事实知识上的专业化。

Comments Accepted at EMNLP 2026. Associated data at this https URL (https://huggingface.co/datasets/Writer/IRT-mislabeled-items)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28199 2026-08-31 cs.GT 新提交 83%

Fine-Tuning Autobidders with Group Relative Policy Optimization

使用分组相对策略优化对自动出价器进行微调

Anton Safin, Alexandra Khirianova, Andrey Pudovikov, Aleksandr Katrutsa, Egor Samosvat

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究将分组相对策略优化(GRPO)框架适配自动出价场景,经BAT等基准测试,其在点击量上优于基线,转化量为最佳或次佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07188 2026-08-31 cs.CV 版本更新 82%

Hierarchical Feature-level Reverse Propagation for Post-Training Neural Networks

用于训练后神经网络的分层特征级反向传播

Ni Ding, Shuchang Wang, Lei He, Shengbo Eben Li, Keqiang Li

机构 * School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(清华大学车辆与移动系统学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing 100084, China(清华大学智能绿色车辆与移动系统国家重点实验室) School of Mathematics and Statistics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学数学与统计学院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 提出FR-PT分层框架,基于CCP和MDP及相关算法处理逆问题,在85种训练后设置中63项优于基准,实现神经网络训练后可控适应与透明度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28421 2026-08-31 cs.AI 新提交 79%

Program Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMs

可验证奖励的程序学习:针对后训练大语言模型的符号反向传播

Vishvesh Bhat

机构 * CoreThink AI

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);分类 cs.AI

AI总结 本文提出PLVR方法,通过符号反向传播从输入输出示例学习显式程序,在代码基准上提升大语言模型推理能力,边际成本低且效果优于RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28406 2026-08-31 cs.CV cs.LG 新提交 79%

Post-Training VLMs for Video Mistake Detection

用于视频错误检测的后训练视觉语言模型

Federico Spurio, Olga Zatsarynna, Lars Doorenbos, Emad Bahrami, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Toyota Motor Europe Belgium(丰田汽车欧洲比利时公司)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 针对视频错误检测的闭集方法泛化性差的问题,提出首个VLM后训练技术,采用定制奖励函数,在EP-VQA上较最佳基线提升11.6%,实现更好的泛化。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-31 cs.CV cs.AI 版本更新 79%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28264 2026-08-31 cs.AI 新提交 70%

Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration

查明责任归属:面向多智能体协作的自动化失败归因式自动反思框架

Xiaoqing Wang, Keman Huang, Bin Liang, Hongyu Li, Xiaoyong Du, Wuqiong Pan

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型驱动多智能体系统的高失败率问题,提出DoCtOR框架,通过自动化失败归因识别决定性错误智能体,仅让其针对性反思,在多个数据集上提升成功率且优于基线方法。

Comments Accepted by EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27017 2026-08-31 cs.IR 版本更新 67%

ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

ProRetrieval:通过可执行程序合成学习编排混合搜索

Chengsong You, Zhen Sun, Yunhai Hu, Junwei Zhou, Xiaoyu Cao, Binyu Li, Ziyan Zhao, Weiyao Wang, Liren Lu, Zhijie Ye, Yumo Cao, Yitao Long, Yiwei Xu, Qiyi Jiang, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yiran Zou, Nan Du

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract)

AI总结 ProRetrieval 将语言模型作为检索编排器,通过混合 DSL 合成可执行程序,在两个新基准上训练 Qwen3-4B,其 4B 模型在电商、邮件检索任务中优于 GPT-5.5 等主流模型及各类基线。

Comments 15 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21240 2026-08-31 cs.LG 版本更新 57%

Class Incremental Continual Learning with Self-Organizing Maps and Synthetic Replay

基于自组织映射和合成重放的类别增量持续学习

Pujan Thapa, Alexander Ororbia, Travis Desell

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出基于自组织映射(SOM)与合成重放的类别增量持续学习框架,在多基准数据集上性能优于无内存方法,为类别增量持续学习提供了可扩展的无标签无示例方案。

详情

展开后加载摘要…

URL PDF HTML 收藏