arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 19 篇

2512.23126 2026-02-10 cs.AI cs.LG 91%

InSPO: Unlocking Intrinsic Self-Reflection for LLM Preference Optimization

InSPO:解锁LLM偏好优化的内在自反思

Yu Li, Tian Lan, Zhengling Qi

机构 * George Washington University(乔治·华盛顿大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 InSPO通过解锁LLM的内在自反思能力,提升偏好优化的鲁棒性和人类对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08136 2026-02-10 cs.CV cs.AI 89%

Robustness of Vision Language Models Against Split-Image Harmful Input Attacks

视觉语言模型对分裂图像有害输入攻击的鲁棒性

Md Rafi Ur Rashid, MD Sadik Hossain Shanto, Vishnu Asutosh Dasu, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 后训练与偏好优化 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);RLHF(abstract)

AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。

Comments 22 Pages, long conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 85%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08847 2026-02-10 cs.LG cs.AI 84%

Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems

Dr. MAS:多智能体大语言模型系统的稳定强化学习

Lang Feng, Longtao Zheng, Shuo He, Fuxiang Zhang, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Dr. MAS通过智能体级归一化方法稳定多智能体大语言模型的强化学习训练,提升性能并减少梯度不稳定问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01952 2026-02-10 cs.CV cs.AI cs.LG cs.RO 82%

GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment

GrndCtrl: 通过自监督奖励对齐实现世界模型的 grounding

Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 GrndCtrl通过自监督奖励对齐提升世界模型的几何 grounding,实现更稳定的空间一致性与导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08259 2026-02-10 stat.ML cs.LG 81%

A Statistical Framework for Alignment with Biased AI Feedback

带有偏见AI反馈的统计框架

Xintao Xia, Zhiqiu Xia, Linjun Zhang, Zhanrui Cai

机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) Department of Electrical and Computer Engineering, Rutgers University(罗格斯大学电气与计算机工程系) Department of Statistics, Rutgers University(罗格斯大学统计学系) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出两种去偏对齐方法,DDPO通过残差修正和密度比重加权提升效率,DIPO直接估计人类偏好概率,实验证明其在情感生成、摘要和对话任务中提升了对齐效率并接近全人类标注数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08041 2026-02-10 cs.LG cs.AI cs.CL 80%

Implicit Strategic Optimization: Rethinking Long-Horizon Decision-Making in Adversarial Poker Environments

隐式策略优化:重新思考对抗扑克环境中的长 horizon 决策

Boyang Xia, Weiyou Tian, Qingnan Ren, Jiaqi Huang, Jie Xiao, Shuo Lu, Kai Wang, Lynn Ai, Eric Yang, Bill Shi

机构 * Gradient

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出隐式策略优化(ISO)框架,通过预测战略环境和结合战略奖励模型与乐观学习规则,提升对抗性扑克环境中的长 horizon 决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04651 2026-02-10 cs.LG 79%

SAFE: Stable Alignment Finetuning with Entropy-Aware Predictive Control for Reinforcement Learning from Human Feedback (RLHF)

SAFE:基于熵感知预测控制的稳定对齐微调用于人类反馈的强化学习(RLHF)

Dipan Maity

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

AI总结 SAFE通过熵感知预测控制提升RLHF稳定性,实现更高的训练奖励和更稳定的优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-02-10 cs.LG cs.AI 79%

Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08829 2026-02-10 cs.CL cs.AI 73%

WildReward: Learning Reward Models from In-the-Wild Human Interactions

WildReward: 从真实世界的人类交互中学习奖励模型

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildReward,通过真实世界用户交互直接学习奖励模型,无需偏好对,实现更优的校准和一致性,并在多种任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07422 2026-02-10 cs.CR cs.AI cs.CL 73%

Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model

通过在线强化学习与漏洞奖励模型实现安全代码生成

Tianyi Wu, Mingzhe Du, Yue Liu, Chengran Yang, Terry Yue Zhuo, Jiaheng Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SecCoderX通过在线强化学习与漏洞奖励模型提升代码安全性,实现功能与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05494 2026-02-10 cs.LG cs.AI 73%

A Unified Framework for Rethinking Policy Divergence Measures in GRPO

在GRPO中重新思考策略分歧度度量的统一框架

Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra Habchi, Qi Zhu, Matthias Gallé, Chao Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的裁剪框架,通过KL3估计器改进GRPO,提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25416 2026-02-10 cs.CL cs.AI cs.SD 73%

Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization

通过偏好引导优化实现扩散文本到语音模型的情感对齐生成

Jiacheng Shi, Hongfei Du, Yangfan He, Y. Alicia Hong, Ye Gao

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EASPO框架,通过偏好引导优化实现扩散文本到语音模型的情感对齐生成,提升语音的表达性和自然度。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12844 2026-02-10 cs.AI cs.LG 62%

Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance

迈向基于神经反馈的强化学习:将fNIRS信号映射到智能体表现

Julia Santaniello, Matthew Russell, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过fNIRS信号预测智能体表现,利用分类器和回归器提升RLHF性能,并验证了跨受试者泛化能力。

Comments Accepted to the Association for the Advancement of Artificial Intelligence (AAAI) 2026. To appear in the AAAI 2026 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07799 2026-02-10 cs.LG cs.AI 62%

Fairness Aware Reward Optimization

公平感知的奖励优化

Ching Lam Choi, Vighnesh Subramaniam, Phillip Isola, Antonio Torralba, Stefanie Jegelka

机构 * CSAIL, Department of EECS, Massachusetts Institute of Technology(计算机科学与人工智能实验室,电气工程与计算机科学系,麻省理工学院) School of CIT, MCML, MDSI, Technical University of Munich(信息科技学院,MCML,MDSI,慕尼黑技术大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Faro通过在处理过程中训练奖励模型,实现公平性、准确性与校准性的平衡,减少偏见并提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07595 2026-02-10 cs.CV cs.AI 57%

TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation

TeleBoost:一种系统对齐框架,用于高保真、可控且稳健的视频生成

Yuanzhi Liang, Xuan'er Wu, Yirui Liu, Yijie Fang, Yizhen Fan, Ke Hao, Rui Li, Ruiying Liu, Ziqi Ni, Peng Yu, Yanbo Wang, Haibin Huang, Qizhen Weng, Chi Zhang, Xuelong Li

机构 * TeleBoost Team(TeleBoost团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 TeleBoost提出了一种系统化的训练后框架,通过整合监督策略塑造、奖励驱动强化学习和偏好细化,提升视频生成的保真度、时间连续性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08346 2026-02-10 cs.CV 50%

What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning

什么是、是否以及如何?揭示图像推理中的过程奖励模型

Yujin Zhou, Pengcheng Wen, Jiale Chen, Boqin Yin, Han Zhu, Jiaming Ji, Juntao Dai, Chi-Min Chan, Sirui Han

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 本研究提出首个图像推理范式下的PRMs综合基准,定义7种细粒度错误类型,揭示当前LVLMs在视觉推理评估中的不足,为改进PRMs提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07564 2026-02-10 cs.CV 50%

SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens

SIGMA: 带多属性标记的选择性交错生成

Xiaoyan Zhang, Zechen Bai, Haofan Wang, Yiren Song

机构 * Creatly AI University of Michigan(密歇根大学) Lovart AI National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 SIGMA通过引入多属性标记实现多条件生成,提升可控性、一致性和视觉质量,优于Bagel在组合任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13885 2026-02-10 cs.IR 50%

Retrieval-GRPO: A Multi-Objective Reinforcement Learning Framework for Dense Retrieval in Taobao Search

检索-GRPO:面向淘宝搜索密集检索的多目标强化学习框架

Xingxian Liu, Dongshuai Li, Jiahui Wan, Tao Wen, Gui Ling, Yuliang Yan, Fuyu Lv, Dan Ou, Haihong Tang, Bo Zheng

专题命中 后训练与偏好优化 :LLM(abstract)

AI总结 Retrieval-GRPO通过多目标强化学习框架解决密集检索中的硬负样本依赖和跷跷板效应问题,提升复杂长尾查询的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏