arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-11 至 2026-02-11 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2504.03784 2026-02-11 stat.ML cs.AI cs.LG 91%

Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning

从人类反馈中鲁棒强化学习用于大语言模型微调

Kai Ye, Hongyi Zhou, Jin Zhu, Francesco Quinzan, Chengchun Shi

机构 * Department of Statistics, LSE(统计系,伦敦经济学院) Department of Mathematics, Tsinghua University(数学系,清华大学) School of Mathematics, University of Birmingham(数学学院,伯明翰大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 本文提出了一种鲁棒的强化学习算法,用于改进大语言模型微调中从人类反馈学习奖励函数的性能,通过减少方差和改进后悔界,实验证明其在基准数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23631 2026-02-11 cs.LG cs.AI stat.ME stat.ML 88%

Beyond Pairwise: Empowering LLM Alignment With Ranked Choice Modeling

超越成对:通过排名选择建模增强大语言模型对齐

Yuxuan Tang, Yifan Feng

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Department of Analytics and Operations(分析与运营系) NUS Business School(新加坡国立大学商学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出RCPO框架,通过最大似然估计结合排名选择建模,提升大语言模型对齐效果,实验显示其在多种模型和设置中均优于基线方法。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13981 2026-02-11 q-bio.BM cs.LG 79%

Decomposed Direct Preference Optimization for Structure-Based Drug Design

基于结构的分解直接偏好优化用于基于结构的药物设计

Xiwei Cheng, Xiangxin Zhou, Yuwei Yang, Yu Bao, Quanquan Gu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 DecompDPO通过分解优化目标和引入物理信息能量项,提升基于结构的药物设计中分子生成与优化的性能。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01879 2026-02-11 cs.CL cs.AI 79%

REPAIR: Robust Editing via Progressive Adaptive Intervention and Reintegration

通过渐进自适应干预与再整合实现鲁棒编辑

Yisu Wang, Ming Wang, Haoyuan Song, Wenjie Huang, Chaozheng Wang, Yi Xie, Xuming Ran

机构 * Engineering Center for Space Utilization of Chinese Academy of Sciences(中国科学院空间利用工程技术中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science and Engineering(计算机科学与工程学院) Northeastern University(东北大学) New York University(纽约大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 REPAIR通过闭环反馈和动态内存管理实现鲁棒编辑,提升编辑准确性并减少知识遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10109 2026-02-11 cs.RO 75%

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

ST4VLA:基于空间引导的视觉-语言-动作模型训练

Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);prompting(abstract)

AI总结 ST4VLA通过空间引导训练提升视觉-语言-动作模型的性能,实现对机器人任务的更稳健和可泛化的学习。

Comments Spatially Training for VLA, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09934 2026-02-11 cs.CV 75%

VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization

VersaViT: 通过任务引导优化增强MLLM视觉骨干

Yikun Liu, Yuan Liu, Shangzhe Di, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jie Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) WeChat AI, Tencent Inc., China(腾讯公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09331 2026-02-11 cs.CL cs.AI cs.LG 67%

Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization

超越均匀信用:为策略优化的因果信用分配

Mykola Khandoga, Rui Yuan, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反事实重要性加权方法,通过因果信用分配提升语言模型推理性能,无需辅助模型或外部标注,实验验证其在GSM8K上的有效性。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02380 2026-02-11 cs.CV 67%

Unified Personalized Reward Model for Vision Generation

面向视觉生成的统一个性化奖励模型

Yibin Wang, Yuhang Zang, Feng Han, Jiazi Bu, Yujie Zhou, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :SFT(abstract);preference optimization(abstract)

AI总结 本文提出UnifiedReward-Flex,一种面向视觉生成的统一个性化奖励模型,通过结合奖励建模与灵活上下文适应的推理,提升视觉生成的准确性与对人类偏好的对齐性。

Comments Website: https://codegoat24.github.io/UnifiedReward/flex

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09538 2026-02-11 cs.CL 57%

UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment

UniARM: 向多目标测试时间对齐的统一自回归奖励模型迈进

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuan Huang, Deqing Wang, Jianxin Li, Yitong Yao, Chao Wang, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 UniARM通过统一自回归奖励模型实现多目标测试时间对齐,通过共享特征和偏好调节模块减少特征纠缠,提升对偏好权衡的控制能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05787 2026-02-11 cs.AI 57%

From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation

从离线到在线:通过双层专家到策略融合提升GUI代理

Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu

机构 * Nanjing University(南京大学) Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 BEPA通过双层专家到策略融合方法,提升GUI代理在OSWorld-Verified等基准测试中的性能。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏