arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-26 至 2026-02-26 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2602.21728 2026-02-26 cs.CL 89%

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

在知识图谱上探索:通过路径细化奖励建模激励大语言模型自主探索

Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

机构 * Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国) Institute for Network Sciences and Cyberspace, Tsinghua University, Beijing, China(网络科学与网络空间研究院,清华大学,北京,中国) Ant International, Ant Group, Hangzhou, Zhejiang, China(蚂蚁集团,杭州,浙江,中国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Explore-on-Graph框架,通过强化学习和路径细化奖励建模,使大语言模型在知识图谱上自主探索更广泛的推理空间,实现对分布外推理问题的高效泛化。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21346 2026-02-26 cs.CL cs.AI 87%

Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment

基于对齐的DPO:一种原则性的推理方法以提高安全性对齐

Mengxuan Hu, Vivek V. Datla, Anoop Kumar, Zihan Guan, Sheng Li, Alfy Samuel, Daben Liu

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20718 2026-02-26 cs.LG cs.AI cs.CL 87%

Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

通过回合级重要性采样和触发式归一化稳定长时程LLM代理的离策略训练

Chenliang Li, Adel Elmahdy, Alex Boyd, Zhongruo Wang, Siliang Zeng, Alfredo Garcia, Parminder Bhatia, Taha Kass-Hout, Cao Xiao, Mingyi Hong

机构 * Texas A&M University(德克萨斯A&M大学) GE HealthCare(通用电气医疗) University of Minnesota(明尼苏达大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SORL通过回合级重要性采样和触发式归一化稳定长时程LLM代理的离策略训练,减少梯度方差并防止优化崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22146 2026-02-26 cs.LG cs.AI 86%

Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual

多目标安全大语言模型对齐的可证明最终迭代收敛性:基于乐观对偶算法

Yining Li, Peizhong Ju, Ness Shroff

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出了一种乐观对偶算法,用于多目标安全大语言模型对齐,解决了传统方法在最终迭代中的不稳定问题,并证明了该算法的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21765 2026-02-26 cs.LG cs.AI stat.ML 86%

Generalisation of RLHF under Reward Shift and Clipped KL Regularisation

基于奖励偏移和截断KL正则化的RLHF泛化

Kenton Tang, Yuzhu Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于奖励偏移和截断KL正则化的RLHF泛化理论,分析了奖励偏移和KL截断对泛化误差的影响,并给出了优化KL截断阈值和预算分配的实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21461 2026-02-26 cs.CL 83%

VecGlypher: Unified Vector Glyph Generation with Language Models

VecGlypher: 一种基于语言模型的统一向量图形单元生成方法

Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han

机构 * Meta AI

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 VecGlypher通过多模态语言模型直接生成高质量向量图形,无需位图中间步骤,显著提升字体创建效率和可编辑性。

Comments Accepted to CVPR'26. Project page: https://xk-huang.github.io/VecGlypher/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20498 2026-02-26 cs.CL 77%

Robust Preference Alignment via Directional Neighborhood Consensus

通过方向邻域共识实现鲁棒偏好对齐

Ruochen Mao, Yuling Shi, Xiaodong Gu, Jiaheng Wei

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 通过方向邻域共识实现鲁棒偏好对齐,提升模型在多样化偏好下的稳定性与可靠性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13551 2026-02-26 cs.CL 77%

Small Reward Models via Backward Inference

通过反向推理的小奖励模型

Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 FLIP通过反向推理实现无需参考和评分标准的奖励建模,在多个领域中显著提升性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21992 2026-02-26 cs.CV 67%

PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning

PanoEnv:探索基于强化学习的全景环境中3D空间智能

Zekai Lin, Xu Zheng

机构 * University of Glasgow(格拉斯哥大学) HKUST(GZ)(香港科技大学(广州))

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 PanoEnv通过强化学习框架提升VLMs在全景环境中3D空间推理能力,实现更高准确率和语义评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05236 2026-02-26 cs.CV 50%

Unified Reward Model for Multimodal Understanding and Generation

多模态理解和生成的统一奖励模型

Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出统一奖励模型,通过联合学习多种视觉任务提升多模态理解和生成的性能。

Comments project page: https://codegoat24.github.io/UnifiedReward/

详情

展开后加载摘要…

URL PDF HTML 收藏