arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2512.22519 2026-04-27 cs.RO 67%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV 67%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12163 2026-04-15 cs.CV 67%

Nucleus-Image: Sparse MoE for Image Generation

Nucleus-Image:稀疏MoE用于图像生成

Chandan Akiti, Ajay Modukuri, Murali Nandan Nagarapu, Gunavardhan Akiti, Haozhe Liu

机构 * Nucleus AI Team(Nucleus AI 团队)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 Nucleus-Image通过稀疏MoE架构在质量与效率上实现新的帕累托前沿,仅使用约2B参数即可达到领先模型性能,无需后训练优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05125 2026-04-08 cs.IR cs.AI cs.CL cs.LG 67%

Offline RL for Adaptive Policy Retrieval in Prior Authorization

离线强化学习在先决授权政策适应性检索中的应用

Ruslan Sharifullin, Maxim Gorshkov, Hannah Clay

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于离线强化学习的适应性政策检索方法,通过将检索过程建模为马尔可夫决策过程,提升了检索效率和准确性。

Comments 9 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04410 2026-04-07 cs.LG cs.AI cs.CL stat.ML 67%

Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment

相对密度比优化用于稳定且统计一致的模型对齐

Hiroshi Takahashi, Tomoharu Iwata, Atsutoshi Kumagai, Sekitoshi Kanai, Masanori Yamada, Kosuke Nishida, Kazutoshi Shinoda

机构 * NTT, Inc.(日本电信电话株式会社) NTT DOCOMO, INC.(NTT DOCOMO公司)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种稳定且统计一致的模型对齐方法,通过相对密度比优化,改进了直接密度比优化的稳定性与收敛性。

Comments Code is available at https://github.com/takahashihiroshi/rdro

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11321 2026-04-07 cs.LG cs.AI cs.CL 67%

Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings

回顾锚定策略优化:在稀疏奖励设置中将失败转化为反馈

Yuning Wu, Ke Wang, Devin Chen, Kai Wei

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HAPO策略优化方法,通过合成成功注入机制和 Thompson 采样启发的门控机制,解决稀疏奖励下策略优化的分布偏置问题,实现渐近一致性。

Comments Published as a conference paper ICLR 2026 CAO Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 67%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27184 2026-03-31 cs.CV 67%

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

激励时间感知的自体视频理解模型

Zhiyang Xu, Tian Qin, Bowen Jin, Zhengfeng Lai, Meng Cao, Lifu Huang, Peng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) Apple(苹果公司) Harvard University(哈佛大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Davis(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出TGPO算法,通过强化学习提升多模态大语言模型在自体视频理解中的时间感知能力,实验表明其在时间接地和因果连贯性方面优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24580 2026-03-26 cs.CL cs.AI cs.CY cs.IR cs.LG 67%

Retrieval Improvements Do Not Guarantee Better Answers: A Study of RAG for AI Policy QA

检索改进并不保证更好的答案:RAG在人工智能政策问答中的研究

Saahil Mathur, Ryan David Rittner, Vedant Ajit Thakur, Daniel Stuart Schiff, Tunazzina Islam

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Political Science, Purdue University(政治学系,普渡大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了RAG在人工智能治理中的应用,发现领域特定微调虽提升检索指标,但未必改善问答性能,尤其在相关文档缺失时可能导致更自信的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24198 2026-03-26 cs.CV 67%

RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution

RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模

Yushuai Song, Weize Quan, Weining Wang, Jiahui Sun, Jing Liu, Meng Li, Pengbin Yu, Zhentao Chen, Wei Shen, Lunxi Yuan, Dong-ming Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22165 2026-03-24 cs.CV 67%

ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints

ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移

Kaili Huang, Hongming Zhang, Rui Shen, Linjun Dai, Jiahao Wang, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13866 2026-03-24 cs.LG cs.AI cs.CL 67%

Masked Diffusion Models as Energy Minimization

掩码扩散模型作为能量最小化

Sitong Chen, Shen Nie, Jiacheng Sun, Zijin Feng, Zhenguo Li, Ji-Rong Wen, Chongxuan Li

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将掩码扩散模型解释为离散最优传输中能量最小化问题的理论框架,证明三种能量形式在MDM结构下等价,并通过Beta分布参数化插值调度,提升采样效率。

Journal ref Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19665 2026-03-23 cs.IR 67%

GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce

GenFacet:通过多任务偏好对齐的端到端生成方法实现电商多维搜索

Zhouwei Zhai, Min Yang, Jin Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出GenFacet,一种端到端生成框架,通过多任务偏好对齐提升电商多维搜索效果,实验证明显著提升点击率和转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09814 2026-03-23 cs.CV 67%

DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision

DreamCS: 基于几何感知的文本到3D生成与无配对3D奖励监督

Xiandong Zou, Ruihao Xia, Hongsong Wang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) East China University of Science and Technology(东华大学) Southeast University(东南大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出DreamCS框架,通过无配对3D-MeshPref数据训练奖励模型,提升文本到3D生成的几何准确性和人类偏好对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 67%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11494 2026-03-13 cs.DB 67%

PRMB: Benchmarking Reward Models in Long-Horizon CBT-based Counseling Dialogue

PRMB:基于长期horizon认知行为疗法对话的奖励模型基准测试

Yougen Zhou, Qin Chen, Ningning Zhou, Jie Zhou, Liang He

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 PRMB提出了一种用于评估奖励模型在多会话CBT咨询中长期效果的基准,揭示了现有方法的不足并展示了生成奖励模型的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV 67%

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract)

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 67%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01352 2026-03-04 cs.CL cs.AI cs.LG 67%

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

Skywork-Reward-V2: 通过人机协同扩大偏好数据整理

Chris Yuhao Liu, Liang Zeng, Yuzhen Xiao, Jujie He, Jiacai Liu, Chaojie Wang, Rui Yan, Wei Shen, Fuxiang Zhang, Jiacheng Xu, Yang Liu, Yahui Zhou

机构 * Research, Skywork AI(2050研究, Skywork AI)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Skywork-Reward-V2通过人机协同扩大偏好数据整理,提出SynPref-40M数据集和两阶段流程,训练出八种参数不同的奖励模型,在多个基准中取得最佳性能。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21992 2026-02-26 cs.CV 67%

PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning

PanoEnv:探索基于强化学习的全景环境中3D空间智能

Zekai Lin, Xu Zheng

机构 * University of Glasgow(格拉斯哥大学) HKUST(GZ)(香港科技大学(广州))

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 PanoEnv通过强化学习框架提升VLMs在全景环境中3D空间推理能力,实现更高准确率和语义评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19542 2026-02-24 cs.CV 67%

Vinedresser3D: Agentic Text-guided 3D Editing

Vinedresser3D: 基于代理的文本引导3D编辑

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 Vinedresser3D通过多模态大语言模型和潜在空间编辑技术实现高质量文本引导的3D编辑,提升编辑精度与一致性。

Comments CVPR 2026, Project website:https://vinedresser3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09331 2026-02-11 cs.CL cs.AI cs.LG 67%

Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization

超越均匀信用:为策略优化的因果信用分配

Mykola Khandoga, Rui Yuan, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反事实重要性加权方法,通过因果信用分配提升语言模型推理性能,无需辅助模型或外部标注,实验验证其在GSM8K上的有效性。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02380 2026-02-11 cs.CV 67%

Unified Personalized Reward Model for Vision Generation

面向视觉生成的统一个性化奖励模型

Yibin Wang, Yuhang Zang, Feng Han, Jiazi Bu, Yujie Zhou, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :SFT(abstract);preference optimization(abstract)

AI总结 本文提出UnifiedReward-Flex,一种面向视觉生成的统一个性化奖励模型,通过结合奖励建模与灵活上下文适应的推理,提升视觉生成的准确性与对人类偏好的对齐性。

Comments Website: https://codegoat24.github.io/UnifiedReward/flex

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00744 2026-02-09 cs.SD 67%

ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation

ACE-Step 1.5:推动开源音乐生成的边界

Junmin Gong, Yulin Song, Wenxiao Zhao, Sen Wang, Shengyuan Xu, Jing Guo, Xuerui Yang

机构 * ACE Studio(ACE工作室) Step Fun

专题命中 后训练与偏好优化 :language model(abstract);foundation model(abstract)

AI总结 ACE-Step 1.5通过高效开源模型实现商业级音乐生成,结合内在强化学习与混合架构,支持多语言创作与风格控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02488 2026-02-04 cs.LG cs.AI cs.CL cs.CV 67%

RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System

RLAnything: 在完全动态的RL系统中动态生成环境、策略和奖励模型

Yinjie Wang, Tianbao Xie, Ke Shen, Mengdi Wang, Ling Yang

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLAnything通过动态生成环境、策略和奖励模型,在完全动态的RL系统中提升学习效果,显著提升多个任务的性能。

Comments Code: https://github.com/Gen-Verse/Open-AgentRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22950 2026-02-04 eess.AS 67%

DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching

DiffRhythm 2: 通过块流匹配实现高效高保真的歌曲生成

Yuepeng Jiang, Huakang Chen, Ziqian Ning, Jixun Yao, Zerui Han, Di Wu, Meng Meng, Jian Luan, Zhonghua Fu, Lei Xie

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract)

AI总结 DiffRhythm 2 通过块流匹配实现高效高保真的歌曲生成,解决歌词与 vocals 对齐及多偏好优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25562 2026-02-02 cs.AI cs.CL cs.CV cs.LG 67%

IRIS: Intrinsic Reward Image Synthesis

IRIS:内在奖励图像合成

Yihang Chen, Yuanhao Ban, Yunqi Hong, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles, USA(计算机科学系,加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IRIS通过内在奖励提升自回归T2I模型性能,改进图像生成质量并促进细致推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05688 2026-01-12 cs.CV 67%

SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More

SketchVL:通过细粒度信用分配进行政策优化以实现图表理解和更多

Muye Huang, Lingling Zhang, Yifei Li, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University, China(计算机科学与技术学院,西安交通大学) MOE KLINNS Lab, Xi’an Jiaotong University, China(教育部KLINNS实验室,西安交通大学) Zhongguancun Academy, Beijing, China(中关村学院,北京)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 SketchVL通过细粒度信用分配优化,提升多模态大语言模型在图表理解和多领域推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV 67%

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05242 2026-01-09 cs.CL cs.AI cs.LG 67%

GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

GDPO:多奖励强化学习优化中的组奖励解耦归一化策略优化

Shih-Yang Liu, Xin Dong, Ximing Lu, Shizhe Diao, Peter Belcak, Mingjie Liu, Min-Hung Chen, Hongxu Yin, Yu-Chiang Frank Wang, Kwang-Ting Cheng, Yejin Choi, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GDPO通过解耦奖励归一化提升多奖励强化学习优化的稳定性和准确性,优于GRPO。

Comments NVIDIA-Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏