arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2603.17808 2026-03-25 cs.RO cs.AI 57%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23007 2026-03-25 cs.CR cs.AI 57%

AgentRAE: Remote Action Execution through Notification-based Visual Backdoors against Screenshots-based Mobile GUI Agents

AgentRAE: 通过基于通知的视觉后门实现远程动作执行以对抗基于截图的移动GUI代理

Yutao Luo, Haotian Zhu, Shuchao Pang, Zhigang Lu, Tian Dong, Yongbin Zhou, Minhui Xue

机构 * Nanjing University of Science and Technology(南京理工大学) Macquarie University(麦考瑞大学) Western Sydney University(西澳大学) University of Hong Kong(香港大学) CSIRO’s Data61(澳大利亚CSIRO Data61)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 针对基于截图的移动GUI代理,提出AgentRAE通过自然视觉触发器诱导远程动作执行,采用两阶段管道提升代理对细微图标差异的敏感度,并通过后训练关联触发器与特定动作,实现高攻击成功率和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 57%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20639 2026-03-24 cs.AI 57%

Agentic AI and the next intelligence explosion

代理AI与下一次智能爆炸

James Evans, Benjamin Bratton, Blaise Agüera y Arcas

机构 * Paradigms of Intelligence Team, Google(谷歌智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣菲研究所) Antikythera, Berggruen Institute(安提基特拉与伯格格林研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 本文探讨代理AI如何通过模拟内部思想社会解决复杂任务,提出智能爆炸将不再是单一硅基脑,而是复杂社会结构。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20299 2026-03-24 cs.SE cs.AI 57%

HCAG: Hierarchical Abstraction and Retrieval-Augmented Generation on Theoretical Repositories with LLMs

HCAG:基于LLM的理论仓库中层次抽象与检索增强生成

Yusen Wu, Xiaotie Deng

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 HCAG通过层次化抽象与检索增强生成方法,解决复杂理论代码库中高层架构模式和跨文件依赖的捕捉问题,提升代码质量和架构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17295 2026-03-19 cs.CV cs.AI 57%

Directing the Narrative: A Finetuning Method for Controlling Coherence and Style in Story Generation

引导叙述:一种用于故事生成中控制连贯性和风格的微调方法

Jianzhang Zhang, Yijing Tian, Jiwang Qu, Chuang Liu

机构 * Department of Management Science and Engineering, Hangzhou Normal University(管理科学与工程系,杭州师范大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 本文提出一种两阶段框架,通过Group-Shared Attention和Direct Preference Optimization提升故事生成的连贯性和风格一致性,实验表明在ViStoryBench基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 57%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10205 2026-03-12 cond-mat.mtrl-sci cs.LG 57%

Flexible Cutoff Learning: Optimizing Machine Learning Potentials After Training

灵活截断学习:训练后优化机器学习势能

Rick Oerder, Jan Hamaekers

机构 * Institute for Numerical Simulation, University of Bonn(波恩大学数值模拟研究所) Fraunhofer Institute for Algorithms and Scientific Computing SCAI(弗劳恩霍夫算法与科学计算研究所SCAI)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 灵活截断学习通过训练后优化实现机器学习势能的精度-成本权衡优化,适用于多种应用需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13095 2026-03-11 cs.CV cs.LG 57%

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

ADHint: 基于难度先验的自适应提示用于强化学习

Feng Zhang, Zezhong Tan, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 ADHint通过整合难度先验,改进强化学习中的探索与模仿平衡,提升推理能力和分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12642 2026-03-11 cs.SE cs.AI quant-ph 57%

QSpark: Towards Reliable Qiskit Code Generation

QSpark:迈向可靠的Qiskit代码生成

Kiana Kheiri, Aamna Aamir, Andriy Miranskyy, Chen Ding

机构 * Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 QSpark通过GRPO和ORPO方法提升Qiskit代码生成的可靠性,在基准测试中取得显著成绩,但仍有提升空间。

Journal ref In Proceedings of the 3rd International Workshop on AI for Quantum and Quantum for AI (AIQxQIA 2025), co-located with ECAI 2025, CEUR Workshop Proceedings, Vol. 4153, Paper 6, pp. 1-12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07700 2026-03-10 cs.CV cs.AI 57%

TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward

TDM-R1: 通过非可微奖励强化少步扩散模型

Yihong Luo, Tianyang Hu, Weijian Luo, Jing Tang

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 TDM-R1通过非可微奖励强化少步扩散模型,提升文本到图像生成性能

Comments https://luo-yihong.github.io/TDM-R1-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07366 2026-03-10 cs.CL 57%

RILEC: Detection and Generation of L1 Russian Interference Errors in English Learner Texts

RILEC:检测和生成英语学习者文本中的L1俄语干扰错误

Darya Kharlamova, Irina Proskurina

机构 * Higher School of Economics(俄罗斯高等经济学院) Université Claude Bernard Lyon 1(克莱尔蒙特大学里昂1分校) Université Lumière Lyon 2(里昂2大学路易斯大学) ERIC(教育研究与创新中心)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 RILEC通过生成语言模型和增强方法,有效检测和生成英语学习者文本中的L1俄语干扰错误。

Comments 12 pages, 7 tables, 2 figures. Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06621 2026-03-10 cs.LG 57%

Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models

奖励在攻击下:分析过程奖励模型的鲁棒性和可hack性

Rishabh Tiwari, Aditya Tomar, Udbhav Bamba, Monishwaran Maheswaran, Heng Yang, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) Transmute AI ICSI(国际计算机科学研究所) LBNL(劳伦斯伯克利国家实验室)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 研究揭示了过程奖励模型在对抗性攻击下的脆弱性,指出其更像流畅性检测器而非推理验证器,并提出PRM-BiasBench用于评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01571 2026-03-03 cs.AI 57%

Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models

超越长度扩展:为生成奖励模型协同广度与深度

Qiyuan Zhang, Yufei Wang, Tianhe Wu, Can Xu, Qingfeng Sun, Kai Zheng, Xue Liu, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Tencent Hunyuan(腾讯文元) MBZUAI

专题命中 后训练与偏好优化 :SFT(abstract);分类 cs.AI

AI总结 本文提出Mix-GRM框架,通过协同广度与深度推理机制提升生成奖励模型的性能,实验显示在多个基准上超越现有模型8.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-03-02 cs.CL 57%

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23438 2026-03-02 cs.CV cs.AI 57%

DesignSense: A Human Preference Dataset and Reward Modeling Framework for Graphic Layout Generation

DesignSense: 一种用于图形布局生成的人类偏好数据集和奖励建模框架

Varun Gopal, Rishabh Jain, Aradhya Mathur, Nikitha SR, Sohan Patnaik, Sudhir Yarram, Mayur Hemani, Balaji Krishnamurthy, Mausoom Sarkar

机构 * MDSR, Adobe(MDSR,Adobe)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 DesignSense通过人类偏好数据集和奖励建模框架提升图形布局生成的质量和效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22226 2026-02-27 cs.IR cs.LG 57%

SEGB: Self-Evolved Generative Bidding with Local Autoregressive Diffusion

SEGB: 自适应生成性竞价与局部自回归扩散

Yulong Gao, Wan Jiang, Mingzhe Cao, Xuepu Wang, Zeyu Pan, Haonan Yang, Ye Liu, Xin Yang

机构 * Beijing China(中国北京)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 SEGB通过自适应生成性竞价与局部自回归扩散,实现动态市场中的高效竞价策略,显著提升广告效果与商业价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17025 2026-02-20 cs.LG 57%

WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning

WS-GRPO:弱监督组相对策略优化用于高效推理

Gagan Mundada, Zihan Huang, Rohan Surana, Sheldon Yu, Jennifer Yuntong Zhang, Xintong Li, Tong Yu, Lina Yao, Jingbo Shang, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) Adobe Research(Adobe研究) The University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 WS-GRPO 通过将终端奖励转换为正确性感知的指导,提高推理效率并减少冗余思考,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06355 2026-02-20 cs.CV cs.AI 57%

Di3PO - Diptych Diffusion DPO for Targeted Improvements in Image Generation

Di3PO - Diptych Diffusion DPO用于图像生成的针对性改进

Sanjana Reddy, Ishaan Malhi, Sally Ma, Praneet Dutta

机构 * Google(谷歌) DeepMind

专题命中 后训练与偏好优化 :SFT(abstract);分类 cs.AI

AI总结 Di3PO通过针对性改进图像生成中的特定区域,提升扩散模型的文本渲染性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03710 2026-02-19 cs.LG 57%

Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards

缩减方差:用于具有可验证奖励的强化学习的收缩基线

Guanning Zeng, Zhaoyi Zhou, Daman Arora, Andrea Zanette

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出了一种基于收缩估计的基线方法,用于改进具有可验证奖励的强化学习中策略梯度估计器的方差,通过结合每个提示和跨提示的均值来提高估计准确性。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16779 2026-02-18 cs.HC cs.LG 57%

Improving User Interface Generation Models from Designer Feedback

改进来自设计师反馈的用户界面生成模型

Jason Wu, Amanda Swearngin, Arun Krishna Vajjala, Alan Leung, Jeffrey Nichols, Titus Barik

机构 * Purdue University(普渡大学) Apple(苹果公司)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于设计师反馈的改进方法,通过评论、草图和直接操作等交互方式提升UI生成模型的质量,实验表明其优于传统排名反馈方法。

Comments Version accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23396 2026-02-13 physics.comp-ph cs.AI 57%

PINNs for Electromagnetic Wave Propagation

用于电磁波传播的PINNs

Nilufer K. Bulut

机构 * Izmir, Turkiye(土耳其伊兹密尔)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出混合训练策略,使PINNs在电磁波传播中实现与FDTD相当的精度和能量守恒性能。

Comments v2: corrected typos and improved wording; corrected Poynting loss weight; added an additional high-frequency scenario with corresponding results and discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11328 2026-02-13 cs.CL 57%

Evaluating Alignment of Behavioral Dispositions in LLMs

评估大语言模型中行为倾向的对齐情况

Amir Taubenfeld, Zorik Gekhman, Lior Nezry, Omri Feldman, Natalie Harris, Shashir Reddy, Romina Stella, Ariel Goldstein, Marian Croak, Yossi Matias, Amir Feder

机构 * Google(谷歌)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 本研究通过情境判断测试评估大语言模型行为倾向与人类倾向的对齐情况,发现模型在不同共识场景下表现出过度自信、偏离共识及跨模型特质模式,揭示了LLMs声明价值与实际行为之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17247 2026-02-12 cs.CL cs.CV 57%

From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models

从偏好到偏见:对齐调谐在视频扩散模型中塑造社会偏见的作用

Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) Microsoft(微软公司)

专题命中 后训练与偏好优化 :prompting(abstract);分类 cs.CL

AI总结 本文研究了对齐调谐在视频扩散模型中如何塑造社会偏见,提出VideoBiasEval框架以评估和缓解偏见,揭示了对齐调谐使偏见更稳定且刻板化的现象。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09538 2026-02-11 cs.CL 57%

UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment

UniARM: 向多目标测试时间对齐的统一自回归奖励模型迈进

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuan Huang, Deqing Wang, Jianxin Li, Yitong Yao, Chao Wang, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 UniARM通过统一自回归奖励模型实现多目标测试时间对齐,通过共享特征和偏好调节模块减少特征纠缠,提升对偏好权衡的控制能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05787 2026-02-11 cs.AI 57%

From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation

从离线到在线:通过双层专家到策略融合提升GUI代理

Zezhou Wang, Ziyun Zhang, Xiaoyi Zhang, Zhuzhong Qian, Yan Lu

机构 * Nanjing University(南京大学) Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 BEPA通过双层专家到策略融合方法,提升GUI代理在OSWorld-Verified等基准测试中的性能。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07595 2026-02-10 cs.CV cs.AI 57%

TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation

TeleBoost:一种系统对齐框架,用于高保真、可控且稳健的视频生成

Yuanzhi Liang, Xuan'er Wu, Yirui Liu, Yijie Fang, Yizhen Fan, Ke Hao, Rui Li, Ruiying Liu, Ziqi Ni, Peng Yu, Yanbo Wang, Haibin Huang, Qizhen Weng, Chi Zhang, Xuelong Li

机构 * TeleBoost Team(TeleBoost团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 TeleBoost提出了一种系统化的训练后框架,通过整合监督策略塑造、奖励驱动强化学习和偏好细化,提升视频生成的保真度、时间连续性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16725 2026-02-03 cs.AI 57%

LongCat-Flash-Thinking-2601 Technical Report

LongCat-Flash-Thinking-2601 技术报告

Meituan LongCat Team, Anchun Gui, Bei Li, Bingyang Tao, Bole Zhou, Borun Chen, Chao Zhang, Chao Zhang, Chen Gao, Chen Zhang, Chengcheng Han, Chenhui Yang, Chuyu Zhang, Cong Chen, Cunguang Wang, Daoru Pan, Defei Bu, Dengchang Zhao, Di Xiu, Dishan Liu, Dongyu Ru, Dunwei Tu, Fan Wu, Fengcheng Yuan, Fengcun Li, Gang Xu, Guanyu Wu, Guoyuan Lin, Haibin Wang, Hansi Yang, Hao Yang, Haonan Yan, Haoxiang Ma, Haoxing Wen, Hongyan Hao, Hongyin Tang, Hongyu Zang, Hongzhi Ni, Hui Su, Jiacheng Zhang, Jiahong Zhou, Jiahuan Li, Jiaming Wang, Jian Yang, Jianfei Zhang, Jianhao Xu, Jianing Wang, Jiapeng Zhu, Jiaqi Sun, Jiarong Shi, Jiarui Zhao, Jingang Wang, Jinluan Yang, Jinrui Ding, Jinwei Xiao, Jiyuan He, Juncan Xu, Kefeng Zhang, Keheng Wang, Li Wei, Lianhui Ma, Lin Qiu, Lingbing Kong, Lingchuan Liu, Linsen Guo, Mengshen Zhu, Mengxia Shen, Mingyang Zhu, Peiguang Li, Peng Pei, Peng Zhao, Pengcheng Jia, Pengtao Zhang, Ping Liu, Qi Gu, Qiong Huang, Qiyuan Duan, Quanchi Weng, Rongxiang Weng, Rongzhi Zhang, Rumei Li, Shanglin Lei, Shengnan An, Shijun Dai, Shizhe Wu, Shuaikang Liu, Shuang Zhou, Shuo Wang, Songyuan Zhao, Tao Liang, Tianhao Hu, Tianze Chen, Wei Liu, Wei Shi, Wei Wang, Weifeng Tang, Wenjie Shi, Wenlong Zhu, Wentao Chen, Wentao Shi, Xi Su, Xiandi Ma, Xiangcheng Liu, Xiangyu Xi, Xiangyuan Liu, Xiangzhou Huang, Xiao Liu, Xiaodong Cai, Xiaolong Chen, Xiaowei Shi, Xiaoyu Li, Xin Chen, Xingchen Liu, Xuan Huang, Xuezhi Cao, Xunliang Cai, Yan Chen, Yang Bai, Yang Liu, Yang Yang, Yang Zheng, Yanyu Chen, Yaoming Wang, Yaoming Zhu, Yaorui Shi, Yaqi Huo, Yerui Sun, Yi Zhang, Yi-Kai Zhang, Yifan Lu, Yifan Zhao, Yihao Chen, Yitao Zhai, Yongjing Yin, Yongwei Zhou, Youshao Xiao, Yu Wang, Yu Yang, Yuchen Xie, Yuchen Yu, Yuchuan Dai, Yue Xu, Yueqing Sun, Yufei Zhang, Yuhuai Wei, Yulei Qian, Yunfan Liang, Yunke Zhao, Yuwei Jiang, Yuxin Bian, Yuxin Chen, Yuxin Liu, Zeyang Yu, Zhao Yang, Zhengsheng Huang, Zhengyu Chen, Zhijian Liu, Zhikang Xia, Zhimin Lin, Zhiyuan Yao, Zhuofan Chen, Zhuowen Han, Zijian Zhang, Ziran Li, Ziwen Wang, Ziyuan Zhuang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 LongCat-Flash-Thinking-2601是一款拥有5600亿参数的开源混合专家推理模型,通过统一训练框架和Heavy Thinking模式,在代理推理任务中表现出卓越的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00724 2026-02-03 cs.LG cs.IR 57%

UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking

UMM-RM: 一种用于缓解奖励黑客的升级和合并MoE奖励模型

Lingling Fu, Yongfu Xue

机构 * Guangxi University(广西大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 UMM-RM通过升级和合并MoE架构,提升奖励模型的鲁棒性和抗利用性,减少奖励黑客并提高偏好一致性。

Comments 8 pages,14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23135 2026-02-02 cs.LG 57%

Why GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive Gradients

为何GRPO需要规范化:从局部曲率角度探讨自适应梯度

Cheng Ge, Caitlyn Heqi Yin, Hao Liang, Jiawei Zhang

机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与宇航系) Department of Statistics, University of Wisconsin--Madison(威斯康星大学麦迪逊分校统计系) Department of Informatics, King's College London(伦敦国王学院信息学系) Department of Computer Sciences, University of Wisconsin--Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 GRPO中标准差规范化通过局部曲率视角解释了其自适应梯度机制,理论和实验表明规范化能提升收敛速度并优化训练阶段表现。

详情

展开后加载摘要…

URL PDF HTML 收藏