arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2605.26628 2026-05-27 cs.AI 79%

Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2

Tail-Aware HiFloat4: 面向Wan2.2的W4A4训练后量化

Zhanfeng Feng, Shuai Guo, Xin Di, Long Peng, Yang Cao, Zhengjun Zha

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 提出Tail-Aware HiFloat4方法,通过感知激活尾部的百分位校准和紧凑PTQ状态恢复,在HiFloat4数值格式下对Wan2.2进行W4A4训练后量化,减少罕见校准异常值的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07211 2026-05-27 cs.LG 79%

CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment

CompassDPO: 用于鲁棒安全对齐的动态控制直接偏好优化

Jilong Liu, Yonghui Yang, Pengyang Shao, Wenjian Tao, Hao Zhan, Haokai Ma, Wei Qin, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 提出CompassDPO,通过隐式DPO奖励边际控制更新方向和幅度,无需外部奖励模型,在PKU-SafeRLHF等基准上提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21123 2026-05-21 cs.CV cs.LG 79%

Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models

Linear-DPO: 用于扩散和流匹配生成模型的线性直接偏好优化

Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出Linear-DPO,通过统一的反向时间SDE框架推导出涵盖扩散和流匹配的通用DPO目标,指出标准DPO目标在文本到图像生成中不最优,并通过定性定量实验验证了其在扩散模型和流匹配模型上的优越性。

Comments Code and models are available at: https://github.com/Whynot0101/Linear-DPO . Work done during an internship at Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20696 2026-05-21 cs.LG 79%

Distributed Direct Preference Optimization

分布式直接偏好优化

Zhanhong Jiang

机构 * Translational AI Center, Iowa State University, Ames, USA(翻译人工智能中心,爱荷华州立大学,爱荷华州阿姆斯)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文研究了在分布式环境中直接偏好优化(DPO)的收敛性和时间复杂度,分析了联邦学习和去中心化学习中偏好数据碎片化对优化动态的影响,并提出了具有理论保证的鲁棒且可扩展的实现实现方法。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04068 2026-05-21 cs.CV cs.AI 79%

Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models

注意生成细节:面向视频扩散模型的直接局部化细节偏好优化

Zitong Huang, Kaidong Zhang, Yukang Ding, Chao Gao, Rui Ding, Ying Chen, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Alibaba Group - Taobao & Tmall Group(阿里巴巴集团-淘宝 & 天猫集团)

专题命中 后训练与偏好优化 :preference optimization(title);post-training(abstract);分类 cs.AI

AI总结 本文提出LocalDPO,一种新的后训练框架,通过从真实视频中构建局部偏好对,并在时空区域层面优化对齐,以提高视频生成的质量和人类偏好评分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15803 2026-05-18 cs.CV cs.LG 79%

Embedding-perturbed Exploration Preference Optimization for Flow Models

嵌入扰动探索偏好优化用于流模型

Sujie Hu, Chubin Chen, Jiashu Zhu, Jiahong Wu, Xiangxiang Chu, Xiu Li

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06239 2026-05-18 cs.LG 79%

Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution

可证明地避免在不了解数据分布的情况下直接偏好优化中的过度优化

Adam Barla, Emanuele Nevali, Luca Viano, Volkan Cevher

机构 * EPFL(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 PEPO通过训练不同数据子集的偏好优化策略并聚合最坏情况,避免了过度优化问题,其样本复杂度仅依赖单策略集中性系数,保持了DPO的简洁性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13229 2026-05-14 cs.AI cs.SE 79%

Improving Code Translation with Syntax-Guided and Semantic-aware Preference Optimization

通过语法引导和语义感知的偏好优化改进代码翻译

Yuhan Wu, Huan Zhang, Wei Cheng, Chen Shen, Jingyue Yang, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University, China(南京大学健康数据科学国家研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出CTO方法,通过对比学习训练跨语言语义模型,结合编译器反馈实现代码翻译的语法和语义优化,实验表明其在C++、Java和Python翻译中表现优异。

Comments Accepted in the 35th International Joint Conference on Artificial Intelligence (IJCAI 2016)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13130 2026-05-14 cs.AI 79%

GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

GRACE:基于梯度对齐的推理数据整理以实现高效的后训练

Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist 大学) City University of Hong Kong, China(香港城市大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 GRACE通过梯度对齐方法,对推理数据进行高效后训练,仅用20%的数据即可达到全数据性能的108.8%,5%数据仍保持100.2%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12435 2026-05-13 cs.LG cs.CE 79%

Environment-Adaptive Preference Optimization for Wildfire Prediction

环境适应性偏好优化用于野火预测

Enyi Jiang, Wu Sun

机构 * Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Global Ecology, Carnegie Institution for Science(卡内基科学研究所全球生态系部门)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出环境适应性偏好优化框架,通过构造分布对齐数据集并结合监督学习与偏好优化,提升野火预测在环境变化下的鲁棒性与极端情况下的检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22507 2026-05-13 cs.LG cs.CV 79%

Space Syntax-guided Post-training for Residential Floor Plan Generation

基于空间语法的后训练生成住宅平面图

Zhuoyang Jiang, Dongqing Zhang

机构 * College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)信息中心)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 本文提出SSPT框架,通过空间语法集成 oracle 评估生成平面图的空间配置质量,改进生成器的配置逻辑,SSPT-PPO在非分布环境下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16070 2026-05-13 cs.CL 79%

Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants

减少冗余:提升视觉语言模型在行走助手中的实用性

Chongyang Li, Zhiqiang Yuan, Hanbo Bi, Zexi Jia, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出WalkVLM-LR模型,通过优化输出和时间冗余,提升视觉语言模型在行走助手中的实用性,实验表明其在输出简洁性和时间冗余方面表现优异。

Comments ICASSP 2026 Best Industry Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11734 2026-05-12 cs.RO cs.AI 79%

SCORP: Scene-Consistent Multi-agent Diffusion Planning with Stable Online Reinforcement Post-Training for Cooperative Driving

SCORP:具有稳定在线强化学习后训练的场景一致多智能体扩散规划用于协作驾驶

Haojie Bai, Aimin Li, Ruoyu Yao, Xiongwei Zhao, Tingting Zhang, Xing Zhang, Lin Gao, and Jun Ma

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Middle East Technology University (METU)(中东技术大学) Robotics and Autonomous Systems Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) School of Computer Science and Technology, Qinghai University(青海大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 SCORP通过场景条件多智能体去噪架构和两层马尔可夫决策过程提升多智能体协作驾驶的场景一致性和效率,实验表明其在安全性和效率指标上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05946 2026-05-12 cs.LG stat.ML 79%

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

f-GRPO 与 beyond:基于发散性的强化学习算法用于通用大语言模型对齐

Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

机构 * Department of Statistics, Purdue University(普渡大学统计学系) Department of Statistics, Michigan State University(密歇根州立大学统计学系)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出f-GRPO和f-HAL算法,通过发散性估计提升大语言模型对齐效果,在数学推理任务中改进GRPO并缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17879 2026-05-12 cs.LG cs.SD 79%

Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction

生成对抗式后训练缓解实时人机音乐交互中的奖励黑客

Yusong Wu, Stephen Brade, Aleksandra Teng Ma, Tia-Jane Fowler, Enning Yang, Berker Banar, Aaron Courville, Natasha Jaques, Cheng-Zhi Anna Huang

机构 * Mila, Quebec Artificial Intelligence Institute, Université de Montréal(蒙特利尔大学人工智能研究所,魁北克机器学习研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) University of Washington(华盛顿大学) McGill University(麦吉尔大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 本文提出一种对抗训练方法,通过政策生成轨迹缓解生成序列模型后训练中的奖励黑客问题,提升音乐伴奏的多样性与和谐性。

Comments v3: fix the Figure numbering bugs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07701 2026-05-11 cs.CL 79%

Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models

指导不是超参数:在扩散语言模型中学习动态控制

Fan Zhou, Tim Van de Cruys

机构 * KU Leuven(卢森堡大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出通过强化学习学习动态指导轨迹,以解决扩散模型中指导尺度固定导致的可控性与生成质量平衡问题。

Comments ReALM-GEN@ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI 79%

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07011 2026-05-11 cs.LG 79%

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

双代理协同训练用于健康教练的隐式对抗偏好优化

Da Long, Lingyi Fu, Diya Michelle Rao, Jasmine Ruales Carrera, Yang Bai, Shandian Zhe

机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract);分类 cs.LG

AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24953 2026-04-30 cs.CV cs.AI 79%

ViPO: Visual Preference Optimization at Scale

ViPO:大规模视觉偏好优化

Ming Li, Jie Wu, Justin Cui, Xiaojie Li, Rui Wang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学) ByteDance Seed(字节跳动种子) UCLA(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出ViPO大规模偏好数据集和Poly-DPO方法,通过提升数据质量和算法鲁棒性,实现视觉生成模型的高效偏好优化。

Comments ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24952 2026-04-29 cs.CV cs.AI 79%

Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization

从噪声偏好学习:一种半监督学习方法用于直接偏好优化

Xinxin Liu, Ming Li, Zonglin Lyu, Yuzhang Shang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出Semi-DPO方法,通过半监督学习处理多维偏好噪声,提升复杂人类偏好对齐性能,无需额外人工标注或显式奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 79%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19749 2026-04-23 cs.AI cs.SE 79%

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

工具过度使用错觉:为什么大语言模型更倾向于使用外部工具而非内部知识?

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology, SCIR(哈尔滨理工大学SCIR研究所) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :LLM(title);preference optimization(abstract);分类 cs.AI

AI总结 本文揭示大语言模型在推理中普遍存在工具过度使用现象,通过分析内部知识可用性区域,提出知识感知边界对齐策略,减少工具使用82.8%,并发现仅以结果奖励会鼓励工具过度使用,通过平衡奖励信号可减少66.7%的无用工具调用。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07527 2026-04-23 cs.LG 79%

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

卡尔曼滤波增强的GRPO用于基于强化学习的语言模型推理

Hu Wang, Congbo Ma, Ian Reid, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

AI总结 本文提出KRPO,通过卡尔曼滤波估计潜在提示级奖励基线,提升语言模型推理的训练奖励和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20816 2026-04-23 cs.LG cs.CV 79%

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

ParetoSlider:扩散模型后训练用于连续奖励控制

Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) Lightricks(Lightricks公司) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 ParetoSlider提出多目标强化学习框架,通过连续变化的偏好权重训练单个扩散模型,实现推理时对冲突目标的精细控制。

Comments Project page: https://shelley-golan.github.io/ParetoSlider-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18473 2026-04-21 cs.LG 79%

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts

分开训练,合并一起:模块化后训练与专家混合

Jacob Morrison, Sanjay Adhikesaven, Akshita Bhagia, Matei Zaharia, Noah A. Smith, Sewon Min

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);分类 cs.LG

AI总结 本文提出BAR方法,通过独立训练领域专家并采用专家混合架构实现高效更新,避免了传统重训练的高成本和性能下降问题,实验显示其在多个领域任务中表现优异。

Comments 9 content pages, 23 pages overall, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00361 2026-04-17 cs.LG 79%

Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach

基于原始能力的分层强化学习的直接偏好优化:双层方法

Utsav Singh, Souradip Chakraborty, Wesley A. Suttle, Brian M. Sadler, Derrik E. Asher, Anit Kumar Sahu, Mubarak Shah, Vinay P. Namboodiri, Amrit Singh Bedi

机构 * IIT Kanpur(印度理工学院坎浦尔分校) University of Maryland, College Park(马里兰大学学院公园分校) U.S. Army Research Laboratory(美国陆军研究实验室) University of Texas, Austin(德克萨斯大学奥斯汀分校) Oracle(Oracle公司) University of Central Florida(中央佛罗里达大学) University of Bath(巴斯大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出DIPPER框架,通过双层优化解决分层强化学习中的非平稳性和不可行子目标问题,采用直接偏好优化提升高层策略性能,实验证明在机器人导航和操作任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11477 2026-04-14 cs.AI cs.SE q-fin.TR 79%

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

OOM-RL:基于大语言模型多智能体系统的出钱强化学习市场驱动对齐

Kun Liu, Liqun Chen

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.AI

AI总结 本文提出OOM-RL方法,通过将智能体部署到金融市场中,利用资本耗尽作为不可篡改的负梯度,使多智能体系统从过度迎合的基线进化为稳健的流动性感知架构,最终实现稳定均衡。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01840 2026-04-09 cs.AI 79%

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

并非所有token都同等重要:基于感知的策略优化方法用于大型视觉-语言模型

Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 本文提出基于感知的策略优化方法PGPO,通过动态调整token级别的优势,提升多模态推理的鲁棒性与稳定性,实验显示在多个基准上提升18.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04855 2026-04-07 cs.LG 79%

The Role of Generator Access in Autoregressive Post-Training

生成器访问在自回归后训练中的作用

Amit Kiran Rege

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 研究生成器访问对自回归后训练的限制,探讨学习者是否能返回已有前缀查询下一个词规则,分析不同控制方式对训练效果的影响。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22601 2026-03-31 cs.LG cs.CV 79%

$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

$ϕ$-DPO:面向大多模态模型持续学习的公平性直接偏好优化方法

Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas(阿肯色大学 CVIU 实验室) Dep. of Geosciences, University of Arkansas(阿肯色大学地球科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出$ϕ$-DPO框架,通过直接偏好优化缓解持续学习中的灾难性遗忘问题,并解决数据不平衡导致的公平性问题,实验表明其在多个基准上表现优异。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏