arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2606.17470 2026-06-17 cs.CY cs.HC 新提交 50%

Self-Efficacy and Favorability Shape Learning from Tutoring Systems and Paper Practice

自我效能感和偏好影响辅导系统与纸质练习的学习效果

Xinfei Cen, Vincent Aleven, Kenneth R. Koedinger, Conrad Borchers, Paulo F. Carvalho

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 研究通过平衡被试内设计,发现低基线自我效能感的学生无论练习形式如何都获得更大学习收益,且对辅导系统的偏好与学习收益正相关,但纸质练习模式不同;基于智能辅导系统的练习并未显著提升自我效能感。

Comments Full research paper accepted at EC-TEL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10495 2026-06-16 cs.RO 新提交 50%

Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models

Act on What You See: 在视觉-语言-动作模型中解锁安全社交导航

Qingzi Wang, Xiyang Wu, Guangyao Shi, Dianwei Chen, Xianfeng Yang, Dinesh Manocha

机构 * University of Maryland(马里兰大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出SALSA框架,通过两阶段无标注后训练(社交行为对齐和时间安全对齐),使预训练VLA模型利用已有表征实现安全社交导航,减少86.4%的近距离碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09296 2026-06-16 cs.CY 版本更新 50%

If open source is to win, it must go public

如果开源要获胜,它必须走向公共

Joshua Tan, Nicholas Vincent, Katherine Elkins, Magnus Sahlgren, Joseph Low, David Pham, Sampo Pyysalo, Jenia Jitsev

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文主张开源AI必须由公共AI补充,即建设公共基础设施和机构,以确保模型在公共利益下可访问、可持续和受治理。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14162 2026-06-15 cs.CV 新提交 50%

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14086 2026-06-15 cs.SD 新提交 50%

Explainable and Trustworthy Speech Emotion Recognition Using Confidence Score and Reinforcement Learning Rectified Speech Emotion Descriptors

使用置信度分数和强化学习修正语音情感描述子的可解释且可信的语音情感识别

Youjun Chen, Xurong Xie, Mengzhe Geng, Zengrui Jin, Jiajun Deng, Guinan Li, Shujie Hu, Huimeng Wang, Haoning Xu, Chengxi Deng, Bowen Zhang, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Research Council Canada(加拿大国家研究委员会) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出基于置信度分数和强化学习的在线语音情感描述子修正方法,用于后训练语音情感识别系统,在IEMOCAP和MELD上分别取得2.9%和3.3%的绝对性能提升。

Comments Accepted by Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13676 2026-06-12 cs.CV 新提交 50%

Modality Forcing for Scalable Spatial Generation

模态强制实现可扩展的空间生成

Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski, Justin Johnson, Keunhong Park

机构 * Carnegie Mellon University(卡内基梅隆大学) World Labs

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出Modality Forcing方法,通过为每个模态分配独立噪声水平,实现单DiT的联合图像-深度生成,利用稀疏深度数据训练,继承T2I预训练的可扩展性,在深度估计上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09486 2026-06-09 cs.MM 新提交 50%

LangRetrieval: Language-Guided Self-Evolving Satellite-to-Radar Retrieval via CSI-Driven Reward

LangRetrieval: 基于CSI驱动奖励的语言引导自进化卫星到雷达检索

Chunlei Shi, Junming Hou, Yi-Lin Wei, Jiong Wang, Yecheng Zhang, Yichao Dong, Wenqi Ren, Dan Niu

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 提出LangRetrieval框架,通过语言引导的条件流匹配和自进化语义优化,利用多阈值CSI奖励提升卫星到雷达降水检索精度。

Comments 17 pages, 9 figures. Submitted to IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06556 2026-06-08 cs.RO 新提交 50%

Robots Need More than VLA and World Models

机器人需要的不仅仅是VLA和世界模型

Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar

机构 * Motoniq.ai Stanford University(斯坦福大学) Istituto Italiano di Tecnologia(意大利技术研究院) ETH Zurich(苏黎世联邦理工学院) Technical University of Darmstadt(德累斯顿技术大学) UCL Centre for AI(伦敦大学学院人工智能中心)

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 本文认为机器人通用智能的关键瓶颈不仅是策略学习,还缺乏将非结构化行为数据转化为机器人可用监督的机制,并提出了四种缺失的接口组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03240 2026-06-03 cs.RO 50%

GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models

GeoAlign: VLA模型中的状态引导空间对齐超越语义

Yizhi Chen, Zhanxiang Cao, Xinyi Peng, Yixiao Zheng, Xiaxi Si, Yiheng Li, Liyun Yan, Keqi Zhu, Xueyun Chen, Shengcheng Fu, Tianyue Zhan, Yufei Jia, Jinming Yao, Yan Xie, Kun Wang, Cewu Lu, Yue Gao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Jingdezhen Ceramic University(景德镇陶瓷大学) Tsinghua University(清华大学) HONOR(HONOR公司) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出GeoAlign架构,通过RGB几何分支的后训练和机器人本体状态引导的几何特征查询,实现几何感知的空间对齐和动态可供性选择,在多个基准上取得高性能。

Comments 20 pages, 9 figures, 8 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19995 2026-06-03 cs.CV 50%

CREward: A Type-Specific Creativity Reward Model

CREward:一种类型特定的创造力奖励模型

Jiyeon Han, Ali Mahdavi-Amiri, Hao Zhang, Haedong Jeong

机构 * Simon Fraser University(西蒙弗雷泽大学) Sogang University(首尔大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 提出首个类型特定的创造力奖励模型CREward,通过几何、材质和纹理三个轴评估创造力,并应用于创造力评估、可解释创造力及创意样本获取。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01036 2026-06-02 cs.RO 50%

Position: Good Embodied Reward Models Need Bad Behavior Data

立场:好的具身奖励模型需要不良行为数据

Ran Tian, Yilin Wu, Andrea Bajcsy

机构 * Ran Tian, Yilin Wu, Andrea Bajcsy

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 本文主张为获得可靠的具身奖励模型,社区必须投资于“不良”机器人数据(失败、次优、易错甚至危险行为),并通过实验证明即使少量真实不良数据也能改善与人类偏好的一致性。

Comments This position paper has been accepted by the ICML 2026 position track as a spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30993 2026-06-01 eess.AS 50%

SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue

SwanVoice: 面向独白与对话的表现力长文本零样本语音合成

Ruiqi Li, Yu Zhang, Changhao Pan, Ke Lei, Xiang Yin, Cheng Yang

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出SwanVoice零样本TTS模型,通过构建独白与对话语料库、结合VAE、原始文本条件与流匹配DiT,以及两阶段训练和强化学习后训练,在长文本多说话人对话中实现表现力连贯性和可控切换。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27154 2026-05-27 cs.CV 50%

Touch-R1: Reinforcing Touch Reasoning in MLLMs

Touch-R1:在多模态大语言模型中强化触觉推理

Yingxin Lai, Yafei Zhou, Fucai Zhu, Siyu Zhu, Weihao Yuan

机构 * Xiamen University(厦门大学) Great Bay University(大湾大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达摩机器人)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 针对触觉推理中物理属性序数性和跨传感器分布偏移的挑战,提出基于触觉接地GRPO目标训练的Touch-R1模型,在TouchReason-Bench上平均性能超过Octopi-13B和GPT-4o。

Comments Our code and data will be made public on the https://laiyingxin2.github.io/Projects

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26451 2026-05-27 cs.HC cs.CV 50%

Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation

先设计,后编码:无模板的美观幻灯片生成

Zhiyao Cui, Chenxu Wang, Shuyue Hu, Yiqun Zhang, Wenqi Shao, Qiaosheng Zhang, Zhen Wang

机构 * School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络安全学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn)

AI总结 提出DeepSlides层次化幻灯片生成流程,通过解耦设计与实现、引入SlideDesign数据集和多智能体强化学习训练范式,在无模板条件下生成高质量幻灯片。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05729 2026-05-27 cs.CV 50%

TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment

TAGRPO: 通过直接轨迹对齐提升图像到视频生成中的GRPO

Jin Wang, Jianxiang Lu, Guangzheng Xu, Comi Chen, Haoyu Yang, Linqing Wang, Peng Chen, Mingtao Chen, Zhichao Hu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文心)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对图像到视频生成中GRPO优化效果不佳的问题,提出基于对比学习的TAGRPO框架,通过中间潜变量对齐高奖励轨迹并远离低奖励轨迹,结合记忆库提升多样性,显著优于DanceGRPO。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06508 2026-05-26 cs.RO 50%

World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy

World-VLA-Loop: 视频世界模型与VLA策略的闭环学习

Xiaokang Liu, Zechen Bai, Hai Ci, Kevin Yuchen Ma, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出World-VLA-Loop框架,通过状态感知视频世界模型联合预测未来帧和二元奖励,并采用协同进化范式迭代优化VLA策略,减少对真实环境交互的依赖。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05202 2026-05-25 cs.CV 50%

GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

GT-SVJ: 基于生成式Transformer的自监督视频评判器用于高效视频奖励建模

Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki, Mehrab Tanjim, Somdeb Sarkhel, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Inc.(Adobe公司)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 提出GT-SVJ,通过将视频生成模型重新用作能量模型,并利用对比目标训练,实现高效、时间感知的视频质量评估,在少量标注下达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13056 2026-05-25 eess.SY cs.SY 50%

Simultaneous Online System Identification and Control using Composite Adaptive Lyapunov-Based Deep Neural Networks

基于复合自适应李雅普诺夫深度神经网络的在线系统辨识与同步控制

Omkar Sudhir Patil, Emily J. Griffis, Wanjiku A. Makumi, Warren E. Dixon

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对非线性系统,提出一种基于李雅普诺夫稳定性分析的深度神经网络在线自适应更新方法,同时实现系统辨识与轨迹跟踪,并保证跟踪误差、状态导数估计误差和网络权重估计误差一致最终有界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19678 2026-05-20 cs.RO 50%

RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models

RoVLA: 多一致性约束用于鲁棒的视觉-语言-动作模型

Jingzhou Luo, Yifan Wen, Yongjie Bai, Xinshuai Song, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出RoVLA框架,通过多一致性约束提升视觉-语言-动作模型的鲁棒性,通过指令语义、轨迹演变和观察扰动三种互补变换增强模型的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08659 2026-05-20 cs.CE q-bio.BM 50%

Pushing Biomolecular Utility-Diversity Frontiers with Supergroup Relative Policy Optimization

通过超组相对策略优化推动生物分子效用-多样性前沿

Xinwu Ye, He Cao, Hao Li, Bin Feng, Zijing Liu, Xiangru Tang, Yu Li, Shenghua Gao

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出了一种灵活的GRPO风格框架SGRPO,通过直接构造集级别多样性奖励来维持生成多样性,从而在小分子设计、口袋基小分子设计和原生蛋白设计中扩展效用-多样性帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17766 2026-05-19 cs.CV 50%

LatentUMM: Dual Latent Alignment for Unified Multimodal Models

LatentUMM: 双重潜在对齐用于统一多模态模型

Yinyi Luo, Wenwen Wang, Hayes Bai, Marios Savvides, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出LatentUMM,通过构建增强的共享潜在空间,显式对齐映射到和从潜在空间的转换,提高跨模态一致性。实验表明,该方法在多种架构上一致提升了多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17352 2026-05-19 cs.CV 50%

Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey

通过强化学习和奖励建模对扩散模型的对齐与安全性:综述

Preeti Lamba, Kiran Ravish, Ankita Kushwaha, Pawan Kumar

机构 * International Institute of Information Technology(国际信息科技学院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文综述了通过强化学习、奖励建模等方法对文本到图像扩散模型进行对齐和安全性的最新进展,探讨了反馈来源、奖励信号形式、优化机制等五个维度,并提出了多目标对齐、反馈高效偏好学习等开放性挑战。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16246 2026-05-18 stat.ME stat.ML 50%

FRESH: Information-Geometric Calibration of Patient-Level Models to Aggregate Evidence

FRESH:信息几何校准患者级模型以聚合证据

Franklin Fuller, Daniele Bertolini, Samantha Liang, Jason Christopher, Aaron M. Smith

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 FRESH通过信息几何方法将群体层面结果与患者层面数据结合,提升临床决策模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15951 2026-05-18 cs.CV 50%

From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

从失败到反馈:群体修订解锁对象级 grounding 的难题

Yuyuan Liu, Yiping Ji, Anjie Le, Jiayuan Zhu, Jiazhen Pan, Can Peng, Jiajun Deng, Fengbei Liu, Junde Wu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Technical University of Munich(慕尼黑技术大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 本文提出群体修订优化方法,通过生成改进候选响应提升硬案例学习效果,改进奖励和优势函数以增强高质量修订影响,优于现有GRPO方法。

Comments 8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02491 2026-05-18 eess.SP 50%

Lightweight Diffusion Models for Resource-Constrained Semantic Communication

轻量级扩散模型用于资源受限的语义通信

Giovanni Pignata, Eleonora Grassucci, Giordano Cicchetti, Danilo Comminiello

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出Q-GESCO框架,通过量化扩散模型减少计算和内存负载,实现语义通信的高效再生,节省75%内存和79%浮点运算。

Journal ref IEEE Wireless Communications Letters, volume 14 issue 9, september 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18719 2026-05-18 cs.CV 50%

Seeing What Matters: Visual Preference Policy Optimization for Visual Generation

看见重要之物:面向视觉生成的视觉偏好策略优化

Ziqi Ni, Yuanzhi Liang, Rui Li, Yi Zhou, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Southeast University(东南大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出ViPO,一种改进的GRPO方法,通过结构化像素级优势图提升视觉生成的对齐和泛化能力,优于传统GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14891 2026-05-15 cs.CV 50%

Hierarchical Image Tokenization for Multi-Scale Image Super Resolution

多尺度图像超分辨率的分层图像标记

Isma Hadji, Enrique Sanchez, Adrian Bulat, Brais Martinez, Georgios Tzimiropoulos

机构 * Samsung AI Center Cambridge, UK(三星AI研究中心(剑桥,英国)) Technical University of Iasi, Romania(亚西技术大学(罗马尼亚)) Queen Mary University of London, UK(伦敦女王玛丽大学(英国))

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出基于视觉自回归模型的多尺度图像超分辨率方法,通过引入分层图像标记和直接偏好优化正则化项,提升模型灵活性与效率,实现无需外部数据的高精度多尺度输出。

Comments Accepted for publication at ICML 2026. *Joint first authorship (alphabetical order). arXiv admin note: substantial text overlap with arXiv:2506.04990

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14274 2026-05-15 cs.CV 50%

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

CreFlow:稀疏奖励具身视频扩散强化学习的纠正回流

Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

机构 * Northwestern University(西北大学) University of California, San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出CreFlow框架,通过信用感知NFT损失和纠正回流损失提升高维视频生成性能,有效解决稀疏奖励下的具身任务执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14068 2026-05-15 cs.CV 50%

CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning

CoCoEdit:通过区域正则化的强化学习实现内容一致的图像编辑

Yuhui Wu, Chenxi Xie, Ruibin Li, Liyi Chen, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University, Hong Kong(香港理工大学) OPPO Research Institute, ShenZhen, China(OPPO研究院,深圳,中国)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出CoCoEdit框架,通过区域正则化强化学习提升图像编辑内容一致性,利用改进的指令和掩码生成高质量训练集,并引入像素相似度奖励和区域正则化器,提升编辑质量和一致性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13155 2026-05-14 cs.CV 50%

Pareto-Guided Optimal Transport for Multi-Reward Alignment

基于帕累托前沿的多奖励对齐最优传输

Ying Ba, Tianyu Zhang, Mohan Zhou, Yalong Bai, Wenyi Mo, Guiwei Zhang, Bing Su, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程技术研究中心) Rutgers University(罗格斯大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出帕累托前沿引导的最优传输框架,通过构建任务特定的帕累托前沿并利用分布感知最优传输将支配样本映射到前沿,结合在线和离线优化策略,引入联合支配率和联合坍塌率作为评估指标,实验显示在多奖励协同和对抗攻击中优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏