arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2605.18603 2026-07-07 cs.CV 版本更新 67%

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth

Starve to Perceive: 通过受限视觉带宽驯服VLMs中的懒惰感知

Yuhuan Wu, Cong Wei, Fangzhen Lin, Wenhu Chen, Haozhe Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Technology University of Waterloo(滑铁卢大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 本文提出了一种新的训练方法,通过限制视觉带宽迫使视觉语言模型主动感知,从而提升其在高分辨率视觉环境中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06628 2026-07-07 cs.RO cs.CV 版本更新 67%

MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment

MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型

Ruicheng Zhang, Mingyang Zhang, Jun Zhou, Xiaofan Liu, Zunnan Xu, Zhizhou Zhong, Puxin Yan, Haocheng Luo, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot(X Square机器人) Sun Yat-sen University(中山大学) HKUST(香港科技大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01707 2026-07-03 cs.CV 新提交 67%

LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression

LASER: 通过视觉注意力保持与沉没抑制为LVLMs提供矫正透镜

Bowen Yuan, Zijian Wang, Yadan Luo, Shijie Wang, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 针对大型视觉语言模型在长序列解码中视觉遗忘的问题,提出LASER后训练框架,通过视觉接地奖励和沉没抑制奖励调节注意力轨迹与分布,在8个基准上超越强基线。

Comments The 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17426 2026-07-03 cs.CL cs.AI cs.LG 版本更新 67%

Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging

导航对齐-校准权衡:通过模型合并实现帕累托更优前沿

Tiancheng Hu, Benjamin Minixhofer, Nigel Collier

机构 * University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现后训练对齐不仅降低任务准确率,还严重损失校准性能,导致模型过度自信且输出多样性下降。通过简单地在对齐前后模型权重间进行插值,可以持续获得帕累托最优模型,同时提升准确率和恢复校准。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00152 2026-07-02 cs.LG cs.AI cs.CL stat.ML 新提交 67%

GRPO, Dr. GRPO, and DAPO Are Three Operations on One Number: The Group-Standard-Deviation Identity

GRPO, Dr. GRPO 和 DAPO 是对同一个数的三种操作:组标准差恒等式

Yong Yi Bay, Kathleen A. Yearick

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文证明三种流行的语言模型推理训练方法(GRPO、Dr. GRPO、DAPO)本质上是对组标准差的不同操作,并揭示了标准差在训练更新中的核心作用。

Comments 18 pages, 10 figures, 4 tables. Code and data: https://github.com/bay-yearick-lab/grpo-standard-deviation-identity

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12155 2026-06-30 cs.CV 67%

FAIL: Flow Matching Adversarial Imitation Learning for Image Generation

FAIL: 流匹配对抗模仿学习用于图像生成

Yeyao Ma, Chen Li, Xiaosong Zhang, Han Hu, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 本文提出FAIL方法,通过对抗训练最小化策略-专家差异,无需显式奖励或配对比较,在图像生成中实现高效训练与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05329 2026-06-30 cs.SD eess.AS 67%

CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models

CosyEdit:从零样本文本到语音模型中解锁端到端语音编辑能力

Junyang Chen, Yuhang Jia, Hui Wang, Jiaming Zhou, Yong Qin

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 CosyEdit通过任务特定的后训练和互补训练范式,从零样本文本到语音模型中解锁端到端语音编辑能力,实现高一致性语音编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13814 2026-06-25 cs.IR 新提交 67%

TASR: Training-Free Adaptive Stopping for Iterative Retrieval

TASR:无需训练的迭代检索自适应停止规则

Adrian Kieback, Uyiosa Philip Amadasun, Aman Chadha, Aaron Elkins

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn)

AI总结 提出TASR,一种无需训练的迭代检索停止规则,通过重复答案检测和逻辑回归边际阈值减少冗余检索,在多种配置下保持高F1值并降低调用次数。

Comments 20 pages, 5 figures. Accepted at Agent4IR Workshop, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18441 2026-06-18 cs.CV 新提交 67%

Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

推理即交集:视频多模态大语言模型中视觉焦点的一致性帧对齐

Chengwen Liu, Zhe Huang, Jisheng Dang, Hong Peng, Qi Tian, Tat-Seng Chua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) Cloud and AI BU, Huawei(华为云与AI业务部) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 提出无时间标注的过程级奖励框架CF-GRPO,通过视频内在线索构建一致性帧先验,并利用一致性帧奖励优化模型帧使用与先验的对齐,提升视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13872 2026-06-15 cs.CV 新提交 67%

Avatar V: Scaling Video-Reference Avatar Video Generation

Avatar V:缩放视频参考的化身视频生成

Benjamin Liang, Ce Chen, Desmond Lin, Ivan Somov, Jiajun Zhao, Jiewei Yuan, Jingfeng Zhang, Junhao Huang, Nik Nolte, Pedram Haqiqi, Penghan Wang, Rong Yan, Rui Zhang, Sam Prokopchuk, Sivan Wang, Viktor Goriachko, Yi Ren, Yuanming Li, Yutao Chen, Zhenhui Ye, Zhibin Hong, Zilong Nie, Zujin Guo

机构 * HeyGen Research(HeyGen 研究院)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn)

AI总结 提出Avatar V框架,通过视频参考条件化身份建模,利用稀疏参考注意力机制实现长视频线性复杂度条件化,结合运动表示流和身份感知超分辨率精炼器,生成无限时长1080p视频,在身份保持、唇形同步和质量上超越现有方法。

Comments 31 pages, 15 figures. All contributors are listed in alphabetical order by first name

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13679 2026-06-15 cs.CV 新提交 67%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn)

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19314 2026-06-11 cs.AI cs.CL cs.LG 版本更新 67%

PRInTS: Reward Modeling for Long-Horizon Information Seeking

PRInTS:面向长程信息检索的奖励建模

Jaewoo Lee, Archiki Prasad, Justin Chih-Yao Chen, Zaid Khan, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PRInTS生成式过程奖励模型,通过密集评分和轨迹摘要提升长程信息检索中工具交互与推理能力,在多个基准上超越前沿模型。

Comments ACL 2026, 19 pages, code: https://github.com/G-JWLee/PRInTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03216 2026-06-03 cs.CV 67%

Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

Follow-Your-Preference++:重新思考图像修复中的偏好对齐

Junkun Yuan, Yutao Shen, Toru Aonishi, Hideki Nakayama, Yue Ma

机构 * Zhejiang University(浙江大学) The University of Tokyo(东京大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 本文从基本原理出发,通过直接偏好优化框架和公开奖励模型构建偏好数据,系统研究了图像修复中的偏好对齐问题,发现奖励模型存在偏差但可通过集成缓解,并在标准指标、大视觉语言模型评估和人类评估上显著超越先前最先进模型。

Comments 23 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2509.23082

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10055 2026-06-03 cs.CV 67%

Physical Plausibility Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance

通过 HCM-GRPO 实现物理合理性推理:赋能紧凑模型以获得卓越性能

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型在物理合理性推理中数据缺乏和推理能力弱的问题,提出包含大规模数据集和 HCM-GRPO 方法的完整解决方案,以紧凑模型超越大规模开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31003 2026-06-01 cs.IR 67%

Graph-GRPO: Dependency-Aware Credit Assignment for Generative E-commerce Search Relevance

Graph-GRPO:面向生成式电商搜索相关性的依赖感知信用分配

Jiarui Che, Yifei Chen, Zhixing Tian, Chenyang Wang, Ziguang Cheng

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 提出Graph-GRPO,一种基于图结构的GRPO扩展,通过构建推理依赖图并传播结果级奖励实现细粒度信用分配,提升电商搜索相关性建模。

Comments 11 pages, 2 figures, 2 tables. Submitted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22274 2026-05-27 cs.CV 67%

CAGE-SGG: Counterfactual Active Graph Evidence for Open-Vocabulary Scene Graph Generation

CAGE-SGG:用于开放词汇场景图生成的反事实主动图证据

Suiyang Guang, Chenyu Liu, Ruohan Zhang, Siyuan Chen

机构 * Institute of Intelligent Vision and Embodied Cognition(智能视觉与具身认知研究院)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 提出基于反事实关系验证的开放词汇场景图生成框架,通过分解谓词为软证据基并使用反事实验证器确保关系有视觉证据支持,从而提升可靠性、可解释性和泛化能力。

Comments This manuscript has been withdrawn by the authors because we found a methodological flaw in the formulation and evaluation of the proposed approach. The issue affects the reliability of the experimental results and the conclusions drawn from them. Therefore, the authors consider the current version unsuitable for citation or further use

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24764 2026-05-27 cs.CV 67%

World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

World-R1:通过强化学习为文本到视频生成注入3D约束

Weijie Wang, Xiaoxuan He, Youping Gu, Yifan Yang, Zeyu Zhang, Yefei He, Yanbo Ding, Xirui Hu, Donny Y. Chen, Zhiyuan He, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :language model(abstract);foundation model(abstract)

AI总结 提出World-R1框架,利用强化学习(Flow-GRPO)结合3D基础模型和视觉语言模型的反馈,在不修改架构的情况下增强视频生成的3D一致性,并采用周期解耦训练策略平衡刚体几何与动态场景。

Comments ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13491 2026-05-27 cs.CV 67%

FiRe: Fine-grained Multimodal Reasoning for Enhanced Image Generation

FiRe:用于增强图像生成的细粒度多模态推理

Yongjin Kim, Yoonjin Oh, Yerin Kim, Hyomin Kim, Jeeyoung Yun, Yujung Heo, Minjun Kim, Sungwoong Kim

机构 * KT Corporation(KT公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 提出FiRe方法,通过细粒度多步推理和强化学习FiRe-GRPO,解决文本到图像生成中缺乏细粒度控制的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25759 2026-05-26 cs.CV 67%

Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences

通过合成局部偏好实现解剖学合理的人体图像生成

Bao Li, Yuliang Xiu, Zhen Liu

机构 * Westlake University(西湖大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :foundation model(abstract);preference optimization(abstract)

AI总结 提出 ASAP 框架,利用局部退化机制构建受控偏好对,并结合局部有界 DPO 变体,在保持整体图像质量的同时减少解剖学错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12455 2026-05-25 cs.CV 67%

Mitigating Object Hallucinations via Sentence-Level Early Intervention

通过句子级早期干预缓解对象幻觉

Shangpin Peng, Senqiao Yang, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 提出SENTINEL框架,通过句子级早期干预和领域内偏好学习,无需人工标注即可显著减少多模态大语言模型的对象幻觉,并在幻觉和通用能力基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22413 2026-05-22 cs.CV 67%

From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding

从识别到推理:在现实世界收据文档理解上对齐和增强MLLMs

Yandi Wang, Libin Zhan, Ziwei Huang, Tiancheng Luo, Yuxuan Jiang, Wang Dong, Leilei Gan, Jun Chen

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出ReceiptBench基准,通过四个层次化子任务提升收据信息提取的结构一致性,并提出两阶段训练框架GRPO,通过强化学习信号提升模型性能,实验证明其在复杂推理任务上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20584 2026-05-21 cs.CV 67%

QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs

QwenSafe: 通过偏好对齐的视觉语言模型实现多模态内容评级描述识别

Dishanika Denipitiyage, Aruna Seneviratne, Suranga Seneviratne

机构 * University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 本文提出QwenSafe,一种通过联合推理应用元数据和截图来自动识别苹果定义的内容评级描述(CRDs)的视觉语言模型,通过引入metadata2CRD数据构建管道和直接偏好优化(DPO)提升模型预测准确性,实验结果显示QwenSafe在二元CRD分类中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15325 2026-05-18 cs.CV 67%

COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection

COPRA:基于强化学习的条件参数适应用于视频异常检测

Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He

机构 * Auburn University(奥本大学) Tencent Hunyuan(腾讯文元)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 COPRA通过生成输入特定的参数更新,动态适应冻结的VLM,提升视频异常检测的适应性和泛化能力,同时拓展到多选视频问答和密集标注等任务。

Comments Manuscript currently under review for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12500 2026-05-13 cs.CV 67%

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

SenseNova-U1:基于NEO-unify架构的多模态理解和生成统一范式

Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, Silei Wu, Weichen Fan, Wenjie Ye, Wenwen Tong, Xiangyu Fan, Yan Li, Yubo Wang, Zhijie Cao, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Yuwei Niu, Yue Zhu, Bo Liu, Chengguang Lv, Haojia Yu, Haozhe Xie, Hongli Wang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jingcheng Ni, Junxiang Xu, Kaihuan Liang, Lianqiang Shi, Linjun Dai, Linyan Wang, Oscar Qian, Peng Gao, Pengfei Liu, Qingping Sun, Rui Shen, Ruisi Wang, Shengnan Ma, Shuang Yang, Siyi Xie, Siying Li, Tianbo Zhong, Xiangli Kong, Xuanke Shi, Yang Gao, Yongqiang Yao, Yves Wang, Zhengqi Bai, Zhengyu Lin, Zixin Yin, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 SenseNova-U1通过NEO-unify架构实现多模态理解与生成的统一,展示了在文本理解、视觉语言感知、知识推理、代理决策和空间智能等任务中的表现,同时在X2I合成、图文生成和视觉语言生成中表现出色。

Comments Project page: https://github.com/OpenSenseNova/SenseNova-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12179 2026-05-13 cs.CV 67%

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning

SyncDPO:通过偏好学习增强视频音频联合生成中的时序同步

Xin Cheng, Xihua Wang, Ying Ba, Yuyue Wang, Kaisi Guan, Yinbo Wang, Wenpu Li, Ruihua Song

机构 * Renmin University of China(中国人民大学) Westlake University(西湖大学)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 本文提出SyncDPO框架,通过引入基于规则的负样本生成策略提升视频音频联合生成的时序同步能力,并在多个基准测试中验证了其有效性。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11403 2026-05-13 cs.LG cs.AI cs.CL 67%

fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum

fg-expo: 基于前沿引导的探索优先策略优化:通过自适应KL和高斯课程学习

Mingxiong Lin, Zhangquan Gong, Maowen Tang, Qian Li, Chuangchuang Wang, Jian Ma, Sutian Huang, Kai Tang, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FG-ExPO算法,通过自适应KL缩放和高斯课程采样提升策略优化效率,实验表明其在数学推理任务中性能显著优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23370 2026-05-11 cs.CV 67%

GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval

GRAPE:通过检索排名监督查询重写

Zhaohua Zhang, Jianhuan Zhuo, Muxi Chen, Chenchen Zhao, Wenyu Jiang, Tianwen Jiang, Mingyang Chen, Yutang, Qiuyong Xiao, Jihong Zhang, Zhixun Su

机构 * Dalian University of Technology, Dalian, China(大连理工大学) Tencent HunYuan Data, Shenzhen, China(腾讯混元数据)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn)

AI总结 GRAPE通过组相对策略优化提升检索排名,改进多语言、长文本和多模态查询的检索性能,平均提升Recall@10 4.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19417 2026-05-08 cs.HC 67%

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

MER 2026:从判别性情感识别到生成性情感理解

Zheng Lian, Xiaojiang Peng, Kele Xu, Ziyu Jia, Xinyi Che, Zebang Cheng, Fei Ma, Laizhong Cui, Yazhou Zhang, Xin Liu, Liang Yang, Jia Li, Fan Zhang, Liumeng Xue, Erik Cambria, Guoying Zhao, Bjorn W. Schuller, Jianhua Tao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00699 2026-05-08 cs.CR 67%

STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack

STARE:分步时间对齐与红队引擎用于多模态毒性攻击

Xutao Mao, Liangjie Zhao, Tao Liu, Xiang Zheng, Hongying Zan, Cong Wang

专题命中 后训练与偏好优化 :language model(abstract,abstract_cn)

AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15646 2026-05-08 cs.LG cs.AI cs.CL 67%

Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy

基于情境评分奖励的交替强化学习:超越标量化策略

Guangchen Lan, Lian Xiong, Xin Zhou, Hejie Cui, Yuwei Zhang, Mao Li, Zhenyu Shi, Besnik Fetahu, Lihong Li, Xian Li

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ARL-RR框架,通过逐个优化语义评分元类别,避免固定标量化,提升模型性能与训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏