arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2603.00025 2026-08-04 cs.CL 版本更新 85%

TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation

TAB-PO:面向Token关键结构化生成的具有Token级自适应障碍的偏好优化

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Sreeraj Ramachandran, Elyas Irankhah, Aimee Kendall Roundtree

机构 * Yale University(耶鲁大学) Texas State University(德克萨斯州立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 针对结构化预测中偏好与拒绝对象仅少数token不同导致的梯度稀释和token侵蚀问题,提出基于混淆感知偏好构建和Token级自适应障碍的TAB-PO方法,在SciERC任务上显著提升关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20057 2026-07-23 q-bio.BM cs.LG 新提交 85%

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

用于功能性抗体设计的抗原特异性抗体多模态基础模型

Xiaoliang Shi, Zichen Wang, Runze Ma, Zhongyue Zhang, Shuangjia Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13315 2026-07-23 cs.CL 版本更新 85%

Meta-Learning Preferences for Multilingual LLM Alignment

多语言语言模型对齐的元学习偏好

Jiaying Lin, Seongho Son, Nam Phuong Tran, Long Tran-thanh, Ilija Bogunovic, Debmalya Mandal

机构 * University of Warwick(华威大学) University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对多语言环境下低资源语言对齐数据不足问题,提出元学习框架,利用其他语言偏好数据学习可转移初始化,经理论和实验验证,该方法在极低资源设置下比基线方法胜率最多提高28%,且在多场景表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18304 2026-07-22 cs.LG 新提交 85%

TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化

Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang

机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。

Comments commited to EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02374 2026-07-15 cs.AI 版本更新 85%

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

DRIFTLENS: 测量个性化语言模型中记忆引发的推理漂移

Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract_cn);post-training(abstract);分类 cs.AI

AI总结 提出DRIFTLENS框架,通过将推理步骤映射到价值类别并比较有无用户属性记忆的轨迹,量化个性化语言模型中的推理漂移,发现记忆会引发中等至大的推理变化,且现有后训练方法仅部分缓解。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11434 2026-07-14 cs.CL cs.CV 新提交 85%

Direct Image-to-Modern Vietnamese Translation of Han-Nom Manuscripts via Multimodal RLHF Preference Alignment

通过多模态基于人类反馈的强化学习偏好对齐实现汉喃手稿到现代越南语的直接图像翻译

Thi Kim Trang Vo, Nghia Hieu Nguyen, Ha Minh Tan

专题命中 后训练与偏好优化 :RLHF(title,abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL

AI总结 针对汉喃手稿到现代越南语翻译的挑战,提出多模态基于人类反馈的强化学习偏好对齐框架,结合四个流生成越南语,比较PPO、DPO和KTO,结果显示各有优劣,且多模态偏好优化能补充监督学习提升翻译质量。

Comments Accepted Paper at 2026 International Conference on Multimedia Analysis and Pattern Recognition (MAPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10848 2026-07-14 cs.LG 新提交 85%

Predictive Divergence Masks for LLM RL

用于大语言模型强化学习的预测性散度掩码

Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang

机构 * Tencent Hunyuan(腾讯混元) UIUC(伊利诺伊大学厄巴纳 - 香槟分校) NUS(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型强化学习中PPO方向标准不足,提出预测性散度掩码,通过判断策略梯度步骤对散度的影响改进训练,针对离散softmax策略推导预测并开发轻量级估计器,提升不同模型规模和精度设置下的强化学习训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01392 2026-07-07 cs.CL 新提交 85%

Multi-Objective Exploration and Preference Optimization via Mutual Information

基于互信息的多目标探索与偏好优化

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuang Huang, Deqing Wang, Jianxin Li, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MI-EPO框架,通过最大化生成响应、偏好反馈和偏好向量的联合条件互信息,统一多目标探索与对齐,实现可控且稳定的多目标权衡。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 85%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17056 2026-06-16 cs.CL 新提交 85%

The Value Axis: Language Models Encode Whether They're on the Right Track

价值轴:语言模型编码它们是否在正确的轨道上

Nick Jiang, Isaac Kauvar, Jack Lindsey

机构 * Stanford University(斯坦福大学) Anthropic

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL

AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。

Comments Code repository: https://github.com/nickjiang2378/value-axis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12590 2026-06-12 cs.CV cs.AI 新提交 85%

Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs

分析与改进医学LVLMs中的细粒度偏好优化

Shayan Mohammadizadehsamakosh, Pritam Sarkar, Leonid Sigal, Ali Etemad, Elham Dolatabadi

机构 * York University(约克大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Queen’s University(女王大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对医学大视觉语言模型在事实一致性、视觉定位和临床对齐方面的不足,提出一种结合双向令牌级KL正则化和视觉对比定位目标的细粒度在线偏好优化框架,通过最小编辑模型输出构建偏好对,仅修正临床错误片段,显著提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07150 2026-06-12 cs.LG cond-mat.mtrl-sci 版本更新 85%

PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design

PLaID++: 一种用于定向无机材料设计的偏好对齐语言模型

Andy Xu, Rohan Desai, Larry Wang, Ethan Ritz, Gabriel Hope

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 提出PLaID++,通过对称性感知的Wyckoff文本表示和温度缩放熵正则化,结合可验证奖励的强化学习,实现稳定、新颖且满足空间群属性的晶体生成,比先前方法效率提高约50%。

Comments Code available at https://github.com/andaero/PLaID, model weights at https://huggingface.co/HOPE-Lab-HMC/PLaID

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09533 2026-06-11 cs.AI 版本更新 85%

Autoregressive Direct Preference Optimization

自回归直接偏好优化

Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

机构 * University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出自回归直接偏好优化(ADPO),在应用Bradley-Terry模型前显式引入自回归假设,通过将DPO目标中的求和操作移至log-sigmoid函数外部,实现更优的偏好对齐,并首次区分token长度μ和反馈长度μ'两种度量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10860 2026-06-10 cs.CR cs.CL 新提交 85%

Training LLMs to Enforce Multi-Level Instruction Hierarchies via Gravity-Weighted Direct Preference Optimization

训练LLM通过重力加权直接偏好优化强制执行多级指令层次结构

Lena S. Bolliger, Lena A. Jäger

机构 * Department of Computational Linguistics, University of Zurich, Switzerland(计算语言学系,苏黎世大学,瑞士)

专题命中 后训练与偏好优化 :LLM(title_cn,abstract_cn);preference optimization(title);分类 cs.CL

AI总结 提出重力加权DPO(GW-DPO)方法,通过线性或双边调度加权冲突级别间的结构距离,结合层次分隔符和指令段嵌入,在Llama-3.1-8B-Instruct上提升多级指令优先级遵守率并降低过度拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15354 2026-06-08 cs.LG 版本更新 85%

Controllable Molecular Generative Foundation Models

可控分子生成基础模型

Yihan Zhu, Yuhan Liu, Weijiang Li, Tengfei Luo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 提出CoMole,一种基于基团感知图扩散的统一框架,结合强化学习优化条件反向策略,在材料与药物设计的九个目标上均实现最优可控性,MAE最高降低48.2%,且无需规则修正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03403 2026-06-02 cs.CV cs.LG 85%

GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning

GRPO-TTA:基于GRPO驱动的强化学习进行视觉语言模型的测试时视觉调优

Yujun Li, Hongyuan Zhang, Yuan Yuan

机构 * School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University(人工智能、光学与电子学院(iOPEN),西北工业大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.LG

AI总结 提出GRPO-TTA方法,将GRPO应用于测试时适应,通过将类特定提示预测重构为组策略优化问题,并设计对齐奖励和分散奖励,在多种基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30888 2026-06-01 cs.CL 85%

The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

RLHF的另一面:用于奖励模型自监督改进的在线策略反馈

Xiaobo Wang, Tong Wu, Min Tang, Jiaqi Li, Qi Liu, Zilong Zheng

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出SAVE框架,利用价值函数生成在线策略反馈,通过对比学习更新奖励模型,在六个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23975 2026-05-26 cs.CL cs.SD 85%

Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

面向音频大语言模型中英双语码转换语音识别的直接偏好优化

Trung Nguyen Quang, Cheng Yi Lewis Won, Minh Duc Pham, Yingxu He, Shuo Sun, Ai Ti Aw

机构 * Institute for Infocomm Research (I2R), A STAR, Singapore(信息通信研究所(I2R),A STAR,新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对音频大语言模型在英中码转换语音转录中的系统失败,提出使用直接偏好优化(DPO)对齐模型,通过构建偏好对(保留混合语言内容 vs 模仿失败模式)训练模型,实现词错误率降低最高89.6%(分布内)和20.0%(分布外)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08141 2026-05-19 cs.LG 85%

SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training

SCOPE-RL: 稳定和定量控制强化学习后训练中的策略熵

Chen Wang, Zhaochun Li, Jionghao Bai, Hexuan Deng, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SCOPE-RL框架,通过温度自适应的正样本构造正则化项,稳定并定量控制强化学习后训练中的策略熵,实验表明其在Pass@1和Pass@$k$任务上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18083 2026-05-19 cs.CL 85%

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$Δ$ Integration into Upcycled MoE

多语言大语言模型的高效路径:通过后训练PARAM$Δ$整合到再利用MoE进行语言扩展

Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种高效的方法,通过将密集模型转换为MoE架构,并将不同语言分配给不同专家,从而在不进行复杂对齐阶段的情况下提升多语言大语言模型的性能,同时保留原始能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00778 2026-05-18 cs.LG 85%

What Is Preference Optimization Doing, and Why?

偏好优化在做什么,为什么这样做?

Yue Wang, Qizhou Wang, Zizhuo Zhang, Gang Niu, Bo Han, Masashi Sugiyama

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) RIKEN AIP(理化学研究所 AIP 分室) The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文分析了偏好优化中DPO和PPO的优化动态,揭示了其算法行为差异及根本原因,探讨了正学习、负学习和损失再加权的作用,并通过消融研究验证了这些动态对优化效率和性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00400 2026-05-13 cs.AI 85%

KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA

KEPO:基于知识的偏好优化用于多模态推理及其在医学VQA中的应用

Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) University of California, Irvine(加州大学伊文斯分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 KEPO通过质量门控的在线蒸馏和知识增强的探索策略,提升多模态推理任务的训练稳定性与推理一致性,优于强化学习和在线蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10716 2026-05-12 cs.LG stat.ML 85%

What should post-training optimize? A test-time scaling law perspective

在测试时间视角下,后训练应优化什么?

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, The University of Hong Kong(香港大学人工智能与数据科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了测试时间预算不匹配场景下,基于奖励尾部统计的后训练优化方法,提出TEA和Prefix-TEA估计器提升最佳N性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07372 2026-05-05 cs.LG 85%

Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training

Transformer树推理后训练中课程的可证明益处

Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Hau-San Wong, Qingfu Zhang, Taiji Suzuki

机构 * cuhk(城市大学) riken(理化学研究所先进智能项目中心) ism(统计数学研究所) usyd(悉尼大学) astar(科技研究局) ntu(南洋理工大学) utokyo(东京大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本文提出一个理论框架,证明课程后训练在提升推理性能方面具有指数级改进,通过分析发现课程策略能显著降低样本复杂度。

Comments Accepted as a conference paper at 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02467 2026-04-29 cs.CV cs.AI 85%

VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation

VERTIGO:用于电影摄像机轨迹生成的视觉偏好优化

Mengtian Li, Yuwei Lu, Feifei Li, Chenqi Gan, Zhifeng Xie, Xi Wang

机构 * Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects LIX, \'Ecole Polytechnique, CNRS, IPP magenta http://vertigo.magic-lab.tech/

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出VERTIGO,通过视觉偏好优化提升摄像机轨迹生成的质量,通过实时渲染和视觉语言模型优化,提高画面构图和视觉效果。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15602 2026-04-20 cs.CL 85%

GroupDPO: Memory efficient Group-wise Direct Preference Optimization

GroupDPO:内存高效的组级直接偏好优化

Jixuan Leng, Si Si, Hsiang-Fu Yu, Vinod Raman, Inderjit S. Dhillon

机构 * CMU(卡内基梅隆大学) Google Deepmind(谷歌DeepMind) Google(谷歌)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GroupDPO,通过解耦样本和保留梯度实现高效的组级偏好优化,减少内存使用,提升大规模训练效果,且在离线和在线对齐中均优于单对训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL 85%

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR 85%

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08454 2026-04-10 cs.LG 85%

Less Approximates More: Harmonizing Performance and Confidence Faithfulness via Hybrid Post-Training for High-Stakes Tasks

少而精:通过混合后训练实现性能与置信度忠实的和谐统一

Haokai Ma, Lee Yan Zhen, Gang Yang, Yunshan Ma, Ee-Chien Chang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) Singapore Management University, Singapore(新加坡管理大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出HyTuning框架,通过混合后训练方法在有限监督下提升模型准确性并实现置信度忠实,支持'少而精'的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08042 2026-04-10 cs.CV cs.AI 85%

3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience

3DrawAgent:通过早期对比经验教LLM进行3D绘制

Hongcan Xiao, Xinyue Xiao, Yilin Wang, Yue Zhang, Yonggang Qi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Jiangnan University(江南大学) HaoHan Data(浩瀚数据)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 3DrawAgent通过几何反馈利用大语言模型生成3D贝塞尔曲线,引入相对经验优化策略,无需参数更新提升3D空间理解与绘制质量,实现免训练的3D草图智能发展。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏