arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-17 至 2026-02-17 共收录 360 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 32 篇

2602.10098 2026-02-17 cs.RO cs.CV 50%

VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model

VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型

Jingwen Sun, Wenyao Zhang, Zekun Qi, Shaojie Ren, Zezhi Liu, Hanxin Zhu, Guangzhong Sun, Xin Jin, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 VLA-JEPA通过潜在世界模型提升视觉-语言-动作模型的泛化与鲁棒性,采用无泄露状态预测和两阶段训练策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17879 2026-02-17 physics.optics 50%

Inverse-Designed Phase Prediction in Digital Lasers Using Deep Learning and Transfer Learning

基于深度学习和迁移学习的数字激光器逆向设计相位预测

Yu-Che Wu, Kuo-Chih Chang, Shu-Chun Chu

专题命中 预训练与数据 :SLM(abstract)

AI总结 本文提出基于深度学习和迁移学习的逆向设计方法,用于高效生成数字激光器中的结构光。

Comments Accepted manuscript accepted for publication in Optics and Laser Technology (Elsevier).Shared under the CC BY-NC-ND license. DOI will be added after publication

Journal ref Optics & Laser Technology, Volume 198, June 2026, 114903

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 18 篇

2602.13773 2026-02-17 cs.LG 87%

On Representation Redundancy in Large-Scale Instruction Tuning Data Selection

在大规模指令微调数据选择中的表示冗余性

Youwei Shu, Shaomian Zheng, Dingnan Jin, Wenjie Qu, Ziyao Guo, Qing Cui, Jun Zhou, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CRDS框架,通过压缩表示减少指令微调数据冗余,提升数据质量与模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11884 2026-02-17 cs.CL 87%

Context-Emotion Aware Therapeutic Dialogue Generation: A Multi-component Reinforcement Learning Approach to Language Models for Mental Health Support

情境-情绪感知的治疗对话生成:一种多组件强化学习方法用于语言模型的心理健康支持

Eric Hua Qing Zhang, Julia Ive

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);SFT(abstract)

AI总结 本文提出一种多组件强化学习方法,通过改进GPT-2的治疗对话生成能力,提升情绪准确性和上下文相关性,以支持心理健康领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10833 2026-02-17 cs.IR cs.AI cs.CL cs.LG 87%

Training-Induced Bias Toward LLM-Generated Content in Dense Retrieval

训练诱导的对LLM生成内容的偏好在密集检索中的表现

William Xion, Wolfgang Nejdl

机构 * L3S Research Center, Hannover, Germany(汉诺威德国L3S研究中心)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现,密集检索中的来源偏见是训练过程诱导的,而非固有属性,通过实验揭示了不同微调策略对检索结果的影响。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15751 2026-02-17 cs.LG cs.AI cs.CL 85%

Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning

稀疏MeZO:在零阶LLM微调中更少的参数带来更好的性能

Yong Liu, Zirui Zhu, Chaoyu Gong, Minhao Cheng, Cho-Jui Hsieh, Yang You

机构 * National University of Singapore(新加坡国立大学) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 稀疏MeZO通过仅对部分参数应用零阶优化,提升LLM微调的性能和收敛速度。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13942 2026-02-17 stat.ML cs.LG 83%

A Theoretical Framework for LLM Fine-tuning Using Early Stopping for Non-random Initialization

基于早停机制的LLM微调理论框架

Zexuan Sun, Garvesh Raskutti

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于早停机制的LLM微调理论框架,结合NTK理论与非随机初始化,揭示微调收敛率与特征值衰减的关系,并通过实验验证理论成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13659 2026-02-17 cs.LG math.OC 83%

Zero-Order Optimization for LLM Fine-Tuning via Learnable Direction Sampling

通过可学习方向采样实现LLM微调的零阶优化

Valery Parfenov, Grigoriy Evseev, Andrey Veprikov, Nikolay Bushkov, Stanislav Moiseev, Aleksandr Beznosikov

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于可学习策略的方向采样方法,用于改进零阶优化在LLM微调中的性能,通过减少方差和依赖维度来提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06964 2026-02-17 cs.CL cs.LG 82%

Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

通过奖励加权微调实现离线强化学习用于对话优化

Subhojyoti Mukherjee, Viet Dac Lai, Raghavendra Addanki, Ryan Rossi, Seunghyun Yoon, Trung Bui, Anup Rao, Jayakumar Subramanian, Branislav Kveton

机构 * Adobe Research(Adobe研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 本文提出通过奖励加权微调实现离线强化学习,用于对话优化,相比传统方法在奖励和语言质量上取得显著提升。

Comments Advances in Neural Information Processing Systems 38

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13157 2026-02-17 eess.SP 82%

Seeing Radio: From Zero RF Priors to Explainable Modulation Recognition with Vision Language Models

看见无线电:从零RF先验到可解释的调制识别与视觉语言模型

Hang Zou, Bohao Wang, Yu Tian, Lina Bariah, Chongwen Huang, Samson Lasaulce, Mérouane Debbah

专题命中 指令微调 :language model(title,abstract);large language model(abstract)

AI总结 本文提出利用视觉语言模型直接感知无线电波信号并推断调制模式,通过转换IQ流为图像数据,提升模型准确性至90%,并实现可解释的调制识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22067 2026-02-17 cs.LG cs.AI 81%

The Rogue Scalpel: Activation Steering Compromises LLM Safety

恶意手术刀:激活引导破坏了大语言模型的安全性

Anton Korznikov, Andrey Galichin, Alexey Dontsov, Oleg Y. Rogov, Ivan Oseledets, Elena Tutubalina

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究发现激活引导技术实际上会破坏大语言模型的安全性,通过实验表明即使随机引导也能增加有害服从的概率,挑战了可解释性带来的安全假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13306 2026-02-17 cs.CV cs.AI cs.LG 81%

Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique

对大型视觉-语言模型进行微调以用于艺术品的评分与批评

Zhehan Zhang, Meihua Qian, Li Luo, Siyu Huang, Chaoyi Zhou, Ripon Saha, Xinxin Song

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过微调Qwen2-VL-7B模型,结合多任务学习实现对人类绘画的自动化创造力评估,通过生成与评分标准一致的反馈,提高评分准确性和反馈质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13954 2026-02-17 cs.SD cs.AI 79%

Eureka-Audio: Triggering Audio Intelligence in Compact Language Models

Eureka-Audio: 在紧凑语言模型中触发音频智能

Dan Zhang, Yishu Lei, Jing Hu, Shuwei He, Songhe Deng, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 Eureka-Audio通过紧凑架构和统一端到端设计,在低参数量下实现高性能音频理解,匹配甚至超越大模型表现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14490 2026-02-17 cs.LG cs.AI cs.CL cs.NE 75%

Parameter-Efficient Fine-Tuning of LLMs with Mixture of Space Experts

使用混合空间专家进行大语言模型的参数高效微调

Buze Zhang, Jinkai Tao, Zilang Zeng, Neil He, Ali Maatouk, Menglin Yang, Rex Ying

机构 * Yale university(耶鲁大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science(香港科学大学) Xi’an Jiaotong University(西安交通大学) Central University of Finance(中央财经大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MoSLoRA,通过混合多种几何空间提升大语言模型的参数高效微调效果,实验显示在多个基准测试中表现优于现有方法。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16905 2026-02-17 cs.LG cs.AI 73%

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

GRIP:通过几何路由约束实现混合专家的算法无关机器反学习

Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Tsinghua University(清华大学) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13504 2026-02-17 cs.CL cs.AI 73%

From Perceptions To Evidence: Detecting AI-Generated Content In Turkish News Media With A Fine-Tuned Bert Classifier

从感知到证据:利用微调的BERT分类器检测土耳其新闻媒体中的AI生成内容

Ozancan Ozdemir

机构 * Bernoulli Institute University of Groningen(格罗宁根大学伯努利研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用微调的土耳其BERT模型,首次实证测量土耳其新闻媒体中AI生成内容的使用情况,实现了高准确率的分类和检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14225 2026-02-17 cs.AI 70%

Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding

文本优先于视觉:针对超高清遥感理解的代理强化学习在超高清遥感理解中的知识注入至关重要

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yuhao Zhou, Di Wang, Yifan Zhang, Haoyu Wang, Haiyan Zhao, Hongda Sun, Long Lan, Jun Song, Yulin Wang, Jing Zhang, Wenlong Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Sichuan University, China(四川大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Renmin University of China, China(中国人民大学)

专题命中 指令微调 :post-training(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出分阶段知识注入方法,利用文本引导提升超高清遥感理解的视觉推理能力,实现XLRS-Bench上的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07132 2026-02-17 stat.ML cs.LG 70%

Discrete Adjoint Matching

离散共轭匹配

Oswin So, Brian Karrer, Chuchu Fan, Ricky T. Q. Chen, Guan-Horng Liu

机构 * Massachusetts Institute of Technology(麻省理工学院) FAIR at Meta(Meta 的 FAIR)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出离散共轭匹配方法,用于微调离散生成模型,通过离散域上的共轭估计器解决熵正则化奖励优化问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13407 2026-02-17 cs.AI 57%

On-Policy Supervised Fine-Tuning for Efficient Reasoning

在线监督微调用于高效推理

Anhao Zhao, Ziyang Chen, Junlong Tong, Yingqi Fan, Fanghua Ye, Shuhao Li, Yunpu Ma, Wenjie Li, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Eastern Institute of Technology, Ningbo(宁波工程技术学院) Shanghai Jiao Tong University(上海交通大学) Ludwig Maximilian University of Munich(慕尼黑大学) Tencent Hunyuan / AI Lab(腾讯混元/AI实验室)

专题命中 指令微调 :SFT(abstract);分类 cs.AI

AI总结 本文提出在线监督微调方法,通过简化奖励机制提升推理效率和准确性,减少计算成本并优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14186 2026-02-17 cs.CV 50%

UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing

UniRef-Image-Edit: 向可扩展和一致的多参考图像编辑迈进

Hongyang Wei, Bin Wen, Yancheng Long, Yankai Yang, Yuhang Hu, Tianke Zhang, Wei Chen, Haonan Fan, Kaiyu Jiang, Jiankang Chen, Changyi Liu, Kaiyu Tang, Haojie Ding, Xiao Yang, Jia Sun, Huaiqing Wang, Zhenyu Yang, Xinyu Wei, Xianglong He, Yangguang Li, Fan Yang, Tingting Gao, Lei Zhang, Guorui Zhou, Han Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) CUHK MMLab(香港中文大学MMLab)

专题命中 指令微调 :SFT(abstract)

AI总结 UniRef-Image-Edit通过统一的输入表示和两阶段训练框架,提升多参考图像编辑的一致性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 12 篇

2502.14560 2026-02-17 cs.LG cs.AI cs.CL 87%

Less is More: Improving LLM Alignment via Preference Data Selection

少即是多:通过偏好数据选择改进大语言模型对齐

Xun Deng, Han Zhong, Rui Ai, Fuli Feng, Zheng Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Massachusetts Institute of Technology(麻省理工学院) Alibaba Cloud Computing(阿里云计算) MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学MoE关键实验室)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 通过改进偏好数据选择策略,提升大语言模型对齐效果,实验显示在较少数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13891 2026-02-17 cs.SD cs.AI 85%

GSRM: Generative Speech Reward Model for Speech RLHF

GSRM:生成式语音奖励模型用于语音强化学习反馈机制

Maohao Shen, Tejas Jayashankar, Osama Hanna, Naoyuki Kanda, Yancheng Wang, Kateřina Žmolíková, Ruiming Xie, Niko Moritz, Anfeng Xu, Yashesh Gaur, Gregory Wornell, Qing He, Jilong Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) Massachusetts Institute of Technology(麻省理工学院) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);language model(abstract);分类 cs.AI

AI总结 GSRM通过生成式语音奖励模型提升语音生成的自然度,利用可解释的推理链实现更准确的自然度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 85%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20150 2026-02-17 cs.IR 85%

Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning

Rank-GRPO: 基于强化学习训练基于大语言模型的对话推荐系统

Yaochen Zhu, Harald Steck, Dawen Liang, Yinhan He, Vito Ostuni, Jundong Li, Nathan Kallus

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Rank-GRPO通过两阶段框架提升LLM对话推荐系统的训练效果,解决排名质量下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19457 2026-02-17 cs.CL cs.AI cs.LG cs.SE 80%

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

GEPA:反思式提示进化可以超越强化学习

Lakshya A Agrawal, Shangyin Tan, Dilara Soylu, Noah Ziems, Rishi Khare, Krista Opsahl-Ong, Arnav Singhvi, Herumb Shandilya, Michael J Ryan, Meng Jiang, Christopher Potts, Koushik Sen, Alexandros G. Dimakis, Ion Stoica, Dan Klein, Matei Zaharia, Omar Khattab

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GEPA通过自然语言反思优化提示,以更少的回放次数在多个任务中超越强化学习方法GRPO和MIPROv2。

Comments Accepted to ICLR 2026 (Oral). Code: https://github.com/gepa-ai/gepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16652 2026-02-17 cs.LG cs.AI 79%

Evolution Strategies at the Hyperscale

超大规模进化策略

Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, Jakob Nicolaus Foerster

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 EGGROLL通过低秩学习提升算术强度,实现大规模参数模型的高效训练,稳定预训练非线性循环语言模型并提升推理任务性能。

Comments 76 pages, 15 figures, Website at https://eshyperscale.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00499 2026-02-17 cs.LG cs.AI stat.ML 79%

ESPO: Entropy Importance Sampling Policy Optimization

ESPO:熵重要性采样策略优化

Yuepeng Sheng, Yuwei Huang, Shuman Liu, Anxiang Zeng, Haibo Zhang

机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司大语言模型团队)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 ESPO通过结合细粒度更新与稳定训练,解决梯度利用率不足问题,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 79%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04552 2026-02-17 cs.SD cs.AI eess.AS 74%

RRPO: Robust Reward Policy Optimization for LLM-based Emotional TTS

RRPO: 为基于LLM的情感TTS的鲁棒奖励策略优化

Cong Wang, Changfeng Gao, Yang Xiang, Zhihao Du, Keyu An, Han Zhao, Qian Chen, Xiangang Li, Yingming Gao, Ya Li

机构 * Speech Team, Tongyi Lab, Alibaba Group(通义实验室,阿里集团)

专题命中 后训练与偏好优化 :LLM(title);分类 cs.AI

AI总结 RRPO通过鲁棒奖励模型和混合正则化方案,提升LLM情感TTS的鲁棒性和自然度,有效对抗奖励黑客攻击。

Comments Accepted by ICASSP 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16117 2026-02-17 cs.LG cs.AI cs.CV 73%

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

DiffusionNFT: 在线扩散强化学习与正向过程

Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, Ming-Yu Liu

机构 * Tsinghua University(清华大学) NVIDIA Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 DiffusionNFT通过正向过程优化扩散模型,结合正负生成对比提升强化学习效率,无需CFG且比FlowGRPO更高效。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏