arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2601.04411 2026-01-09 cs.LG cs.AI cs.CL 67%

Rate or Fate? RLV$^\varepsilon$R: Reinforcement Learning with Verifiable Noisy Rewards

速率还是命运?RLV$^\varepsilon$R:具有可验证噪声奖励的强化学习

Ali Rad, Khashayar Filom, Darioush Keivan, Peyman Mohajerin Esfahani, Ehsan Kamalinejad

机构 * Cognichip AI University of Toronto(多伦多大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLV$^\varepsilon$R框架,通过分析验证噪声对强化学习的影响,揭示了噪声如何影响学习速率与命运,并通过实验验证了在不同Youden指数下动态变化的相变特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04300 2026-01-09 cs.CV 67%

Beyond Binary Preference: Aligning Diffusion Models to Fine-grained Criteria by Decoupling Attributes

超越二元偏好:通过解耦属性对齐扩散模型以实现细粒度标准

Chenye Meng, Zejian Li, Zhongni Liu, Yize Li, Changle Xie, Kaixin Jia, Ling Yang, Huanghuang Deng, Shiying Ding, Shengyuan Zhang, Jiayi Li, Lingyun Sun

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 本文提出CPO方法,通过解耦属性实现扩散模型对细粒度标准的对齐,提升生成质量与专业对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 67%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10071 2026-01-07 cs.RO 67%

Openpi Comet: Competition Solution For 2025 BEHAVIOR Challenge

Openpi Comet: 2025 BEHAVIOR挑战的竞赛解决方案

Junjie Bai, Yu-Wei Chao, Qizhi Chen, Jinwei Gu, Moo Jin Kim, Zhaoshuo Li, Xuan Li, Tsung-Yi Lin, Ming-Yu Liu, Nic Ma, Kaichun Mo, Delin Qu, Shangkun Sun, Hongchi Xia, Fangyin Wei, Xiaohui Zeng

机构 * Openpi Comet

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract)

AI总结 Openpi Comet通过系统构建方法,在2025 BEHAVIOR挑战中取得优异成绩,展示了在长期移动操作任务中的高效解决方案

Comments Post-challenge bug fix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22681 2026-01-01 cs.CV 67%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 67%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18766 2025-12-23 cs.CV 67%

MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation

MaskFocus: 为掩码图像生成聚焦策略优化

Guohui Zhang, Hu Yu, Xiaoxiao Ma, Yaning Pan, Hang Xu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 MaskFocus通过聚焦关键步骤优化策略,提升掩码图像生成模型的性能。

Comments Code is available at https://github.com/zghhui/MaskFocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18014 2025-12-23 cs.CL cs.AI cs.LG 67%

ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India

ReGal:基于PPO的法律AI在印度判决预测和摘要中的初步探索

Shubham Kumar Nigam, Tanuj Tyagi, Siddharth Shukla, Aditya Kumar Guru, Balaramamahanthi Deepak Patnaik, Danush Khanna, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya

专题命中 后训练与偏好优化 :instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReGal通过PPO结合多任务指令微调与强化学习,探索法律AI在印度判决预测和摘要中的应用,揭示了强化学习在法律文本中的挑战与潜力。

Comments Accepted in AILaw @ AAAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17815 2025-12-22 cs.CE q-bio.BM 67%

Structure-Aware Antibody Design with Affinity-Optimized Inverse Folding

具有结构意识的抗体设计与优化结合的反向折叠

Xinyan Zhao, Yi-Ching Tang, Rivaaj Monsia, Victor J. Cantu, Ashwin Kumar Ramesh, Xiaozhong Liu, Zhiqiang An, Xiaoqian Jiang, Yejin Kim

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 SimBinder-IF通过偏好优化提升抗体亲和力,实现高效率的抗体设计与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07313 2025-12-22 cs.CV 67%

DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding

DocR1: 证据页面引导的GRPO用于多页文档理解

Junyu Xiong, Yonghui Wang, Weichao Zhao, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07606 2025-12-15 cs.RO 67%

In-situ Value-aligned Human-Robot Interactions with Physical Constraints

原位价值对齐的人机交互与物理约束

Hongtao Li, Ziyuan Jiao, Xiaofeng Liu, Hangxin Liu, Zilong Zheng

机构 * College of Artificial Intelligence and Automation, Hohai University(人工智能与自动化学院,河海大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本研究提出结合人类偏好与物理约束的框架,通过ICLHF方法实现任务计划生成与约束平衡,提升人机交互的效率与适应性。

Comments 8 pages, 7 figures. Accepted by IROS 2025

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22826 2025-12-04 cs.CV 67%

Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs

某些模态比其他模态更平等:在MLLMs中解码和架构多模态整合

Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文研究了多模态大语言模型对矛盾模态的鲁棒性,提出模态对齐调优策略以提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21953 2025-11-25 cs.CV 67%

MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment

MultiCrafter: 通过解耦注意力和身份感知偏好对齐实现高保真的多主体生成

Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Huawei Technologies Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 MultiCrafter通过解耦注意力和身份感知偏好对齐,提升多主体生成的保真度和人类偏好对齐能力。

Comments Project Page: https://wutao-cs.github.io/MultiCrafter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14760 2025-11-19 cs.CV 67%

UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning

Rui Tian, Mingfei Gao, Haiming Gang, Jiasen Lu, Zhe Gan, Yinfei Yang, Zuxuan Wu, Afshin Dehghan

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12982 2025-11-18 cs.CR cs.CV 67%

SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization

Xuankun Rong, Wenke Huang, Tingfeng Wang, Daiguo Zhou, Bo Du, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13444 2025-11-07 econ.GN q-fin.EC 67%

Balancing Engagement and Polarization: Multi-Objective Alignment of News Content Using LLMs

Mengjie Cheng, Elie Ofek, Hema Yoganarasimhan

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

Comments 73 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10609 2025-10-14 cs.CV 67%

OmniQuality-R: Advancing Reward Models Through All-Encompassing Quality Assessment

Yiting Lu, Fengbin Guan, Yixin Gao, Yan Zhong, Xinge Peng, Jiakang Yuan, Yihao Liu, Bo Zhang, Xin Li, Zhibo Chen, Weisi Lin

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :post-training(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10395 2025-10-14 cs.CV 67%

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

Xinlong Chen, Yue Ding, Weihong Lin, Jingyun Hua, Linli Yao, Yang Shi, Bozhou Li, Yuanxing Zhang, Qiang Liu, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Peking University(北京大学) Nanjing University(南京大学)

专题命中 后训练与偏好优化 :post-training(abstract);SFT(abstract)

Comments Project webpage: https://avocado-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22688 2025-10-08 cs.CV 67%

Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization

Xu Jia

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04392 2025-10-07 cs.CL cs.AI cs.CY cs.LG 67%

Improving Consistency in Retrieval-Augmented Systems with Group Similarity Rewards

Faisal Hamman, Chenyang Zhu, Anoop Kumar, Xujun Peng, Sanghamitra Dutta, Daben Liu, Alfy Samuel

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Capital One

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025 Workshop on Reliable ML from Unreliable Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01540 2025-10-03 cs.CV 67%

Towards Better Optimization For Listwise Preference in Diffusion Models

Jiamu Bai, Xin Yu, Meilong Xu, Weitao Lu, Xin Pan, Kiwan Maeng, Daniel Kifer, Jian Wang, Yu Wang

机构 * Penn State University(宾夕法尼亚州立大学) TikTok Inc.(TikTok公司) Stony Brook University(石溪大学)

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25137 2025-09-30 cs.AI cs.CL cs.LG 67%

The Era of Real-World Human Interaction: RL from User Conversations

Chuanyang Jin, Jing Xu, Bo Liu, Leitian Tao, Olga Golovneva, Tianmin Shu, Wenting Zhao, Xian Li, Jason Weston

机构 * FAIR at Meta(Meta 的 FAIR) Johns Hopkins University(约翰霍普金斯大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20725 2025-09-29 cs.GR cs.CV 67%

SeamCrafter: Enhancing Mesh Seam Generation for Artist UV Unwrapping via Reinforcement Learning

Duoteng Xu, Yuguang Chen, Jing Li, Xinhai Liu, Xueqi Ma, Zhuo Chen, Dongyu Zhang, Chunchao Guo

机构 * Tencent Hunyuan(腾讯文英) SYSU(南方科技大学) SZU(深圳大学) USTC(中国科学技术大学)

专题命中 后训练与偏好优化 :pretraining(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16246 2025-09-23 cs.PL cs.AR 67%

VerilogMonkey: Exploring Parallel Scaling for Automated Verilog Code Generation with LLMs

Juxin Niu, Yuxin Du, Dan Niu, Xi Wang, Zhe Jiang, Nan Guan

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13388 2025-09-23 cs.CL cs.AI cs.LG 67%

R3: Robust Rubric-Agnostic Reward Models

David Anugraha, Zilu Tang, Lester James V. Miranda, Hanyang Zhao, Mohammad Rifqi Farhansyah, Garry Kuwanto, Derry Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) Boston University(波士顿大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学) Institut Teknologi Bandung(Bandung 工程技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01939 2025-09-03 eess.AS 67%

Group Relative Policy Optimization for Speech Recognition

Prashanth Gurunath Shivakumar, Yile Gu, Ankur Gandhe, Ivan Bulyko

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

Comments Accepted for ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21066 2025-08-29 cs.CV 67%

OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning

Yuan Gong, Xionghui Wang, Jie Wu, Shiyin Wang, Yitong Wang, Xinglong Wu

机构 * ByteDance Inc.(字节跳动公司)

专题命中 后训练与偏好优化 :language model(abstract);SFT(abstract)

Comments project url: https://one-reward.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07818 2025-08-29 cs.CV 67%

DanceGRPO: Unleashing GRPO on Visual Generation

Zeyue Xue, Jie Wu, Yu Gao, Fangyuan Kong, Lingting Zhu, Mengzhao Chen, Zhiheng Liu, Wei Liu, Qiushan Guo, Weilin Huang, Ping Luo

机构 * The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :foundation model(abstract);RLHF(abstract)

Comments Project Page: https://dancegrpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18067 2025-08-26 cs.CV 67%

Annotation-Free Open-Vocabulary Segmentation for Remote-Sensing Images

Kaiyu Li, Xiangyong Cao, Ruixun Liu, Shihong Wang, Zixuan Jiang, Zhi Wang, Deyu Meng

机构 * School of Software Engineering, Xi’an Jiaotong University(软件工程学院,西安交通大学) School of Computer Science and Technology and Ministry of Education Key Laboratory of Intelligent Networks and Network Security, Xi’an Jiaotong University(计算机科学与技术学院和教育部智能网络与网络安全重点实验室,西安交通大学) School of Automation, Xi’an Jiaotong University(自动化学院,西安交通大学) College of Artificial Intelligence, Xi’an Jiaotong University(人工智能学院,西安交通大学) School of Mathematics and Statistics and Ministry of Education Key Laboratory of Intelligent Networks and Network Security, Xi’an Jiaotong University(数学与统计学院和教育部智能网络与网络安全重点实验室,西安交通大学)

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract)

Comments All codes and models will be released at https://github.com/earth-insights/SegEarth-OV-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04700 2025-08-13 cs.AI cs.CL cs.CV cs.LG cs.MA cs.MM 67%

SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience

Zeyi Sun, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Tong Wu, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code at https://github.com/SunzeY/SEAgent

详情

展开后加载摘要…

URL PDF HTML 收藏