arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-14 至 2025-10-14 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 13 篇

2507.10605 2025-10-14 cs.LG cs.AI cs.SI 91%

RedOne: Revealing Domain-specific LLM Post-Training in Social Networking Services

Fei Zhao, Chonggang Lu, Yue Wang, Zheyong Xie, Ziyan Liu, Haofu Qian, JianZhao Huang, Fangcheng Shi, Zijie Meng, Hongcheng Guo, Mingqian He, Xinze Lyu, Yiming Lu, Ziyang Xiang, Zheyu Ye, Chengqiang Lu, Zhe Xu, Yi Wu, Yao Hu, Yan Gao, Jun Fan, Xiaolong Jiang, Weiting Liu, Boyang Wang, Shaosheng Cao

机构 * NLP Team, Xiaohongshu Inc.(小红书公司自然语言处理团队)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09710 2025-10-14 cs.LG cs.CL 91%

DUMP: Automated Distribution-Level Curriculum Learning for RL-based LLM Post-training

Zhenting Wang, Guofeng Cui, Yu-Jhe Li, Kun Wan, Wentian Zhao

机构 * Rutgers University(罗杰斯大学) Adobe Inc.(Adobe公司)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22578 2025-10-14 cs.LG cs.AI stat.ML 88%

The Hidden Link Between RLHF and Contrastive Learning

Xufei Lv, Kehai Chen, Haoyuan Sun, Xuefeng Bai, Min Zhang, Houde Liu, Kehai Chen

机构 * Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Soochow University(苏州大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09895 2025-10-14 cs.CL cs.AI cs.LG 87%

Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data

Shuai Zhao, Yunqiu Xu, Linchao Zhu, Yi Yang

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The code is at https://github.com/mzhaoshuai/RefAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19223 2025-10-14 cs.LG 85%

LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models

Fengqi Zhu, Rongzhen Wang, Shen Nie, Xiaolu Zhang, Chunwei Wu, Jun Hu, Jun Zhou, Jianfei Chen, Yankai Lin, Ji-Rong Wen, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心) Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);SFT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04272 2025-10-14 cs.LG 83%

Understanding the Impact of Sampling Quality in Direct Preference Optimization

Kyung Rok Kim, Yumo Bai, Chonghuan Wang, Guanting Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.LG

Comments Submitted to AISTATS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06552 2025-10-14 cs.CL cs.LG 81%

References Indeed Matter? Reference-Free Preference Optimization for Conversational Query Reformulation

Doyoung Kim, Youngjun Lee, Joeun Kim, Jihwan Bang, Hwanjun Song, Susik Yoon, Jae-Gil Lee

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11345 2025-10-14 cs.LG cs.AI 79%

Part II: ROLL Flash -- Accelerating RLVR and Agentic Training with Asynchrony

Han Lu, Zichen Liu, Shaopan Xiong, Yancheng He, Wei Gao, Yanan Wu, Weixun Wang, Jiashun Liu, Yang Li, Haizhou Zhao, Ju Huang, Siran Yang, Xiaoyang Li, Yijia Luo, Zihe Liu, Ling Pan, Junchi Yan, Wei Wang, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiaotong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10963 2025-10-14 cs.LG cs.AI 79%

APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport

Zhuo Li, Yuege Feng, Dandan Guo, Jinpeng Hu, Anningzhe Gao, Xiang Wan

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳工业与应用数学国际中心) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) Birmingham City University(伯明翰城市大学) Jilin University(吉林大学) KAUST(科威特大学) Hefei University of Technology(合肥工业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

Comments EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10201 2025-10-14 cs.LG cs.AI cs.CL 75%

RLFR: Extending Reinforcement Learning for LLMs with Flow Environment

Jinghao Zhang, Naishan Zheng, Ruilin Li, Dongzhou Cheng, Zheming Liang, Feng Zhao, Jiaqi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动) Wuhan University(武汉大学) Southeast University(东南大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project Website: https://jinghaoleven.github.io/RLFR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07558 2025-10-14 cs.LG cs.AI 73%

VL Norm: Rethink Loss Aggregation in RLVR

Zhiyuan He, Xufang Luo, Yike Zhang, Yuqing Yang, Lili Qiu

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10609 2025-10-14 cs.CV 67%

OmniQuality-R: Advancing Reward Models Through All-Encompassing Quality Assessment

Yiting Lu, Fengbin Guan, Yixin Gao, Yan Zhong, Xinge Peng, Jiakang Yuan, Yihao Liu, Bo Zhang, Xin Li, Zhibo Chen, Weisi Lin

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :post-training(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10395 2025-10-14 cs.CV 67%

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

Xinlong Chen, Yue Ding, Weihong Lin, Jingyun Hua, Linli Yao, Yang Shi, Bozhou Li, Yuanxing Zhang, Qiang Liu, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Peking University(北京大学) Nanjing University(南京大学)

专题命中 后训练与偏好优化 :post-training(abstract);SFT(abstract)

Comments Project webpage: https://avocado-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏