arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-19 至 2025-08-19 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2505.19743 2025-08-19 cs.CL cs.LG 90%

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models

Yang Zhang, Yu Yu, Bo Tang, Yu Zhu, Chuxiong Sun, Wenqiang Wei, Jie Hu, Zipeng Xie, Zhiyu Li, Feiyu Xiong, Edward Chung

机构 * Hong Kong Polytechnic University(香港理工大学) MemTensor (Shanghai) Technology Co., Ltd(MemTensor(上海)科技有限公司) University of Science and Technology of China(中国科学技术大学) China Telecom Corporation Limited Beijing Research Institute(中国电信北京研究院) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG

Comments Accepted to 34th International Joint Conference on Artificial Intelligence (IJCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00845 2025-08-19 cs.LG cs.CL 87%

Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment

Yizhuo Zhang, Heng Wang, Shangbin Feng, Zhaoxuan Tan, Xinyun Liu, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Xi’an Jiaotong University(西安交通大学) University of Notre Dame(圣母大学) Google(谷歌)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);分类 cs.CL、cs.LG

Comments 8 pages, 1 figures, 2 tables. Experimental code and results are publicly available at https://anonymous.4open.science/r/Graph_RL-BF08/readme.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12790 2025-08-19 cs.AI cs.CL cs.LG 80%

Reinforcement Learning with Rubric Anchors

Zenan Huang, Yihong Zhuang, Guoshan Lu, Zeyu Qin, Haokai Xu, Tianyu Zhao, Ru Peng, Jiaqi Hu, Zhanming Shen, Xiaomeng Hu, Xijun Gu, Peiyi Tu, Jiaxin Liu, Wenyu Chen, Yuzhuo Fu, Zhiting Fan, Yanmei Gu, Yuanyuan Wang, Zhengkai Yang, Jianguo Li, Junbo Zhao

机构 * Inclusion AI Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12165 2025-08-19 cs.AI 77%

RLNVR: Reinforcement Learning from Non-Verified Real-World Rewards

Rohit Krishnan, Jon Evans

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11737 2025-08-19 cs.CV cs.AI cs.CL cs.LG 75%

Ovis2.5 Technical Report

Shiyin Lu, Yang Li, Yu Xia, Yuwei Hu, Shanshan Zhao, Yanqing Ma, Zhichao Wei, Yinglun Li, Lunhao Duan, Jianshan Zhao, Yuxuan Han, Haijun Li, Wanying Chen, Junke Tang, Chengkun Hou, Zhixing Du, Tianli Zhou, Wenjie Zhang, Huping Ding, Jiahe Li, Wen Li, Gui Hu, Yiliang Gu, Siran Yang, Jiamang Wang, Hailong Sun, Yibo Wang, Hui Sun, Jinlong Huang, Yuping He, Shengze Shi, Weihong Zhang, Guodong Zheng, Junpeng Jiang, Sensen Gao, Yi-Feng Wu, Sijia Chen, Yuhui Chen, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13023 2025-08-19 cs.AI 70%

G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance

Yongxin Guo, Wenbo Deng, Zhenglin Cheng, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, Guangdong(科学与工程学院,香港中文大学(深圳)) Alibaba Group(阿里巴巴集团) School of Engineering, Westlake University(工程学院,西湖大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12338 2025-08-19 cs.AI 70%

Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback

Wenzhen Yuan, Shengji Tang, Weihao Lin, Jiacheng Ruan, Ganqu Cui, Bo Zhang, Tao Chen, Ting Liu, Yuzhuo Fu, Peng Ye, Lei Bai

机构 * Shanghai AI Lab(上海AI实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11800 2025-08-19 cs.LG cs.AI 62%

Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes

Michael Bereket, Jure Leskovec

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11904 2025-08-19 cs.CV 50%

SafeCtrl: Region-Based Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress

Lingyun Zhang, Yu Xie, Yanwei Fu, Ping Chen

专题命中 后训练与偏好优化 :preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏