arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-26 至 2025-09-26 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2508.07137 2025-09-26 cs.LG cs.AI 88%

A Principled Loss Function for Direct Language Model Alignment

Yuandong Tan

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21134 2025-09-26 cs.AI cs.MA 85%

ToMPO: Training LLM Strategic Decision Making from a Multi-Agent Perspective

Yiwen Zhang, Ziang Chen, Fanqi Kong, Yizhe Huang, Xue Feng

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21009 2025-09-26 cs.DC cs.LG 85%

RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training

Wei Gao, Yuheng Zhao, Dakai An, Tianyuan Wu, Lunxi Cao, Shaopan Xiong, Ju Huang, Weixun Wang, Siran Yang, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng, Wei Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Alibaba Group(阿里巴巴集团) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 16pages,14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20384 2025-09-26 cs.CR cs.AI cs.PL cs.SE 83%

R1-Fuzz: Specializing Language Models for Textual Fuzzing via Reinforcement Learning

Jiayi Lin, Liangcai Su, Junzhe Li, Chenxiong Qian

机构 * The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20751 2025-09-26 cs.CV cs.AI cs.CL 81%

Seeing Through Words, Speaking Through Pixels: Deep Representational Alignment Between Vision and Language Models

Zoe Wanying He, Sean Trott, Meenakshi Khosla

机构 * Department of Cognitive Science University of California, San Diego(认知科学系,加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02495 2025-09-26 cs.CL cs.AI cs.LG 80%

Inference-Time Scaling for Generalist Reward Modeling

Zijun Liu, Peiyi Wang, Runxin Xu, Shirong Ma, Chong Ruan, Peng Li, Yang Liu, Yu Wu

机构 * DeepSeek-AI Dept. of Computer Sci. & Tech., Tsinghua University(计算机科学与技术系,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint, under review. 44 pages. Models are available at https://huggingface.co/collections/BBQGOD/deepseek-grm-68b4681169dbb97fd30614b5 and https://www.modelscope.cn/collections/DeepSeek-GRM-ff6a2d8babdd4a

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20961 2025-09-26 cs.CV cs.AI 77%

Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos

Sarmistha Das, R E Zera Marveen Lyngkhoi, Sriparna Saha, Alka Maurya

机构 * Indian Institute of Technology Patna(印度帕纳杰大学) CRISIL LTD(CRISIL公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12148 2025-09-26 cs.CV 75%

HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and Generation

Ling Yang, Xinchen Zhang, Ye Tian, Chenming Shang, Minghao Xu, Wentao Zhang, Bin Cui

机构 * Peking University(北京大学) Tsinghua University(清华大学) Mila - Québec AI Institute(魁北克人工智能研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract)

Comments NeurIPS 2025. Code: https://github.com/Gen-Verse/HermesFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16663 2025-09-26 cs.CL cs.AI 73%

Turning Internal Gap into Self-Improvement: Promoting the Generation-Understanding Unification in MLLMs

Yujin Han, Hao Chen, Andi Han, Zhiheng Wang, Xinyu Liu, Yingya Zhang, Shiwei Zhang, Difan Zou

专题命中 后训练与偏好优化 :post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI

Comments 31 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20838 2025-09-26 cs.CL 70%

Zero-Shot Privacy-Aware Text Rewriting via Iterative Tree Search

Shuo Huang, Xingliang Yuan, Gholamreza Haffari, Lizhen Qu

机构 * Monash University(莫纳什大学) University of Melbourne(墨尔本大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18849 2025-09-26 cs.AI 57%

MAPO: Mixed Advantage Policy Optimization

Wenke Huang, Quan Zhang, Yiyang Fang, Jian Liang, Xuankun Rong, Huanjin Yao, Guancheng Wan, Ke Liang, Wenwen He, Mingjun Li, Leszek Rutkowski, Mang Ye, Bo Du, Dacheng Tao

机构 * Wuhan University(武汉大学) ByteDance(字节跳动) National University of Defense Technology(国防科技大学) Nanyang Technological University(南洋理工大学) The AGH University of Krakow(克拉科夫AGH大学)

专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏