arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 14 篇

2509.17866 2026-01-30 cs.LG cs.AI 92%

Understanding Post-Training Structural Changes in Large Language Models

理解大型语言模型的训练后结构变化

Xinyu He, Xianghui Cao

机构 * School of Automation, Southeast University, Nanjing, China(自动化学院,东南大学,南京,中国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);instruction tuning(abstract)

AI总结 本研究通过SVD分析揭示了大型语言模型训练后参数空间的结构变化,发现奇异值缩放和奇异向量旋转机制,为理解训练后调节机制提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12991 2026-01-30 cs.LG cs.AI stat.AP 89%

Bridging Performance Gaps for ECG Foundation Models: A Post-Training Strategy

弥合ECG基础模型性能差距:一种训练后策略

Ya Zhou, Yujie Yang, Xiaohan Fan, Wei Zhao

机构 * Department of Information Center, Fuwai Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(信息中心部门,阜外医院,中国医学科学院和北京协和医学院) Function Test Center, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(功能测试中心,阜外医院,国家心血管疾病中心,中国医学科学院和北京协和医学院) Cardiac Arrhythmia Center, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(心律失常中心,阜外医院,国家心血管疾病中心,中国医学科学院和北京协和医学院) Center for Health Statistics and Information, National Health Commission People’s Republic of China(健康统计与信息中心,中华人民共和国国家卫生健康委员会)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种训练后策略,通过提升ECG基础模型的性能,使其在多个任务中表现优于基线微调方法。

Comments A Transformer-based model is used as an example; the proposed post-training strategy may also be applicable to CNN-based models. The manuscript is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11311 2026-01-30 cs.AI cs.CY 87%

Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble

通过紧凑的LLM集合模拟人类偏好:提示到代理

Bingchen Wang, Zi-Yu Khoo, Jingtan Wang

机构 * Independent Researcher, China(中国独立研究者) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 通过紧凑的LLM集合模拟人类偏好,P2P方法在无需微调和敏感数据的情况下,有效重建目标人群偏好并实现高质量预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06411 2026-01-30 cs.AI cs.LG 86%

SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization

SofT-GRPO:通过Gumbel-重新参数化软思考策略优化超越离散标记LLM强化学习

Zhi Zheng, Yu Gu, Wei Liu, Yee Whye Teh, Wee Sun Lee

机构 * School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系) School of Intelligence Science(智能科学学院) Technology, Nanjing University, China(技术学院,南京大学,中国)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SofT-GRPO通过引入Gumbel噪声和重新参数化技巧,在软思考模式下提升LLM推理性能,使其在Pass@1和Pass@32任务中分别优于离散标记GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15596 2026-01-30 cs.LG 83%

Corrective Diffusion Language Models

纠正扩散语言模型

Shuibai Zhang, Fred Zhangzhi Peng, Yiheng Zhang, Jin Pan, Grigorios G. Chrysos

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Duke University(杜克大学)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 纠正扩散语言模型通过明确监督可见错误token,实现判别性置信度和针对性细化,显著提升代码修订和并行解码任务性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20966 2026-01-30 cs.RO cs.AI 83%

Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends

VLA模型后训练与人类运动学习的类比:进展、挑战与趋势

Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Sheng-Bin Duan, Fu-Chao Xie, Wen-Kai Wang, Si-Cheng Wang, Ling-Yun Li, Tian Tu, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Grainger College of Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程学院智能科学与技术联合实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文从人类运动学习角度综述了VLA模型后训练的进展、挑战与趋势,提出四类后训练方法并探讨了其在机器人操作中的应用与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21268 2026-01-30 cs.NE 82%

Reinforcement Learning from Meta-Evaluation: Aligning Language Models Without Ground-Truth Labels

基于元评估的强化学习:无需真实标签对齐语言模型

Micah Rentschler, Jesse Roberts

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract)

AI总结 本研究提出RLME方法,通过元评估生成奖励,实现无需真实标签的LLM训练,提升准确性和样本效率,支持多目标权衡与可靠推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23596 2026-01-30 cs.CL 77%

Think Twice: Branch-and-Rethink Reasoning Reward Model

再思两次:分支与再思考推理奖励模型

Yizhu Jiao, Jiaqi Zeng, Julien Veron Vialard, Oleksii Kuchaiev, Jiawei Han, Olivier Delalleau

机构 * NVIDIA(NVIDIA公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 BR-RM通过两轮次的分支与再思考机制,改进奖励模型的判断准确性与敏感性,实现更精确的推理能力。

Comments Source Code: https://github.com/yzjiao/BR-RM. Model Checkpoints: https://huggingface.co/nvidia/Qwen3-Nemotron-14B-BRRM and https://huggingface.co/nvidia/Qwen3-Nemotron-8B-BRRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01027 2026-01-30 cs.LG 77%

DBellQuant: Breaking the Bell with Double-Bell Transformation for LLMs Post Training Binarization

DBellQuant: 通过双铃变换打破贝尔限制以实现LLMs预训练后二值化

Zijian Ye, Wei Huang, Yifei Yu, Tianhe Ren, Zhongrui Wang, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 DBellQuant通过双铃变换实现LLMs预训练后量化,显著提升压缩性能与模型效果。

Comments 19 pages; Appendix added

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18531 2026-01-30 eess.AS cs.AI cs.CL cs.SD 62%

No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS

无可验证的语调奖励:迈向基于偏好的语调学习在TTS中

Seungyoun Shin, Dongha Ahn, Jiwoo Kim, Sungwook Jeon

机构 * Channel Corporation(Channel公司) Kernelspace(Kernelspace公司) Sungkyunkwan University(成均馆大学) NAVER Cloud(NAVER云公司)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于人类偏好的语调优化方法,在KoCC-TTS数据集上实现了更高的语音偏好评分和更优的CER表现,优于传统GRPO方法。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17850 2026-01-30 cs.LG cs.AI 62%

GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning

GEPO:用于稳定异构强化学习的群体期望策略优化

Han Zhang, Ruibin Zheng, Zexuan Yi, Zhuo Zhang, Hanyang Peng, Hui Wang, Zike Yuan, Cai Ke, Shiwei Chen, Jiacheng Yang, Yangning Li, Xiang Li, Jiangyue Yan, Yaoqi Liu, Liwen Jing, Jiayin Qi, Ruifeng Xu, Binxing Fang, Yue Yu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 GEPO通过解耦参数学习与回放采样,提升去中心化异构强化学习的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21985 2026-01-30 cs.LG 57%

Elign: Equivariant Diffusion Model Alignment from Foundational Machine Learning Force Fields

Elign:从基础机器学习力场中等效扩散模型对齐

Yunyang Li, Lin Huang, Luojia Xia, Wenhe Zhang, Mark Gerstein

机构 * Department of Computer Science, Yale University, New Haven, USA(计算机科学系,耶鲁大学,新 Haven,USA) Program in Computational Biology and Biomedical Informatics, Yale University, New Haven, USA(计算生物学与生物医学信息学项目,耶鲁大学,新 Haven,USA) IQuestLab

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 Elign通过结合基础机器学习力场和强化学习优化,实现了等效扩散模型的对齐,提升分子构象生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21943 2026-01-30 cs.LG cs.IT math.IT 57%

Entropy-Based Dimension-Free Convergence and Loss-Adaptive Schedules for Diffusion Models

基于熵的无维度收敛和损失自适应调度方法用于扩散模型

Ahmad Aghapour, Erhan Bayraktar, Ziqing Zhang

机构 * Department of Mathematics, University of Michigan(数学系,密歇根大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出基于熵的无维度收敛方法和损失自适应调度,通过信息论方法提升扩散模型的采样效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11144 2026-01-30 cs.IR cs.AI 57%

Deep GraphRAG: A Balanced Approach to Hierarchical Retrieval and Adaptive Integration

深度图RAG:一种面向层次检索与自适应整合的平衡方法

Yuejie Li, Ke Yang, Tao Wang, Bolin Chen, Bowen Li, Chengjun Mao

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 Deep GraphRAG通过分层检索与自适应整合方法,在效率与全面性之间取得平衡,利用动态奖励机制提升知识整合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏