arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-23 至 2025-10-23 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2501.04961 2025-10-23 cs.CL cs.AI cs.CE cs.LG 87%

Demystifying Domain-adaptive Post-training for Financial LLMs

Zixuan Ke, Yifei Ming, Xuan-Phi Nguyen, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 (Oral, ARR best paper nomination)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15020 2025-10-23 stat.ML cs.AI cs.CL cs.LG math.ST stat.TH 85%

The Coverage Principle: How Pre-Training Enables Post-Training

Fan Chen, Audrey Huang, Noah Golowich, Sadhika Malladi, Adam Block, Jordan T. Ash, Akshay Krishnamurthy, Dylan J. Foster

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15061 2025-10-23 cs.LG cs.CL 84%

Antislop: A Comprehensive Framework for Identifying and Eliminating Repetitive Patterns in Language Models

Samuel Paech, Allen Roush, Judah Goldfeder, Ravid Shwartz-Ziv

专题命中 后训练与偏好优化 :language model(title);LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

Comments 11 pages + appendices, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19325 2025-10-23 cs.CL cs.AI 79%

Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization

Junjie Song, Yiwen Liu, Dapeng Li, Yin Sun, Shukun Fu, Siqi Chen, Yuji Cao

机构 * AI-4-Business of Li Auto Inc.(利汽车有限公司AI-4-Business)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01735 2025-10-23 cs.CL cs.LG 79%

LASeR: Learning to Adaptively Select Reward Models with Multi-Armed Bandits

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(杜克大学夏洛特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025 camera-ready. First two authors contributed equally. Code: https://github.com/duykhuongnguyen/LASeR-MAB

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19737 2025-10-23 cond-mat.mtrl-sci 78%

Accelerating Moment Tensor Potentials through Post-Training Pruning

Zijian Meng, Karim Zongo, Matthew Thoms, Ryan Eric Grant, Laurent Karim Béland

专题命中 后训练与偏好优化 :post-training(title,abstract)

Comments 16 pages, 5 figures Software available from https://github.com/RichardZJM/MTP_basis_optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18895 2025-10-23 cs.SE cs.AI cs.HC 77%

CosmoCore Affective Dream-Replay Reinforcement Learning for Code Generation

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19479 2025-10-23 cs.LG cs.AI 76%

Graph Unlearning Meets Influence-aware Negative Preference Optimization

Qiang Chen, Zhongze Wu, Ang He, Xi Lin, Shuo Jiang, Shan You, Chang Xu, Yi Chen, Xiu Su

机构 * Central South University(中南大学) Shanghai Maritime University(上海 Maritime 大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) SenseTime Research(商汤科技研究院) University of Sydney(悉尼大学) Hong Kong University of Science(香港科学大学)

专题命中 后训练与偏好优化 :preference optimization(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19173 2025-10-23 q-fin.CP cs.AI cs.LG 73%

News-Aware Direct Reinforcement Trading for Financial Markets

Qing-Yu Lan, Zhan-He Wang, Jun-Qian Jiang, Yu-Tong Wang, Yun-Song Piao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19050 2025-10-23 cs.AI cs.LG 73%

Rectifying Shortcut Behaviors in Preference-based Reward Learning

Wenqian Ye, Guangtao Zheng, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13656 2025-10-23 cs.LG 57%

Rebalancing with Calibrated Sub-classes (RCS): A Statistical Fusion-based Framework for Robust Imbalanced Classification across Modalities

Priyobrata Mondal, Faizanuddin Ansari, Swagatam Das

机构 * Electronics and Communication Sciences Unit(电子与通信科学单元) Indian Statistical Institute(印度统计研究所)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏