arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-14 至 2025-11-14 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4 篇

2507.20067 2025-11-14 cs.AI cs.CL cs.LG 91%

PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training

Sarat Chandra Bobbili, Ujwal Dinesha, Dheeraj Narasimha, Srinivas Shakkottai

机构 * Texas A&M University(德克萨斯A&M大学) Inria(法国国家信息与自动化研究所)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10289 2025-11-14 eess.AS cs.CL 83%

Music Flamingo: Scaling Music Understanding in Audio Language Models

Sreyan Ghosh, Arushi Goel, Lasha Koroshinadze, Sang-gil Lee, Zhifeng Kong, Joao Felipe Santos, Ramani Duraiswami, Dinesh Manocha, Wei Ping, Mohammad Shoeybi, Bryan Catanzaro

机构 * NVIDIA, CA, USA(NVIDIA公司) University of Maryland, College Park, USA(大学)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL

Comments Project Page: https://research.nvidia.com/labs/adlr/MF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10165 2025-11-14 cs.LG q-bio.QM 79%

EPO: Diverse and Realistic Protein Ensemble Generation via Energy Preference Optimization

Yuancheng Sun, Yuxuan Ren, Zhaoming Chen, Xu Han, Kang Liu, Qiwei Ye

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

Comments Accepted as AAAI 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10148 2025-11-14 cs.NE 78%

UCPO: A Universal Constrained Combinatorial Optimization Method via Preference Optimization

Zhanhong Fang, Debing Wang, Jinbiao Chen, Jiahai Wang, Zizhen Zhang

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏