arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-27 至 2025-11-27 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2511.14476 2025-11-27 cs.AI 90%

Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior

在大型语言模型对齐中操作多元价值观揭示了安全、包容性和模型行为之间的权衡

Dalia Ali, Dora Zhao, Allison Koenecke, Orestis Papakyriakopoulos

机构 * Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本研究探讨了在大型语言模型对齐中融入多元价值观的影响,发现不同群体偏好和设计选择对模型行为和安全性有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19387 2025-11-27 cs.LG cs.SY eess.SY math.OC 90%

Alignment of large language models with constrained learning

受限学习下的大语言模型对齐

Botong Zhang, Shuo Li, Ignacio Hounie, Osbert Bastani, Dongsheng Ding, Alejandro Ribeiro

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 本文提出了一种基于拉格朗日对偶性的迭代对偶对齐方法,用于在满足约束条件下优化大语言模型策略,通过实验验证了其在受限对齐问题中的有效性。

Comments 51 pages, 5 figures, 11 tables; Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19474 2025-11-27 cs.LG 88%

g-DPO: Scalable Preference Optimization for Protein Language Models

g-DPO:可扩展的偏好优化用于蛋白质语言模型

Constance Ferragu, Jonathan D. Ziegler, Nicolas Deutschmann, Arthur Lindoulsi, Eli Bixby, Cradle ML Team

机构 * Cradle ML Team(Cradle团队) Cradle Zürich, Switzerland(Cradle瑞士苏黎世)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);分类 cs.LG

AI总结 g-DPO通过序列聚类和组近似方法提升蛋白质语言模型的偏好优化效率,实现更快的收敛速度和与标准DPO相当的性能。

Comments Accepted at two workshops: FM4LS NeurIPS 2025 (accepted-paper.html" target="_blank" rel="noopener">https://nips2025fm4ls.github.io/pages/accepted-paper.html) and MLSB in Copenhagen EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21592 2025-11-27 cs.CV 78%

MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training

通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量

Haotian Xue, Qi Chen, Zhonghao Wang, Xun Huang, Eli Shechtman, Jinrong Xie, Yongxin Chen

机构 * Adobe(Adobe公司) Georgia Tech(佐治亚理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21638 2025-11-27 cs.LG 77%

Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO

通过迭代PPO对齐大语言模型以实现多轮对话结果

Daniel R. Jiang, Jalaj Bhandari, Yukai Yang, Rémi Munos, Tyler Lu

机构 * Meta FAIR at Meta(Meta的FAIR)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21270 2025-11-27 cs.SD cs.CV 75%

Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale

多奖励GRPO用于大规模稳定且有声调的单代码本TTS LLMs

Yicheng Zhong, Peiji Yang, Zhisheng Wang

机构 * Tencent Technology Co.Ltd(腾讯科技有限公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出多奖励GRPO框架,通过优化单代码本TTS LLMs的生成策略,提升语音的语调稳定性、说话者相似性和自然度。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20351 2025-11-27 cs.CV 50%

Thinking in 360°: Humanoid Visual Search in the Wild

全方位思考:野外人形视觉搜索

Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li

机构 * NYU(纽约大学) NVIDIA(英伟达) TU Darmstadt(图鲁姆大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。

Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar

详情

展开后加载摘要…

URL PDF HTML 收藏