arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-18 至 2025-08-18 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 3 篇

2508.11255 2025-08-18 cs.CV 78%

FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation

MengChao Wang, Qiang Wang, Fan Jiang, Mu Xu

机构 * Project Leader(项目负责人)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

Comments https://fantasy-amap.github.io/fantasy-talking2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11616 2025-08-18 cs.CV cs.AI cs.CL cs.LG 75%

Controlling Multimodal LLMs via Reward-guided Decoding

Oscar Mañas, Pierluca D'Oro, Koustuv Sinha, Adriana Romero-Soriano, Michal Drozdzal, Aishwarya Agrawal

机构 * Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Meta FAIR Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11363 2025-08-18 cs.LG 57%

Fusing Rewards and Preferences in Reinforcement Learning

Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏