arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-28 至 2025-08-28 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4 篇

2505.03233 2025-08-28 cs.RO 82%

GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

Shengliang Deng, Mi Yan, Songlin Wei, Haixin Ma, Yuxin Yang, Jiayi Chen, Zhiqi Zhang, Taoyu Yang, Xuheng Zhang, Wenhao Zhang, Heming Cui, Zhizheng Zhang, He Wang

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19532 2025-08-28 cs.CL 77%

Alignment with Fill-In-the-Middle for Enhancing Code Generation

Houxing Ren, Zimu Lu, Weikang Shi, Haotian Hou, Yunqiao Yang, Ke Wang, Aojun Zhou, Junting Pan, Mingjie Zhan, Hongsheng Li

机构 * CUHK MMLab(CUHK语音实验室) SenseTime Research(商汤科技研究院) CPII under InnoHK(创新香港下的CPII) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北航)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19567 2025-08-28 cs.LG 70%

Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning

Sheryl Mathew, N Harshit

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15842 2025-08-28 cs.CV cs.GR 50%

DiffArtist: Towards Structure and Appearance Controllable Image Stylization

Ruixiang Jiang, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(abstract)

Comments Accepted to ACM MM 2025, Homepage: https://DiffusionArtist.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏