arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-22 至 2025-12-22 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2504.03790 2025-12-22 cs.CL cs.LG stat.ML 84%

Sample, Don't Search: Rethinking Test-Time Alignment for Language Models

样本,而非搜索:重新思考语言模型的测试时间对齐

Gonçalo Faria, Noah A. Smith

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17213 2025-12-22 cs.CV cs.LG 79%

CheXPO-v2: Preference Optimization for Chest X-ray VLMs with Knowledge Graph Consistency

CheXPO-v2:基于知识图谱一致性的胸片视觉-语言模型偏好优化

Xiao Liang, Yuxuan An, Di Wang, Jiawei Hu, Zhicheng Jiao, Bin Jing, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学学院) School of Biomedical Engineering, Capital Medical University(首都医科大学生物医学工程学院)

专题命中 后训练与偏好优化 :preference optimization(title);language model(abstract);分类 cs.LG

AI总结 CheXPO-v2通过知识图谱一致性奖励机制,提升胸片VLMs的临床可靠性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22219 2025-12-22 cs.CL cs.AI 79%

RL from Teacher-Model Refinement: Gradual Imitation Learning for Machine Translation

从教师模型细化进行强化学习:机器翻译中的渐进模仿学习

Dongyub Jude Lee, Zhenyi Ye, Pengcheng He

机构 * Zoom Communications(Zoom公司)

专题命中 后训练与偏好优化 :LLM(abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLfR方法,通过教师模型细化和复合奖励机制提升机器翻译的语义质量和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25123 2025-12-22 cs.AI cs.CL 73%

From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones

从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能

Lifan Yuan, Weize Chen, Yuchen Zhang, Ganqu Cui, Hanbin Wang, Ziming You, Ning Ding, Zhiyuan Liu, Maosong Sun, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17815 2025-12-22 cs.CE q-bio.BM 67%

Structure-Aware Antibody Design with Affinity-Optimized Inverse Folding

具有结构意识的抗体设计与优化结合的反向折叠

Xinyan Zhao, Yi-Ching Tang, Rivaaj Monsia, Victor J. Cantu, Ashwin Kumar Ramesh, Xiaozhong Liu, Zhiqiang An, Xiaoqian Jiang, Yejin Kim

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 SimBinder-IF通过偏好优化提升抗体亲和力,实现高效率的抗体设计与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07313 2025-12-22 cs.CV 67%

DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding

DocR1: 证据页面引导的GRPO用于多页文档理解

Junyu Xiong, Yonghui Wang, Weichao Zhao, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 DocR1通过证据页面引导的GRPO框架,提升多页文档理解能力,实现高质量模型训练与多任务性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22182 2025-12-22 cs.IR cs.AI cs.CV 57%

Sell It Before You Make It: Revolutionizing E-Commerce with Personalized AI-Generated Items

在制作之前就出售它:通过个性化AI生成物品革新电子商务

Jianghao Lin, Peng Du, Jiaqi Liu, Weite Li, Yong Yu, Weinan Zhang, Yang Cao

机构 * Antai College of Economics and Management(经济管理学院) Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 本文提出PerFusion框架,通过个性化AI生成物品提升电子商务的点击率和转化率,同时降低退货率。

Comments Accepted by KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏