arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-18 至 2025-12-18 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2512.15000 2025-12-18 cs.LG cs.AI cs.CL 87%

DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding

DreamPRM-Code: 一种基于函数作为步骤的进程奖励模型与标签校正用于LLM编码

Ruiyi Zhang, Peijia Qin, Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 DreamPRM-Code通过链式函数提示策略和元学习校正机制,提升LLM在编码任务中的表现,达到LiveCodeBench的最高准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16896 2025-12-18 cs.LG cs.AI 84%

Structure-Aligned Protein Language Model

结构对齐的蛋白质语言模型

Can Chen, David Heurtel-Depeiges, Robert M. Vernon, Christopher James Langmead, Yoshua Bengio, Quentin Fournier

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Chandar Research Lab(钱达尔研究实验室) Polytechnique Montréal(蒙特利尔理工学院) Amgen(安进公司)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过结构对齐方法提升蛋白质语言模型的结构知识,增强其在生物应用中的性能。

Comments 28 pages, 16 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15644 2025-12-18 cs.CV 82%

InpaintDPO: Mitigating Spatial Relationship Hallucinations in Foreground-conditioned Inpainting via Diverse Preference Optimization

InpaintDPO:通过多样偏好优化缓解前景条件修复中的空间关系幻觉

Qirui Li, Yizhe Tang, Ran Yi, Guangben Lu, Fangyuan Zou, Peng Shu, Huan Yu, Jie Jiang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract)

AI总结 InpaintDPO通过多样偏好优化解决前景条件修复中的空间关系幻觉问题,提升背景与前景间的一致性与合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15353 2025-12-18 cs.CL cs.AI 79%

Adversarial versification in portuguese as a jailbreak operator in LLMs

葡萄牙对抗性韵律作为LLMs中的对抗性操作符

Joao Queiroz

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,将提示改写为诗歌能显著提高LLMs的安全漏洞,揭示当前对齐机制的不足,并指出葡萄牙语评估的缺失。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15009 2025-12-18 cs.CV 78%

Model Agnostic Preference Optimization for Medical Image Segmentation

无模型偏好优化用于医学图像分割

Yunseong Nam, Jiwon Jang, Dongkyu Won, Sang Hyun Park, Soopil Kim

机构 * DGIST, School of Undergrad Studies(DGIST研究生院) DGIST, Department of Robotics and Mechatronics Engineering(DGIST机器人与机电工程系) DGIST, Division of Intelligent Robot(DGIST智能机器人系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 MAPO通过Dropout驱动的随机分割假设实现无模型偏好优化,提升医学图像分割的边界遵循性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19895 2025-12-18 cs.AI 70%

RPM-MCTS: Knowledge-Retrieval as Process Reward Model with Monte Carlo Tree Search for Code Generation

RPM-MCTS:基于蒙特卡洛树搜索的知识检索作为过程奖励模型用于代码生成

Yuanyuan Lin, Xiangyu Ouyang, Teng Zhang, Kaixin Sui

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RPM-MCTS通过结合知识检索与蒙特卡洛树搜索,有效评估代码生成过程中的中间步骤,减少错误并提升效率

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14761 2025-12-18 cs.SE cs.AI cs.LG 62%

CAPE: Capability Achievement via Policy Execution

通过策略执行实现能力:CAPE

David Ball

机构 * Superficial Labs(超浅实验室)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 CAPE通过策略执行实现能力,系统性地将要求转化为可执行规范并训练模型默认满足,减少违规率81%,提升能力评估效率。

Comments 32 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏