arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-22 至 2025-12-22 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2504.03790 2025-12-22 cs.CL cs.LG stat.ML 84%

Sample, Don't Search: Rethinking Test-Time Alignment for Language Models

样本,而非搜索:重新思考语言模型的测试时间对齐

Gonçalo Faria, Noah A. Smith

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.LG

AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17213 2025-12-22 cs.CV cs.LG 70%

CheXPO-v2: Preference Optimization for Chest X-ray VLMs with Knowledge Graph Consistency

CheXPO-v2:基于知识图谱一致性的胸片视觉-语言模型偏好优化

Xiao Liang, Yuxuan An, Di Wang, Jiawei Hu, Zhicheng Jiao, Bin Jing, Quan Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Warren Alpert Medical School of Brown University(布朗大学沃伦·阿尔珀特医学学院) School of Biomedical Engineering, Capital Medical University(首都医科大学生物医学工程学院)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 CheXPO-v2通过知识图谱一致性奖励机制,提升胸片VLMs的临床可靠性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22219 2025-12-22 cs.CL cs.AI 62%

RL from Teacher-Model Refinement: Gradual Imitation Learning for Machine Translation

从教师模型细化进行强化学习:机器翻译中的渐进模仿学习

Dongyub Jude Lee, Zhenyi Ye, Pengcheng He

机构 * Zoom Communications(Zoom公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLfR方法,通过教师模型细化和复合奖励机制提升机器翻译的语义质量和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22182 2025-12-22 cs.IR cs.AI cs.CV 57%

Sell It Before You Make It: Revolutionizing E-Commerce with Personalized AI-Generated Items

在制作之前就出售它:通过个性化AI生成物品革新电子商务

Jianghao Lin, Peng Du, Jiaqi Liu, Weite Li, Yong Yu, Weinan Zhang, Yang Cao

机构 * Antai College of Economics and Management(经济管理学院) Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出PerFusion框架,通过个性化AI生成物品提升电子商务的点击率和转化率,同时降低退货率。

Comments Accepted by KDD 2026 ADS Track

详情

展开后加载摘要…

URL PDF HTML 收藏