arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-23 至 2026-02-23 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2507.09650 2026-02-23 cs.LG 79%

Cultivating Pluralism In Algorithmic Monoculture: The Community Alignment Dataset

在算法单一性中培育多元主义:社区对齐数据集

Lily Hong Zhang, Smitha Milli, Karen Jusko, Jonathan Smith, Brandon Amos, Wassim Bouaziz, Manon Revel, Jack Kussman, Yasha Sheynin, Lisa Titus, Bhaktipriya Radharapu, Jane Yu, Vidya Sarma, Kris Rose, Maximilian Nickel

机构 * FAIR at Meta(Meta 的 FAIR 部门) Governance at Meta(Meta 的治理部门) AI at Meta(Meta 的人工智能部门) Social Issues Research at Meta(Meta 的社会问题研究部门) AI Policy Team at Meta(Meta 的人工智能政策团队) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文通过构建社区对齐数据集,探讨如何通过负相关采样提升LLM对不同偏好的适应能力,推动算法多元主义发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17695 2026-02-23 cs.LG cs.AI cs.IR 62%

EXACT: Explicit Attribute-Guided Decoding-Time Personalization

EXACT: 显式属性引导的解码时个性化

Xin Yu, Hanwen Xing, Lingzhou Xue

机构 * Department of Statistics, the Pennsylvania State University, PA, USA(统计系,宾夕法尼亚州立大学) University of Southern California, CA, USA(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 EXACT通过显式属性引导解码时个性化,利用预定义可解释属性提升生成质量,有效缓解上下文偏好变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17814 2026-02-23 cs.CV cs.IR cs.LG 57%

VQPP: Video Query Performance Prediction Benchmark

VQPP:视频查询性能预测基准

Adrian Catalin Lutu, Eduard Poesina, Radu Tudor Ionescu

机构 * University of Bucharest / Bitdefender(布加勒斯大学/Bitdefender) University of Bucharest(布加勒斯大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出VQPP基准,用于视频查询性能预测,包含两个数据集和两个系统,探索预检索和后检索预测器,并展示其在训练大型语言模型上的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏