arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-14 至 2025-11-14 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2507.20067 2025-11-14 cs.AI cs.CL cs.LG 82%

PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training

Sarat Chandra Bobbili, Ujwal Dinesha, Dheeraj Narasimha, Srinivas Shakkottai

机构 * Texas A&M University(德克萨斯A&M大学) Inria(法国国家信息与自动化研究所)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21597 2025-11-14 cs.CL cs.AI cs.LG 67%

Reducing the Scope of Language Models

David Yunis, Siyu Huo, Chulaka Gunasekara, Danish Contractor

机构 * Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) IBM(IBM公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Appears in AAAI 2026 in the Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10032 2025-11-14 cs.HC cs.AI cs.CY 66%

Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback

Vijay Keswani, Cyrus Cousins, Breanna Nguyen, Vincent Conitzer, Hoda Heidari, Jana Schaich Borg, Walter Sinnott-Armstrong

机构 * Duke University(杜克大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :alignment(abstract,comments);分类 cs.AI、cs.CY

Comments To appear in the AAAI 2026 Alignment Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10279 2025-11-14 cs.CV 50%

PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning

Yanbei Jiang, Chao Lei, Yihao Ding, Krista Ehinger, Jey Han Lau

机构 * University of Melbourne(墨尔本大学)

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏