arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-08 至 2025-12-08 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2512.05464 2025-12-08 cs.CL cs.AI 84%

Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment

动态对齐与集体代理:迈向一个可扩展的自我改进框架以实现开放式的LLM对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Jad Tarifi, Nima Asgharbeygi

机构 * Integral AI

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态对齐框架,通过集体代理价值实现LLM的自我改进和可扩展对齐。

Comments 8 pages, 4 figures, to appear in AAAI 2026 AIGOV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01790 2025-12-08 cs.LG cs.CR 70%

IF-GUIDE: Influence Function-Guided Detoxification of LLMs

IF-GUIDE:影响函数引导的LLM去毒化

Zachary Coalson, Juhan Bae, Nicholas Carlini, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学) University of Toronto(多伦多大学) Anthropic

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 IF-GUIDE通过影响函数主动识别并抑制训练数据中的有害标记,有效减少大语言模型的显性和隐性毒性。

Comments Accepted at NeurIPS 2025 [Poster]

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05740 2025-12-08 cs.CV 50%

Distilling Expert Surgical Knowledge: How to train local surgical VLMs for anatomy explanation in Complete Mesocolic Excision

萃取专家手术知识:如何训练局部手术VLMs用于完全网膜切除术的解剖解释

Lennart Maack, Julia-Kristin Graß, Lisa-Marie Toscha, Nathaniel Melling, Alexander Schlaefer

机构 * 1 Institute of Medical Technology Intelligent Systems, Hamburg University of Technology, Hamburg, Germany 2 Department of General, Visceral Thoracic Surgery, University Medical Center Hamburg-Eppendorf, Hamburg, Germany

专题命中 偏好对齐 :DPO(abstract)

AI总结 本文提出一种隐私保护框架,通过从大型通用LLM中萃取知识,训练出高效的本地手术VLM,用于在完全网膜切除术中进行解剖解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05145 2025-12-08 cs.CV 50%

Self-Improving VLM Judges Without Human Annotations

无需人工标注的自改进VLM评判模型

Inna Wanyin Lin, Yushi Hu, Shuyue Stella Li, Scott Geng, Pang Wei Koh, Luke Zettlemoyer, Tim Althoff, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 偏好对齐 :safety(abstract)

AI总结 无需人工标注,通过自训练提升VLM评判模型的准确性和多维度表现

详情

展开后加载摘要…

URL PDF HTML 收藏