arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-22 至 2026-01-22 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2507.09709 2026-01-22 cs.CL cs.LG 86%

Large Language Models Encode Semantics and Alignment in Linearly Separable Representations

大语言模型在线性可分的表示中编码语义和对齐

Baturay Saglam, Paul Kassianik, Blaine Nelson, Sajana Weerawardhena, Yaron Singer, Amin Karbasi

机构 * Yale University(耶鲁大学) Foundation AI – Cisco Systems Inc(Foundation AI – 卡西欧系统公司)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 本研究发现大语言模型通过线性可分的表示编码语义和对齐,提出基于潜在空间的MLP探测器有效提升安全防护。

Comments IJCNLP and the Asian Chapter of ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14528 2026-01-22 cs.CR cs.LG 83%

LLM Security and Safety: Insights from Homotopy-Inspired Prompt Obfuscation

大语言模型的安全性与安全性:基于同调启发的提示混淆洞察

Luis Lazo, Hamed Jelodar, Roozbeh Razavi-Far

机构 * Canadian Institute for Cybersecurity(加拿大网络安全研究所) Faculty of Computer Science(计算机科学学院) University of New Brunswick(新 Brunswick大学)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出基于同调启发的提示混淆框架,通过系统实验揭示LLM安全漏洞,强调对更强大防御机制和鲁棒性改进的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11689 2026-01-22 cs.CY cs.AI cs.CL 67%

Generative AI Purpose-built for Social and Mental Health: A Real-World Pilot

面向社交与心理健康定制的生成式AI:一项现实世界试点

Thomas D. Hull, Lizhe Zhang, Patricia A. Arean, Matteo Malgaroli

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种针对心理健康的生成式AI聊天机器人,通过现实世界试点研究证明其在心理健康支持方面的有效性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17792 2026-01-22 cs.CL cs.AI cs.LG 67%

H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs

H3Fusion: 有助于、无害且诚实的对齐大语言模型融合

Selim Furkan Tekin, Fatih Ilhan, Tiansheng Huang, Sihao Hu, Yichang Xu, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 H3Fusion通过基于MoE的融合机制,在帮助性、无害性和诚实性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10758 2026-01-22 cs.CY cs.AI 62%

Designing AI-Resilient Assessments Using Interconnected Problems: A Theoretically Grounded and Empirically Validated Framework

利用互联问题设计AI鲁棒评估:一种理论严谨且经验证实的框架

Kaihua Ding

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种理论严谨且经验证实的框架,通过设计互联问题来提高评估的AI鲁棒性,挑战了开放性评估的鲁棒性假设,并提供了实证支持和实用设计方法。

Comments 8 pages, 3 figures and 3 tables, under submission to IEEE FIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14686 2026-01-22 cs.AI cs.LG 62%

IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization

IB-GRPO: 通过基于指标的群体相对策略优化对基于大语言模型的学习路径推荐进行对齐

Shuai Wang, Yaoming Yang, Bingdong Li, Hao Hao, Aimin Zhou

机构 * East China Normal University(东华大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 IB-GRPO通过基于指标的群体相对策略优化,解决大语言模型在学习路径推荐中的多目标对齐问题,提升学习效果与教学目标的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15115 2026-01-22 cs.CV 50%

Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning

无需训练的多阶段对抗推理 hateful 视频检测

Shuonan Yang, Yuchen Zhang, Zeyu Fu

机构 * Multimodal Intelligence Lab, Department of Computer Science, University of Exeter, United Kingdom(埃克塞特大学计算机科学系多模态智能实验室) Institute for Analytics and Data Science, University of Essex, United Kingdom(埃塞克斯大学分析与数据科学研究所)

专题命中 安全训练 :safety(abstract)

AI总结 MARS通过多阶段对抗推理框架实现无需训练的可解释仇恨视频检测,提升检测可靠性与透明度。

Comments Accepted at ICASSP 2026. \c{opyright} 2026 IEEE. This is the author accepted manuscript. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14324 2026-01-22 cs.HC 50%

When Generative AI Is Intimate, Sexy, and Violent: Examining Not-Safe-For-Work (NSFW) Chatbots on FlowGPT

当生成AI变得亲密、性感和暴力:检验FlowGPT上的不适宜内容聊天机器人

Xian Li, Yuanning Han, Di Liu, Pengcheng An, Shuo Niu

专题命中 安全训练 :safety(abstract)

AI总结 研究分析FlowGPT上NSFW聊天机器人的类型及用户互动,揭示虚拟亲密、性幻想、暴力表达等特征,提出对聊天机器人设计和内容审核的启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06136 2026-01-22 cs.CR 50%

"Abuse Risks are Often Inherent to Product Features": Exploring AI Vendors' Bug Bounty and Responsible Disclosure Policies

滥用风险往往与产品特性相关

Yangheran Piao, Jingjie Li, Daniel W. Woods

专题命中 安全训练 :alignment(abstract)

AI总结 本文研究了AI供应商在漏洞赏金和负责任披露政策中的风险与实践,发现36%的供应商无明确政策,且数据访问等漏洞最常被纳入范围,而劫持等漏洞则被排除。

Comments At USENIX Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏