arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 4 篇

2602.06869 2026-02-09 cs.CL cs.LG 81%

Uncovering Cross-Objective Interference in Multi-Objective Alignment

揭示多目标对齐中的跨目标干扰

Yining Lu, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CTWA方法,通过保持目标奖励与训练信号的正协方差来缓解多目标对齐中的跨目标干扰问题,并分析了干扰与模型几何属性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04210 2026-02-09 cs.AI cs.LG 62%

Steering LLMs via Scalable Interactive Oversight

通过可扩展的交互监督引导大语言模型

Enyu Zhou, Zhiheng Xi, Long Ma, Zhihao Zhang, Shihan Dou, Zhikai Lei, Guoteng Wang, Rui Zheng, Hang Yan, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出可扩展的交互监督框架,通过递归决策树提升人类对AI任务的引导能力,实现非专家生成高质量产品需求文档,并通过强化学习优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14625 2026-02-09 cs.CL cs.AI 62%

Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models

概率聚合与定向嵌入优化用于大语言模型中的集体道德推理

Chenchen Yuan, Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06325 2026-02-09 cs.CR cs.SE 50%

Identifying Adversary Tactics and Techniques in Malware Binaries with an LLM Agent

利用LLM代理识别恶意软件二进制中的攻击战术与技术

Zhou Xuan, Xiangzhe Xu, Mingwei Zheng, Louis Zheng-Hua Tan, Jinyao Guo, Tiantai Zhang, Le Yu, Chengpeng Wang, Xiangyu Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 TTPDetect通过结合密集检索与LLM神经检索,利用LLM代理识别恶意软件二进制中的TTPs,实现高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏