arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-26 至 2025-11-26 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2505.09341 2025-11-26 cs.AI 70%

Access Controls Will Solve the Dual-Use Dilemma

访问控制将解决双重用途困境

Evžen Wybitul

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出基于访问控制的概念框架,通过验证用户访问双重用途输出,以解决人工智能安全系统在双重用途请求中的决策困境。

Comments Accepted at ICML 2025 Workshop on Technical AI Governance (TAIG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20104 2025-11-26 cs.LG cs.AI cs.CL 67%

The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs

细节中的魔鬼:开放权重语言模型中的涌现偏移、格式与连贯性

Craig Dickson

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了开放权重语言模型中的涌现偏移现象,发现格式约束如JSON输出会增加偏移率,而Qwen-2.5系列比GPT-4o更抗压。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19644 2025-11-26 cs.CR cs.AI 57%

IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response

IRSDA:面向企业入侵响应的智能体协调框架

Damodar Panigrahi, Raj Patel, Shaswata Mitra, Sudip Mittal, Shahram Rahimi

机构 * Mississippi State University(密苏里州立大学) The University of Alabama(阿拉巴马大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 IRSDA是一种基于智能体的入侵响应框架,结合自适应计算与知识引导循环,实现自动化防御和政策合规性,提升企业网络安全响应效率与可解释性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01813 2025-11-26 cs.MA cs.CL cs.GT 57%

ShortageSim: Simulating Drug Shortages under Information Asymmetry

ShortageSim: 在信息不对称下模拟药品短缺

Mingxuan Cui, Yilan Jiang, Duo Zhou, Cheng Qian, Yuji Zhang, Qiong Wang

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 ShortageSim通过模拟信息不对称下的药品短缺情况,提供了一个评估监管干预效果的框架,减少了生产中断的解决延迟,推动了供应链政策研究的发展。

Comments Accepted by AAAI 2026. Oral presentation. 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20617 2025-11-26 cs.SE cs.PL 50%

Translating Large-Scale C Repositories to Idiomatic Rust

将大规模C仓库翻译为idiomatic Rust

Saman Dehghan, Tianran Sun, Tianxiang Wu, Zihan Li, Reyhaneh Jabbarvand

专题命中 安全训练 :safety(abstract)

AI总结 Rustine是一种高效自动化的C到idiomatic Rust翻译工具,实现了高质量的功能等价性,比现有方法更安全、更idiomatic且更易读。

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19691 2025-11-26 cs.RO 50%

Multi-Agent gatekeeper: Safe Flight Planning and Formation Control for Urban Air Mobility

多智能体守门人:面向城市空中交通的安全飞行规划与编队控制

Thomas Marshall Vielmetti, Devansh R Agrawal, Dimitra Panagou

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Robotics(机器人学系) Department of Robotics and Department of Aerospace Engineering(机器人学系和航空航天工程系)

专题命中 安全训练 :safety(abstract)

AI总结 多智能体守门人框架通过安全轨迹备份和碰撞避免算法,实现城市空中交通中的安全飞行规划与编队控制。

Comments 13 pages, 4 figures, to appear AIAA SciTech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18617 2025-11-26 cs.RO cs.CV 50%

AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations

AutoFocus-IL:基于视觉语言模型的数据高效视觉模仿学习中的显著性图

Litian Gong, Fatemeh Bahrani, Yutai Zhou, Amin Banayeeanzade, Jiachen Li, Erdem Bıyık

机构 * Department of Electrical and Computer Engineering, University of California, Riverside, USA(电气与计算机工程系,加州大学河滨分校) Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学)

专题命中 安全训练 :alignment(abstract)

AI总结 AutoFocus-IL通过视觉语言模型自动生成显著性图,提升视觉模仿学习的数据效率和泛化能力,无需额外人类标注。

Comments 8 pages, 6 figures. Code and datasets available at http://autofocus-il.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02025 2025-11-26 cs.SE 50%

SAFE: Harnessing LLM for Scenario-Driven ADS Testing from Multimodal Crash Data

SAFE: 借助LLM从多模态碰撞数据中驱动场景的ADS测试

Siwei Luo, Yang Zhang, Yao Deng, Linfeng Liang, Xi Zheng

专题命中 安全训练 :safety(abstract)

AI总结 SAFE通过多模态提取和LLM技术,提升从碰撞数据中重建真实场景和检测安全违规的能力,实现高准确率和高效生成。

Comments The paper has been accepted for publication in the proceedings of the IEEE/ACM 48th International Conference on Software Engineering to be held 12-18 April 2026 (ICSE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19450 2025-11-26 cs.DC 50%

AI-driven Predictive Shard Allocation for Scalable Next Generation Blockchains

基于AI的预测性分片分配用于可扩展下一代区块链

M. Zeeshan Haider, Tayyaba Noreen, M. D. Assuncao, Kaiwen Zhang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出PSAP协议,通过预测性分片分配提升区块链可扩展性,实验显示吞吐量提升2倍,延迟降低35%

详情

展开后加载摘要…

URL PDF HTML 收藏