arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-13 至 2026-08-13 共收录 64 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2608.12024 2026-08-13 cond-mat.other physics.ins-det 新提交 50%

Formally Verified Lock-Free Software Transactional Memory for Scientific Measurement

经形式化验证的用于科学测量的无锁软件事务内存

Kentaro Kitagawa

专题命中 其他安全 :safety(abstract)

AI总结 针对科学测量中线程并发访问共享分层状态的问题,提出经形式化验证的无锁STM,实现原子子树操作,通过TLA+和TLC验证属性,接口支持Python脚本与AI自动化,已应用于多种实验。

Comments 15 pages, 7 figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28037 2026-08-13 cs.SE 版本更新 50%

Evolution-Aware Regression Test Prioritization of ML-Enabled Systems Using Gradient-Based Behavior Vectors

基于梯度行为向量的ML系统进化感知回归测试优先级排序

Eunho Cho, Donghwan Shin, In-Young Ko

专题命中 其他安全 :alignment(abstract)

AI总结 提出GBV-PD方法,利用梯度行为向量和参数更新投影,在不运行进化模型的情况下预测测试用例损失变化方向,实现高效的回归测试优先级排序。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新 50%

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12950 2026-08-13 cs.SE 版本更新 50%

Diffploit: Facilitating Cross-Version Exploit Migration for Open Source Library Vulnerabilities

Diffploit:助力开源库漏洞的跨版本漏洞利用迁移

Zirui Chen, Zhipeng Xue, Jiayuan Zhou, Xing Hu, Xin Xia, Xiaohu Yang

专题命中 其他安全 :alignment(abstract)

AI总结 Diffploit是一种迭代的差异驱动漏洞利用迁移方法,通过上下文模块和迁移模块提升跨版本漏洞利用迁移成功率,在大规模Java CVE数据集上表现优于现有工具,还发现了受影响版本范围错误的CVE及未报告的易受攻击版本。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏