arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3309 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3309 篇

2607.13070 2026-07-22 cs.SE cs.AI 版本更新 61%

Falsifiable Release Gates for Self-Improving Systems: Standing Invariants at Scale

用于自我改进系统的可证伪发布门限

Deepak Soni

机构 * AI Architect(人工智能架构师)

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

AI总结 研究自我改进系统安全声明,提出可证伪发布门限及构建验证方法,在Antahkarana运行时应用,经机器检查确保安全,发布验收结果,明确范围,使结果可重现、门限可在其他框架运行。

Comments 23 pages, 14 figures. Major revision merging the follow-up "Standing Invariants at Scale" into this paper per arXiv moderation: the machine-checked action-safety core preserved across six further releases, six new invariant families with teeth, and real-hardware self-improvement; suite grown from 122 to 563 tests. Software, gate suite, run artifacts, and TLA+ spec are open source

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26542 2026-07-02 cs.CR cs.AI 版本更新 61%

ChainCaps: Composition-Safe Tool-Using Agents via Monotonic Capability Attenuation

ChainCaps: 通过单调能力衰减实现组合安全的工具使用智能体

Xiaochong Jiang, Shiqi Yang, Ziwei Li, Lifei Liu, Haoran Yu, Yichen Liu

机构 * Independent Researcher, Seattle, WA, USA(华盛顿州塞勒姆独立研究员) Independent Researcher, New York City, NY, USA(纽约市纽约独立研究员) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学技术大学)

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

AI总结 针对工具组合中的权限洗钱漏洞,提出ChainCaps机制,通过运行时能力预算交集传播规则,在不修改智能体或工具服务器的情况下,将攻击成功率从25-68%降至0-4.8%,同时保持96-100%的良性任务完成率。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26649 2026-06-26 cs.AI cs.CR 新提交 61%

Autoformalization of Agent Instructions into Policy-as-Code

智能体指令的自动形式化为策略即代码

Adam Mondl, Matthew Maisel, John H. Brock

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

AI总结 提出自动形式化流水线,通过LLM生成-批评循环将智能体提示和自然语言策略转化为Cedar策略语言,在MedAgentBench上比手工编码覆盖更多规范。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19658 2025-05-27 cs.SE cs.AI 61%

Large Language Models in Code Co-generation for Safe Autonomous Vehicles

Ali Nouri, Beatriz Cabrero-Daniel, Zhennan Fei, Krishna Ronanki, Håkan Sivencrona, Christian Berger

机构 * Volvo Cars(沃尔沃汽车公司) University of Gothenburg(哥德堡大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

Comments Accepted in the 44th International Conference on Computer Safety, Reliability and Security (SafeComp 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10737 2024-11-06 cs.SE cs.AI 61%

AutoSafeCoder: A Multi-Agent Framework for Securing LLM Code Generation through Static Analysis and Fuzz Testing

Ana Nunez, Nafis Tanveer Islam, Sumit Kumar Jha, Peyman Najafirad

专题命中 安全训练 :safety(abstract);分类 cs.AI;trustworthy(comments)

Comments Accepted to NeurIPS 2024 Workshop on Safe & Trustworthy Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01850 2024-10-04 cs.LG 61%

An Early-Stage Workflow Proposal for the Generation of Safe and Dependable AI Classifiers

Hans Dermot Doran, Suzana Veljanovska

专题命中 安全训练 :safety(abstract,comments);分类 cs.LG

Comments 43rd International Conference on Computer Safety, Reliability and Security (SafeComp2024), Florence, Italy, September 17-20.2024

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.01074 2020-10-15 cs.LG stat.ML 61%

Formal Language Constraints for Markov Decision Processes

Eleanor Quint, Dong Xu, Samuel Flint, Stephen Scott, Matthew Dwyer

专题命中 安全训练 :safety(abstract,comments);分类 cs.LG

Comments NeurIPS 2019 Workshop on Safety and Robustness in Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.07189 2019-05-31 cs.RO cs.AI 61%

Reinforcement Learning with Probabilistic Guarantees for Autonomous Driving

Maxime Bouton, Jesper Karlsson, Alireza Nakhaei, Kikuo Fujimura, Mykel J. Kochenderfer, Jana Tumova

专题命中 安全训练 :safety(abstract,journal_ref);分类 cs.AI

Journal ref Workshop on Safety Risk and Uncertainty in Reinforcement Learning, Conference on Uncertainty in Artificial Intelligence (UAI), 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24214 2026-08-26 cs.AI 新提交 57%

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

MetaRAG:面向智能体检索增强生成的信念-行动对齐策略优化

Qiuyi Qi, Tian Liang, Jiamu Wang, Jinjian Zhang, Wei Zhou, Pengcheng Zhu, Linjian Mo, Ming Kong, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 MetaRAG是面向智能体RAG的信念-行动对齐策略优化框架,通过优先验证的行动生成与内部信念探测,提升了智能体RAG的准确率-效率权衡,收益可迁移至多种场景与模型。

Comments EMNLP 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23941 2026-08-26 cs.AI 新提交 57%

More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Oversight

更多弃权(不执行),而非更强判别性:预执行大语言模型监督中的验证单元

Yuchen Han, Cheng Yan, Wuyang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对预执行LLM监督的验证单元问题,提出双前缀框架,发现一或两个行动的短验证单元信息性最高,更长窗口会使监控器更倾向于弃权而非提升判别性。

Comments 37 pages, 20 figures, 32 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17277 2026-08-26 cs.RO cs.LG 57%

Building Real-time Awareness of Out-of-distribution in Trajectory Prediction for Autonomous Vehicles

Tongfe Guo, Taposh Banerjee, Rui Liu, Lili Su

机构 * Northeastern University(东北大学) University of Pittsburgh(匹兹堡大学) Kent State University(肯特州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22797 2026-08-25 cs.AI 新提交 57%

Performance of a domain-specific large language model in answering patient questions in psychiatry

面向精神病学领域的专用大语言模型在回答患者问题时的性能表现

Alexander J. Hish, Arjun Nagendran, Scott N. Compton

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究开发了专用LLM MIND,对比ChatGPT、OpenEvidence回答患者关于艾司西酞普兰的问题,发现MIND评分更高但医生更偏好ChatGPT,为构建精神病学安全LLM提供了进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22752 2026-08-25 cs.AI cs.IR 新提交 57%

The Compaction Cliff in Long-Running AI Agent Memory

长期运行AI智能体记忆中的压缩 cliff

Saber Zerhoudi, Jelena Mitrovic, Michael Granitzer

机构 * University of Passau(帕绍大学) IT:U

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对AI智能体记忆压缩时安全规则保留率骤降的压缩cliff问题,提出Knowledge Triage框架,通过三类算子优化上下文管理,在多基准测试中优于现有方法,并发布了相关数据集与工具。

Journal ref Proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22615 2026-08-25 cs.AI 新提交 57%

DeepSAGE: Stage-Aware Reinforcement Learning for Structured CBT Counseling Dialogue

DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习

Qi Zhang, Heajun An, Prakriti Dumaru, Sang Won Lee, Lifu Huang, Pamela J. Wisniewski, Jin-Hee Cho

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DeepSAGE是融合LLM与DRL的阶段感知咨询对话框架,经评估在阶段目标完成与对话效率上优于6种替代方案,为AI咨询提供了有前景的新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21803 2026-08-25 cs.CR cs.AI 新提交 57%

ExplainGuard: A Zero Trust Framework for Post-Hoc Explanation Integrity Guarantees in Blackbox XAI Models

ExplainGuard:一种用于黑盒XAI模型事后解释完整性保证的零信任框架

Maraz Mia, Shovan Roy, Mir Mehedi A. Pritom, Maanak Gupta

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出ExplainGuard零信任框架,通过策略决策点的三项验证支柱,中和XAI解释操纵攻击,将审计过程转为可验证操作,保障黑盒XAI模型事后解释的完整性。

Comments 9 pages, 2 figures. Accepted at the IEEE Cybersecurity Awareness and Research Symposium 2026 (IEEE CARS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21501 2026-08-25 cs.AI 新提交 57%

Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning

让信用跟随计算:面向大语言模型强化学习的架构感知信用传输

Qifan Shi, Zhaolu Kang, Chenghua Zhu

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究针对大语言模型强化学习的信用传输算子与架构无关的问题,提出计算条件信用传输框架及 CompPO 算法,在 Qwen3-4B 等模型上较 GRPO 取得更优的保留准确率与贪心评估表现。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14685 2026-08-25 cs.LG stat.ML 版本更新 57%

Rethinking Reverse KL as Adaptive Entropy Distillation

将反向KL重新思考为自适应熵蒸馏

Shizhen Li, Zhiyu Shen, Yuyin Lu, Yunhe Pang, Jielin Song, Yanghui Rao, Fu Lee Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-08-25 cs.CV cs.CL 版本更新 57%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00424 2026-08-24 cs.AI 版本更新 57%

Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏

Can Jin, Jiakang Li, Rui Wu, Eddy Z. Zhang, Dimitris N. Metaxas

机构 * University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17588 2026-08-19 cs.AI cs.SE 新提交 57%

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17583 2026-08-19 cs.CL 新提交 57%

Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

使用多模态语言模型对TikTok上的有害内容暴露情况进行审计:一项跨国、按年龄分层的研究

Hamidreza Saffari, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究使用多模态大语言模型Gemini 2.5 Flash,在法、意、瑞三国对TikTok开展跨国年龄分层审计,发现关键词搜索会大幅提升有害内容占比,意国各年龄组有害内容占比最高,平台安全过滤器低估了明确有害内容。

Comments 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17520 2026-08-19 cs.CY 新提交 57%

Ready for What? Rethinking AI and Robotics Preparedness for Adoption and Policy

准备好应对什么?反思人工智能与机器人技术在应用和政策层面的准备情况

Peng Wang, Naomi Adel, Amy E. Morgan, Folayo Aina, Demos Parapanos, Vikas Mackevicius, Teslim Olayiwola Salahudeen

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 该研究通过分析982名参与者对17项AI与机器人技术挑战的15200次评估,揭示了挑战复杂性、重要性与准备度的关联,指出政策制定者需关注挑战特有障碍及同一利益相关者的内部差异。

Comments 33 pages, including supplementary. 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 57%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交 57%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: https://lego-rl.pages.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17067 2026-08-19 cs.AI 新提交 57%

DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

机构 * Qualcomm AI Research(高通人工智能研究院) King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16177 2026-08-19 cs.CR cs.AI 版本更新 57%

Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm

用米尔格拉姆范式测量大型语言模型对权威的服从性

Hidayet Aksu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究将米尔格拉姆服从范式迁移至LLMs,测量42个模型的服从性概况,发现服从性异质性高、具模型特异性,受情境因素影响,且反映检查点而非模型谱系。

Comments 11 pages, 7 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24126 2026-08-19 cs.LG cs.PL 版本更新 57%

Likelihood Hacking in Probabilistic Program Synthesis

概率程序合成中的似然黑客行为

Jacek Karwowski, Younesse Kaddar, Zihuiwen Ye, Esmeralda S. Whitammer, Sam Staton

机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) University of Edinburgh, School of Informatics(爱丁堡大学信息学院) CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。

Journal ref Proceedings of the 42nd Conference on Uncertainty in Artificial Intelligence, PMLR 337:2744-2791, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16888 2026-08-18 cs.LG 新提交 57%

Q-based Variational Inverse Reinforcement Learning

基于Q的变分逆强化学习

Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis, Maike Osborne

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出新型贝叶斯逆强化学习方法QVIRL,兼具可扩展性与不确定性量化能力,在多类任务的学徒学习中表现优异,是首个可从原始像素观测训练的贝叶斯IRL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交 57%

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: https://grange007.github.io/HAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15772 2026-08-18 cs.AI 新提交 57%

Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration

大语言模型拒绝回答中的对称性破缺:答案释放比拒绝恢复更具局部性

Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究通过受控保留设置揭示大语言模型拒绝回答存在对称性破缺:答案释放具高度局部性,拒绝恢复需更广干预,拒绝并非简单对称开关,对安全审计具启示。

详情

展开后加载摘要…

URL PDF HTML 收藏