arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 37 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 37 篇

2508.20766 2026-09-01 cs.CL cs.AI cs.LG 版本更新 89%

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection

反转思路:通过单秩安全注入实现轻量级对齐增强

Harethah Abu Shairah, Hasan Abed Al Kader Hammoud, George Turkiyyah, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡布尔大学科学与技术学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出单秩安全注入(ROSI)这一无需微调的白盒方法,通过修改模型权重增强 LLM 安全对齐,可提升安全拒绝率且保留模型效用,还可重新对齐未审查模型,是高效的 LLM 安全改进机制。

Comments EMNLP 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29936 2026-09-01 cs.CL cs.LG 新提交 84%

When Safety Speaks a Language: A Mechanistic Analysis of Safety-Language Identity Entanglement in LLMs

当安全“说”一种语言:大语言模型中安全-语言身份纠缠的机制分析

Apoorva Upadhyaya, Sandipan Sikdar

机构 * L3S Research Center(L3S研究中心) Leibniz Universität Hannover(汉诺威莱布尼茨大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过稀疏自编码器特征分析,揭示大语言模型中安全与语言身份的纠缠机制,发现安全相关特征具架构依赖性,为多语言安全干预提供机制解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25201 2026-09-01 cs.CL cs.CY 版本更新 84%

SafeMath: Inference-time Safety improves Math Accuracy

SafeMath: 在推理过程中提升安全性以提高数学准确性

Sagnik Basu, Subhrajit Mitra, Aman Juneja, Somnath Banerjee, Rima Hazra, Animesh Mukherjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院克勒格布尔分校) Cisco Systems(思科系统公司) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文研究了有害数学问题对LLM的影响,提出SafeMath技术在保障安全的同时提升数学推理能力。

Comments Accepted in EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30750 2026-09-01 cs.LG 新提交 83%

Do VLMs Share Safety Neurons Across Modalities?

视觉语言模型(VLMs)是否在不同模态间共享安全神经元?

Jiaxuan Li, Jiahao Zhang, Duc Minh Vo, Huy H. Nguyen, Pride Kavumba, Koki Wataoka

机构 * SB Intuitions Corp.(SB Intuitions公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 该研究针对10个视觉语言模型,通过因果神经元层面分析,提出两阶段迭代消融检测流程与两个模态隔离基准,发现文本安全神经元集中、视觉安全高维弥散的差距,解释了当前对齐未缩小视觉安全差距的原因。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30197 2026-09-01 cs.CL cs.SE 新提交 83%

ALTSTEER: Selective Safety Steering for Moving Beyond Hard Refusals to Constructive Alternatives

ALTSTEER:用于超越生硬拒绝并构建建设性替代方案的选择性安全引导

Hoejoon Kwon, Byeonggeuk Lim, Kahyeon Kim, YoungBin Kim

机构 * Chung-Ang University(中央大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 该研究提出推理时框架ALTSTEER,结合选择性干预与拒绝锚定的建设性重定向,在Llama-3.1和Qwen2.5上验证其可保持良性效用并提升建设性安全完成行为。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22118 2026-09-01 cs.AI 版本更新 83%

Defining Operational Conditions for Safety-Critical AI-Based Systems from Data

从数据定义安全关键AI系统的操作条件

Johann Maximilian Christensen, Elena Hoemann, Frank Köster, Sven Hallerbach

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多维核表示的方法,从已有数据后验定义安全关键AI系统的操作条件领域,以实现更有效的认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02665 2026-09-01 cs.CR cs.AI cs.CL 版本更新 81%

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

单一规范提示低估了大语言模型安全的表面形式敏感性

Yongxi Zhou, Junwei Yao, Yuanzhe Liu, Zihan Dong, Wenbo Ye, Jiaxi Wen, Lai Yun Choi

机构 * Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) University of Southern California(南加利福尼亚大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。

Comments Accepted at the Sci-FM Workshop @ COLM 2026 (non-archival). Workshop version with reviews: this https URL (https://openreview.net/forum?id=mZh0MqpOOC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00610 2026-09-01 cs.CY cs.AI 版本更新 81%

Multimodal Large Language Models Predict Urban Safety Perception but Encode Non-Neutral Demographic Priors

多模态大语言模型可预测城市安全感知,但编码非中立的人口统计先验

Ciro Beneduce, Bruno Lepri, Massimiliano Luca

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 该研究验证多模态大语言模型可规模化预测城市安全感知,但发现其存在非中立人口统计先验,不同性别、种族角色下的安全判断存在系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30585 2026-09-01 cs.LG 新提交 79%

The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

角色扮演越狱中的安全继电器:对有害内容识别与拒绝的组件解析因果分析

Md Mokarram Chowdhury, Ernie Chang, Yang Li

机构 * Iowa State University(爱荷华州立大学) Meta

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本研究通过机制可解释性分析角色扮演越狱中模型服从有害请求的机制,发现安全继电器衰减等规律,明确了安全措施需维持有害识别到拒绝的关联。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27580 2026-09-01 cs.AI 版本更新 79%

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10014 2026-09-01 cs.RO cs.LG cs.MA eess.SY 版本更新 79%

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤

Alex Zongo, Peng Wei

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。

Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29379 2026-09-01 cs.RO 新提交 71%

Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation

用受约束的大语言模型(LLM)弥合语义与物理鸿沟,实现安全可信的机器人操纵

Wenhao Hong, Lan Wei, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

专题命中 安全训练 :trustworthy(title)

AI总结 该研究针对语言引导机器人操纵的语言-动作鸿沟,通过类型化契约约束LLM决策,结合MoveIt流水线验证,在多类机器人任务上实现了优于脚本策略的安全可靠性能。

Comments ECCV Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30856 2026-09-01 cs.CL cs.HC 新提交 70%

You Shouldn't Have Asked: A Pragmatics-Inspired Taxonomy for Evaluating LLM Refusals

你本不该问:一种受语用学启发的评估大语言模型(LLM)拒绝行为的分类法

Ruoxuan Li, Pinqiao Wang, Sheng Li, Cameron Robert Jones

机构 * Stony Brook University(石溪大学) University of Virginia(弗吉尼亚大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 该研究提出首个基于语用学理论的LLM拒绝分类法,通过分析16个LLM在14类有害请求下的拒绝回复,发现其拒绝的特点及存在的问题,呼吁开展兼顾情境适应性与社会问责的对齐评估。

Comments To appear in the Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04483 2026-09-01 cs.CL 版本更新 70%

Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments Accepted by EMNLP 2026 Main Conference, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30703 2026-09-01 cs.CR cs.AI cs.CL cs.LG 新提交 67%

SingProbe Technical Report

SingProbe 技术报告

Sing Team

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SingProbe 是一种轻量级 LLM 内在运行时护栏,复用 LLM 隐藏状态以 token 级别预测意图、安全性与幻觉风险,仅约 200 万参数、额外开销<0.5%,还可指导安全解码,其衍生的 SingProbe-Med 可用于医疗生成的风险干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30581 2026-09-01 cs.AI cs.LG 新提交 62%

Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle

使用模型检验作为神谕对基于大语言模型(LLM)的事后解释器进行自动化测试

Dennis Gross, Helge Spieker

机构 * Institut für Kommunikations- und Prüfungsforschung gGmbH(通信与测试研究院(非营利有限责任公司)) Simula Research Laboratory(Simula研究院)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出以概率模型检验为神谕、结合事后查询分类法,实现对基于LLM的事后解释器的自动化测试,在7个MDP环境中区分出不同规模LLM的解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28844 2026-09-01 cs.HC cs.AI cs.LG 新提交 62%

Toward Postural State Classification in Immersive VR with Multimodal Data and Explainability Analysis

基于多模态数据与可解释性分析的沉浸式VR姿态状态分类研究

Nipa Anjum, Md Irfan Pavel, Robert Gonzalez Jr, Kevin Desai, Alberto Cordova, M. Rasel Mahmud, John Quarles

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用MI-CNN模型结合多模态数据与SHAP可解释性分析,实现VR中平衡与不平衡姿态的二分类,准确率达96.76%,降维后仍保持良好性能,为安全VR系统提供支撑。

Comments Accepted in The 25th IEEE International Symposium on Mixed and Augmented Reality (ISMAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-09-01 cs.SE cs.AI cs.ET cs.LG 交叉投稿 62%

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc(EmbodyX公司) Aibao LLC(Aibao有限责任公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29089 2026-09-01 cs.LG cs.AI cs.CV 版本更新 62%

OISD: On-Policy Internal Self-Distillation of Language Models

OISD: 语言模型在策略内部自蒸馏

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

机构 * Auburn University(阿肯色大学) William & Mary(威廉与玛丽学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出OISD框架,通过将最终层的预测信号蒸馏到中间层,结合logit对齐和注意力对齐,提升推理能力,在数学推理任务上显著优于基线。

Comments Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28900 2026-09-01 cs.RO cs.AI cs.LG eess.SY 版本更新 62%

Robust Multi-Agent Reinforcement Learning for Small UAS Separation Assurance under GPS Degradation and Spoofing

针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障

Alex Zongo, Filippos Fotiadis, Ufuk Topcu, Peng Wei

机构 * George Washington University(乔治华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-09-01 cs.LG cs.CL cs.RO 版本更新 62%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31035 2026-09-01 cs.CL cs.SD eess.AS 新提交 57%

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

基于预测器的强化学习何时与人类感知对齐?基于编解码器的语音语言模型中主观奖励的研究

Joonyong Park, Jerry Li

机构 * Spellbrush(斯佩尔布拉什公司)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究探究基于编解码器的语音语言模型中,预测器式强化学习与人类感知的对齐条件,采用GRPO与CER区间约束,发现单奖励针对性提升对应指标,8最佳重排序性能接近GRPO,为多奖励语音后训练的奖励选择提供诊断方法。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交 57%

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: this https URL (https://lucida-r2s.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30025 2026-09-01 cs.AI 新提交 57%

Interpreting and Steering for Safe and Correct Code Generation

面向安全且正确的代码生成的解释与引导

Hao Yan, Ziyu Yao

机构 * George Mason University(乔治梅森大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究通过CodeSec-Pairs数据集解释LLMs代码生成的安全机制,提出DuoSteer双引导方法,在5类漏洞实验中实现26.9%漏洞率降低,效果优于基线方法且可跨模型复现。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29965 2026-09-01 cs.AI 新提交 57%

Review Before Trust: Source-Grounded Integrity Gates for AI-Assisted Personal Health Records

信任前审核:面向AI辅助个人健康记录的基于来源的完整性闸门

Nora Girda, Adrian Groza

机构 * Technical University of Cluj-Napoca(克卢日-纳波卡技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 该研究针对AI辅助个人健康记录的完整性风险,提出Medical DataCloud中的证据门控信任提升模型,通过源文档验证机制控制生成数据的使用,经测试验证了技术可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29286 2026-09-01 cs.AI 新提交 57%

MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs

MMPCBench:评估多模态大语言模型对有缺陷输入的主动批判能力的基准

Jinzhe Li, Gengxu Li, Jinnan Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型主动错误处理评估的空白,提出MMPCBench基准框架,测试发现主流MLLMs在主动批判上存在明显弱点,还识别出“一致性缺口”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29109 2026-09-01 cs.CL 新提交 57%

Recognition-Refusal Misalignment in LLMs: Why Models Answer Structurally Unanswerable Questions

大语言模型中的识别-拒绝错位:为何模型会回答结构上无法解答的问题

Yucheng Du, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 该研究发现大语言模型会回答结构上无法解答的问题是因识别到不可行性的信号与安全拒绝通路未对齐,而非缺失识别能力。

Comments Accepted to EMNLP 2026 Main Conference. 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28662 2026-09-01 cs.AI 新提交 57%

FRAC-MAS: A Safe and Explainable Multi-Agent System for Fracture Diagnosis

FRAC-MAS:一种用于骨折诊断的安全可解释多智能体系统

Hardik Iyer, Tirath Bhathawala, Mihir Panchal, Ying-Jung Chen, Kiran Bhowmick, Pankaj Sonawane, Meera Narvekar

机构 * Dwarkadas J Sanghvi College of Engineering(德瓦卡达斯J.桑吉维工程学院) University of Amsterdam(阿姆斯特丹大学) National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 FRAC-MAS是一种结合堆叠集成视觉模型、共形预测与多智能体评审员的骨折诊断系统,可实现安全可解释的放射学分诊,性能优于单智能体基线,生成更易理解的临床报告。

Comments Medical Image Computing and Computer Assisted Intervention (MICCAI) 2nd Workshop on Agentic AI for Medicine (AgenticMed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28593 2026-09-01 cs.AI 新提交 57%

Statutory AI: Aligning Large Language Models With Legal Norms

法定人工智能:使大语言模型与法律规范对齐

Cindy Delage, Stéphane Canu, Marc Décombas, Jonathan Foureur

机构 * JustAI INSA Rouen Normandie(鲁昂诺曼底国立应用科学学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 针对现有AI对齐方法的局限,提出法定人工智能,以法律文本为框架,通过两阶段思维链提示运行,在1000个红队提示的五主题实验中,较标准宪法AI更能减少有害内容并缩短计算时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-09-01 cs.AI 版本更新 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 60 pages, added additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏