arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2604.10286 2026-04-14 cs.AI 79%

STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems

STARS:基于技能触发的请求条件调用安全性审计

Guijia Zhang, Shu Yang, Xilin Gong, Di Wang

机构 * Shenzhen University(深圳大学) King Abdullah University of Science & Technology(阿卜杜拉国王科技大学) PRADA Lab(PRADA实验室) University of Georgia(佐治亚大学)

专题命中 安全评测 :safety(title);prompt injection(abstract);分类 cs.AI

AI总结 STARS通过结合静态能力先验、请求条件调用风险模型和校准风险融合策略,提升代理系统调用时的风险评估与优先级排序能力,优于静态筛查和上下文评分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09682 2026-04-14 cs.NI cs.AI 79%

Decision-Theoretic Safety Assessment of Persona-Driven Multi-Agent Systems in O-RAN

基于决策理论的面向角色驱动的多智能体系统在O-RAN中的安全性评估

Zeinab Nezami, Syed Ali Raza Zaidi, Maryam Hafeez, Louis Powell, Vara Prasad Talari, Mallik Tatipamula

机构 * GSMA(全球移动通信系统协会) University of Leeds(利兹大学) AWS(亚马逊云服务) Ericsson(爱立信)

专题命中 安全评测 :safety(title);alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于角色驱动的多智能体框架,通过角色行为规范影响五个专业智能体,结合决策理论构建三维评估框架,验证486种角色配置在O-RAN优化挑战中的性能与协调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09606 2026-04-14 cs.AI cs.SE 79%

Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling

通过重复提示采样评估大语言模型安全性的可靠性差距

Keita Broadwater

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出APST框架,通过重复采样相同提示在受控条件下揭示LLM潜在故障模式,量化不同模型和配置下的操作风险,展示浅层基准分数可能掩盖持续使用下的可靠性差异。

Comments 9 pages, 4 figures; accepted at the CCAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08987 2026-04-13 cs.AI 79%

PilotBench: A Benchmark for General Aviation Agents with Safety Constraints

PilotBench:一个具有安全约束的一般航空智能体基准

Yalun Wu, Haotian Liu, Zhoujun Li, Boyang Wang

机构 * School of Computing National University of Singapore China School of Informatics Xiamen University China CESS Beihang University China

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 PilotBench通过对比LLM与传统预报器,评估飞行轨迹和姿态预测,揭示了传统方法在精度上的优势与LLM在指令遵循上的优势,指出LLM在高负荷阶段表现下降,推动混合架构的发展。

Comments Accepted at the 2026 IEEE International Joint Conference on Neural Networks (IJCNN 2026). 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08217 2026-04-10 cs.CY 79%

Co-design for Trustworthy AI: An Interpretable and Explainable Tool for Type 2 Diabetes Prediction Using Genomic Polygenic Risk Scores

可信AI的协同设计:一种用于2型糖尿病预测的可解释和可解释工具,使用基因组多基因风险评分

Ralf Beuthan, Megan Coffee, Heejin Kim, Na Yeon Kim, Pedro Kringen, Elisabeth Hildt, Haekyung Lee, Seunggeun Lee, Emilie Wiinblad Mathez, Sira Maliphol, Vadim Pak, Yuna Park, Stephan Sonnenberg, Jesmin Jahan Tithi, Magnus Westerlund, Roberto V. Zicari

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 本文提出eXplainable PRS工具,通过SHAP分解基因组多基因风险评分,提升2型糖尿病预测的可解释性,并结合法律、医疗、伦理和技术鲁棒性进行协同设计,为AI系统提供伦理和法律框架。

Comments 57 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05524 2026-04-10 cs.CL cs.IR 79%

KEO: Knowledge Extraction on OMIn via Knowledge Graphs and RAG for Safety-Critical Aviation Maintenance

KEO:通过知识图谱和RAG进行OMIn的领域知识提取

Kuangshi Ai, Jonathan A. Karr, Meng Jiang, Nitesh V. Chawla, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 KEO通过知识图谱和RAG框架提升航空安全维护中的领域知识提取与推理,实验显示其在全局理解上优于传统文本块RAG,同时保持对细粒度任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05172 2026-04-09 cs.AI 79%

ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces

ClawsBench: 评估LLM生产力代理在模拟工作区中的能力和安全性

Xiangyi Li, Kyoung Whan Choe, Yimin Liu, Xiaokun Chen, Chujun Tao, Bingran You, Wenbo Chen, Zonglin Di, Jiankai Sun, Shenghan Zheng, Jiajun Bao, Yuanli Wang, Weixiang Yan, Yiyuan Li, Han-chung Lee

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ClawsBench通过高保真模拟服务和结构化任务评估LLM代理在真实生产力场景中的能力与安全性,揭示了代理在多服务协作和安全关键场景中的表现及潜在风险。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05171 2026-04-09 eess.SY cs.AI cs.SY 79%

Towards provable probabilistic safety for scalable embodied AI systems

迈向可证明的可扩展具身AI系统的概率安全

Linxuan He, Lingxiang Fan, Qing-Shan Jia, Ang Li, Hongyan Sang, Ling Wang, Guanghui Wen, Jiwen Lu, Tao Zhang, Jie Zhou, Yi Zhang, Yisen Wang, Peng Wei, Zhongyuan Wang, Henry X. Liu, Shuo Feng

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) School of Computer, Liaocheng University(聊城大学计算机学院) Department of Automation, Southeast University(东南大学自动化学院) Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系) University of Michigan Transportation Research Institute(密歇根大学交通研究所) Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出可证明的概率安全范式,旨在解决具身AI系统在复杂环境中安全验证的挑战,通过结合可证明保证与渐进式达成概率安全边界,提升系统可行性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02642 2026-04-09 q-bio.NC cs.ET cs.LG cs.NE 79%

Spike-based alignment learning solves the weight transport problem

基于尖峰的对齐学习解决权重传输问题

Timo Gierlich, Andreas Baumbach, Akos F. Kungl, Kevin Max, Mihai A. Petrovici

机构 * Department of Physiology, Bern University(伯尔尼大学生理学系) Neural Computation Unit, Okinawa Institute of Science and Technology(冲绳科学技术大学院大学神经计算单元)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出基于尖峰的对齐学习方法,利用尖峰时间统计消除有效互惠连接间的不对称性,提升spiking网络在权重传输问题中的性能。

Comments 28 pages, 15 figures. Updated with a comparison to the STDWI algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04849 2026-04-07 cs.CY 79%

Latent Profiles of AI Risk Perception and Their Differential Association with Community Driving Safety Concerns: A Person-Centered Analysis

人工智能风险感知的潜在轮廓及其与社区驾驶安全担忧的差异性关联:一项以人为核心分析

Amir Rafe, Anika Baitullah, Subasish Das

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文通过以人为核心分析,识别美国成年人中人工智能风险感知的潜在轮廓,并测试这些轮廓与社区驾驶安全担忧的差异性关联,揭示世界观驱动的风险结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04775 2026-04-07 cs.CY 79%

Community Driving-Safety Deterioration as a Push Factor for Public Endorsement of AI Driving Capability

社区驾驶安全性下降作为公众支持自动驾驶能力的推动力

Amir Rafe, Subasish Das

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 研究探讨了社区驾驶安全性担忧通过一般化人工智能倾向的中介作用,揭示了驾驶频率对自动驾驶接受度的双重路径影响,发现社区担忧虽促进特定领域AI支持,但抑制了普遍AI热情,总体效应接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04660 2026-04-07 cs.AI 79%

Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception

Springdrift:一种可审计的持久运行时用于LLM代理,具备基于案例的记忆、规范安全性和环境自我感知

Seamus Brady

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 Springdrift通过可审计的执行子系统、基于案例的记忆层和规范安全机制,实现了LLM代理在跨会话任务连续性和环境自我感知方面的突破,展示了无显式指令下的自主诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04155 2026-04-07 cs.LG cs.IT math.IT q-bio.QM stat.ML 79%

The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models

几何对齐税:令牌化与连续几何在科学基础模型中的对比

Prashant C. Raju

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 科学基础模型在预测精度优化中面临连续几何保持问题,研究发现几何对齐税是内在成本,通过连续头替代交叉熵可显著减少几何失真,但编码本存在非单调双关现象,不同架构在连续与离散目标下表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03976 2026-04-07 cs.AI cs.CE 79%

Quantifying Trust: Financial Risk Management for Trustworthy AI Agents

量化信任:为可信AI代理的金融风险管理

Wenyue Hua, Tianyi Peng, Chi Wang, Ian Kaufman, Bryan Lim, Chandler Fang

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) t54.ai Virtuals ACP University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出基于金融风险管理的Agentic Risk Standard框架,通过整合风险评估与补偿机制,将信任从隐含期望转为可衡量的产品保证,提升AI代理在开放环境中的可靠性。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03622 2026-04-07 cs.SE cs.AI 79%

Toward Executable Repository-Level Code Generation via Environment Alignment

面向环境对齐的仓库级代码生成

Ruwei Pan, Junlei Shen, Linhao Wu, Yueheng Zhu, Zixiong Yang, Yakun Zhang, Lu Zhang, Hongyu Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出EnvGraph框架,通过环境对齐问题解决仓库级代码生成中的可执行性挑战,实验显示其在功能正确性和非功能质量上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03264 2026-04-07 cs.CV cs.AI cs.CR 79%

SafeScreen: A Safety-First Screening Framework for Personalized Video Retrieval for Vulnerable Users

SafeScreen: 一种以安全优先的个性化视频检索框架用于易受伤害用户的视频筛选

Wenzheng Zhao, Madhava Kalyan Gadiputi, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 SafeScreen通过安全优先机制,在确保个性化视频检索的同时满足个体安全约束,采用自动化流程进行视频的连续审批或拒绝,结合个性化安全标准提取、证据驱动评估和LLM决策,实现实时可解释的视频筛选。

Comments 11 pages, 3 figures, 7 tables. Under review for ACM ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07553 2026-04-06 cs.CL 79%

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

VeriOS: 基于查询的人机GUI交互以实现可信操作系统代理

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 VeriOS通过引入查询驱动的人机GUI交互框架,提升操作系统代理在不可信环境中的任务完成能力,实验显示其在不可信场景中性能显著提升,同时保持正常场景下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02008 2026-04-03 cs.CL 79%

$k$NNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detection

$k$NNProxy:高效无训练代理对齐方法用于黑盒零样本LLM生成文本检测

Kahim Wong, Kemou Li, Haiwei Wu, Jiantao Zhou

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出$ k $NNProxy方法,利用$ k $NN语言模型检索机制作为领域适配器,实现无训练的代理对齐,提升黑盒零样本LLM生成文本检测的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 79%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08847 2026-03-31 cs.AI cs.MA 79%

What Is Your Agent's GPA? A Framework for Evaluating Agent Goal-Plan-Action Alignment

你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架

Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26922 2026-03-31 cs.HC cs.AI 79%

Mimetic Alignment with ASPECT: Evaluation of AI-inferred Personal Profiles

模仿对齐与ASPECT:AI推断个人资料的评估

Ruoxi Shang, Dan Marshall, Edward Cutrell, Denae Ford

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出ASPECT方法,通过验证的沟通量表和职场数据评估LLM沟通特征,生成的个人资料在自评上表现良好,并在多个场景中优于通用和自述基线。

Comments 20 pages (including appendix), 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26122 2026-03-30 cs.CV cs.AI 79%

SkinGPT-X: A Self-Evolving Collaborative Multi-Agent System for Transparent and Trustworthy Dermatological Diagnosis

SkinGPT-X: 一种自演化协作多智能体系统用于透明和可信的皮肤病诊断

Zhangtianyi Chen, Yuhao Shen, Florensia Widjaja, Yan Xu, Liyuan Sun, Zijian Wang, Hongyi Chen, Wufei Dai, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(天津中医药大学附属医院天津市中西医结合皮肤病研究所皮肤科) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院皮肤科)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 SkinGPT-X通过自演化皮肤病记忆机制,解决单一大语言模型在细粒度多类诊断和罕见皮肤病诊断中的不足,实现透明可信的皮肤病诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00262 2026-03-30 cs.CV cs.AI 79%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25412 2026-03-27 cs.AI cs.CR 79%

Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models

超越内容安全:大型语言模型推理漏洞的实时监控

Xunguang Wang, Yuguang Zhou, Qingyue Wang, Zongjie Li, Ruixuan Huang, Zhenlan Ji, Pingchuan Ma, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出实时监控方法,识别大型语言模型推理过程中的安全漏洞,定义九类不安全推理行为,并通过实验验证其有效性,展示了推理安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06055 2026-03-27 cs.LG 79%

A Trustworthy By Design Classification Model for Building Energy Retrofit Decision Support

为建筑节能改造决策支持设计的可信分类模型

Panagiota Rempi, Sotiris Pelekis, Alexandros Menelaos Tzortzis, Evangelos Spiliotis, Evangelos Karakolis, Christos Ntanos, Dimitris Askounis

机构 * Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(雅典国家技术大学电气与计算机工程学院决策支持系统实验室)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出一种可信-by-设计的机器学习框架,通过条件表格生成对抗网络和神经网络多标签分类器,为住宅建筑提供节能策略推荐,结合SHAP解释层提升透明度和可信度,验证了在不同数据条件下性能提升达53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25097 2026-03-27 cs.AI 79%

ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents

ElephantBroker:一个基于知识的认知运行时用于可信AI代理

Cristian Lupascu, Alexandru Lupascu

机构 * Elephant Broker(大象经纪人)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 本文提出ElephantBroker,一个结合Neo4j知识图谱与Qdrant向量存储的认知运行时,通过Cognee SDK实现可信AI代理的记忆管理,包含认知循环、证据验证、安全防护等模块,支持多部署层级和安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 79%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22819 2026-03-25 cs.CV cs.AI 79%

TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment

TDATR:通过表格细节感知学习和单元级视觉对齐改进端到端表格识别

Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 TDATR通过表格细节感知学习和单元级视觉对齐改进端到端表格识别,采用感知-融合策略,提升模型鲁棒性和识别精度,无需数据集特定微调即可在七个基准上取得领先性能。

Comments Acceptd by CVPR 2026. Project Page: https://github.com/Chunchunwumu/TDATR.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22350 2026-03-25 cs.AI cs.CR 79%

Session Risk Memory (SRM): Temporal Authorization for Deterministic Pre-Execution Safety Gates

会话风险记忆(SRM):确定性预执行安全门的时序授权

Florin Adrian Chitan

机构 * Independent Researcher(独立研究者) ILION Project(ILION项目)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出SRM,一种轻量确定性模块,通过轨迹级授权扩展无状态执行门,以检测分布式攻击。实验显示SRM在检测率和准确率上优于传统方法,且具备低延迟。

Comments 12 pages, 3 figures. Companion paper to arXiv:2603.13247. Benchmark dataset and artifacts available on Zenodo: 10.5281/zenodo.15410944

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20595 2026-03-24 cs.AI cs.MA 79%

Position: Multi-Agent Algorithmic Care Systems Demand Contestability for Trustworthy AI

位置:多智能体算法护理系统需具备可挑战性以实现可信AI

Truong Thanh Hung Nguyen, Hélène Fournier, Piper Jackson, Makoto Itoh, Shannon Freeman, Rene Richard, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick, Canada(安利克斯 everywhere 实验室,新不伦瑞克大学,加拿大) National Research Council Canada, Canada(加拿大国家研究委员会,加拿大) Thompson Rivers University, Canada(汤普森河大学,加拿大) ISB Corporation, Japan(ISB公司,日本) University of Northern British Columbia, Canada(北北加拿大大学,加拿大)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文探讨了多智能体算法护理系统中可挑战性设计的必要性,提出通过透明性、干预机会和审查机制来增强人机协作的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏