arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2605.10386 2026-05-12 cs.AI 79%

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10146 2026-05-12 cs.AI cs.CR 79%

Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

在恶意知识编辑下知识密集推理安全风险的基准测试

Qinghua Mao, Xi Lin, Jinze Gu, Jun Wu, Siyuan Li, Yuliang Chen

机构 * School of Computer Science(计算机科学学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出EditRisk-Bench,通过整合恶意场景和多级推理任务,系统评估知识编辑对推理行为的影响,揭示恶意知识编辑导致错误推理的风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08486 2026-05-12 cs.CY 79%

Teachers' Perceived Benefits and Risks of AI Across Fifty-Five Countries: An Audit of LLM Alignment and Steerability

教师对AI在教育中的感知益处与风险:对LLM对齐与可控性的审计

Yan Tao, Olga Viberg, Deepak Varuvel Dennison, Zhikun Wu, René F. Kizilcec

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 研究通过分析55国教师对AI的感知益处与风险,评估LLM在教育领域应用的对齐与可控性,揭示模型输出与现实差异,警示LLM不能替代教师直接反馈。

Comments Accepted as full paper to the 13th ACM Conference on Learning @ Scale (L@S'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01307 2026-05-12 cs.SE cs.AI 79%

Document Retrieval Augmented Fine-Tuning (DRAFT) for safety-critical software assessments

用于安全关键软件评估的文档检索增强微调(DRAFT)

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Vanessa Vulovic, Gary Bamford, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre, UK, HD1 3BD(数字交通有限公司,3M Buckley创新中心,英国,HD1 3BD) Department of Computer Science, University of Huddersfield, UK, HD1 3DH(计算机科学系,赫德瑟菲尔德大学,英国,HD1 3DH)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出DRAFT方法,通过引入双检索架构和半自动化数据集生成,提升大型语言模型在安全关键合规评估中的准确性与证据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06230 2026-05-11 cs.AI cs.DC 79%

Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence

Safactory:一个可扩展的代理基础设施,用于训练可信的自主智能

Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang Xu, Yiwen Cong, Meng Jin, Gaolei Li, Xuansheng Wu, Linhan Liu, Zijing He, An Li, Yan Teng, Xin Tan, Dongrui Liu, Jing Shao, ChaoChao Lu, Ji He, Jie Li, Chunfeng Song, Jinya Xu, Fan Song, Shujie Wang, Jianmin Qian, Jie Hou, Xuhong Wang, Yingchun Wang, Hui Wang, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出Safactory,一个可扩展的代理工厂,用于训练可信的自主智能。该框架整合了三个紧密耦合的平台,以实现长期决策、工具使用和真实环境交互的可靠性和连续改进。

Comments 50 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03728 2026-05-11 cs.CV cs.AI 79%

CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval

CSMCIR: 基于记忆库的增强对称对齐用于复合图像检索

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Yiwei Ma, Jiayi Ji, Chenyi Lei, Han Li, Xiaoshuai Sun

机构 * Kuaishou Technology(快播科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CSMCIR,通过多级链式思维提示策略、对称双塔架构和熵基记忆库策略,实现高效查询-目标对齐,提升复合图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06024 2026-05-08 cs.AI 79%

Strat-LLM: Stratified Strategy Alignment for LLM-based Stock Trading with Real-time Multi-Source Signals

Strat-LLM:基于实时多源信号的LLM股票交易分层策略对齐

Wenliang Huang, Zengyi Yu

机构 * School of Economics(经济学院) Zhejiang University of Technology(浙江工业大学) Faculty of Education(教育学院) East China Normal University(华东师范大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Strat-LLM框架,通过分层策略对齐提升LLM在股票交易中的表现,实验显示不同模式下模型在风险控制和收益获取上的差异。

Comments Accepted by the 2026 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI 79%

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05748 2026-05-08 cs.AI 79%

Evaluating Explainability in Safety-Critical ATR Systems: Limitations of Post-Hoc Methods and Paths Toward Robust XAI

评估安全关键ATR系统中的可解释性:事后方法的局限性及稳健XAI的路径

Vanessa Buhrmester, David Muench, Dimitri Bulatov, Michael Arens

机构 * Fraunhofer Institute of Optronics, System Technologies(弗劳恩霍夫光学与系统技术研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文评估安全关键ATR系统中可解释性方法的局限性,指出事后方法的不足,并探讨更稳健的XAI方向,强调需超越视觉合理解释以支持可靠决策。

Comments 15 pages, 1 image 1 table, ICPR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00731 2026-05-04 cs.SI cs.AI 79%

Empowering Heterogeneous Graph Foundation Models via Decoupled Relation Alignment

通过解耦关系对齐增强异质图基础模型

Ziyu Zheng, Yaming Yang, Zhe Wang, Ziyu Guan, Wei Zhao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DRSA方法,通过解耦特征语义与关系结构,解决异质图中跨类型特征偏移和领域内关系缺口问题,提升跨域和少样本知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00689 2026-05-04 cs.CL cs.CR 79%

ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models

ML-Bench&Guard: 政策导向的多语言安全基准与大型语言模型的防护机制

Yunhan Zhao, Zhaorun Chen, Xingjun Ma, Yu-Gang Jiang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fudan University(复旦大学) University of Chicago(芝加哥大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出ML-Bench和ML-Guard,通过区域法规构建多语言安全基准,并开发基于扩散模型的防护系统,实现文化与法律一致的多语言安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 79%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00227 2026-05-04 cs.CL 79%

Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations

基于角色的AI陪伴在多轮对话中的安全性评估

Prerna Juneja, Lika Lomidze

机构 * Seattle University(西雅图大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出首个端到端可扩展框架,用于可控模拟和评估AI陪伴应用的多轮交互安全性,通过构建角色、生成场景、模拟对话及评估危害,分析Replika对高风险用户群体的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14044 2026-05-01 cs.CV cs.AI 79%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14719 2026-05-01 cs.AI 79%

Policy-Grounded Safety Evaluation of 20 Large Language Models

基于政策的安全性评估:20个大语言模型

Juan Manuel Contreras

机构 * Aymara

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出Aymara AI平台,用于生成和管理定制化的政策导向安全性评估。通过评估20个商业大语言模型在10个现实安全领域中的表现,揭示了模型在不同领域中的显著性能差异,强调了构建可扩展、可定制工具的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26411 2026-04-30 cs.LG 79%

Unifying Runtime Monitoring Approaches for Safety-Critical Machine Learning: Application to Vision-Based Landing

统一运行时监控方法以确保安全关键机器学习:应用于基于视觉的着陆

Mathieu Dario, Florent Chenevier, Kévin Delmas, Joris Guerin, Jérémie Guiochet

机构 * LAAS-CNRS(法国图卢兹Laas--cnrs研究所) University of Toulouse(图卢兹大学) Thales(泰勒斯) ONERA(法国国家航空器研究与测试中心) Espace-Dev, IRD, Université de Montpellier(Espace-Dev, 法国国家农业与食品研发机构, 图卢兹大学) Universidade Federal do Rio Grande do Norte(巴西北里奥格兰德联邦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出统一框架,将运行时监控分为三种类型,通过航空安全应用实验验证其有效性,促进监控设计与评估。

Comments 15 pages, 5 figures, 3 tables, submitted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14858 2026-04-30 cs.AI cs.SE 79%

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex

轨迹安全评估与诊断的基准测试:OpenClaw和Codex中的ATBench-Claw和ATBench-Codex

Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出ATBench-Claw和ATBench-Codex,用于评估和诊断OpenClaw和Codex环境中的轨迹安全,通过定制安全分类法实现基准测试的可扩展性。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24902 2026-04-29 cs.CY cs.SE 79%

Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains

微调后的安全性漂移:来自高风险领域的证据

Emaan Bilal Khan, Amy Winecoff, Miranda Bogen, Dylan Hadfield-Menell

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 研究发现微调导致的安全性变化显著且不一致,挑战了基于基础模型的安全性假设,需重新评估微调模型以管理下游风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23523 2026-04-28 cs.SE cs.AI 79%

Grammar-Constrained Refinement of Safety Operational Rules Using Language in the Loop: What Could Go Wrong

基于语言闭环的安全操作规则语法约束细化:可能发生的问题

Khouloud Gaaloul, Zaid Ghazal, Madhu Latha Pulimi, Sam Emmanuel Kathiravan

机构 * University of Michigan--Dearborn(密歇根大学迪尔伯恩分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出结合反事实推理与语法约束循环的框架,用于安全操作规则的细化,通过自主驾驶控制系统案例展示其在解决不一致规则中的有效性,并强调语法约束与语义验证的重要性。

Comments 6 pages, 1 figure, 2 tables. Accepted at SEAMS 2026

Journal ref Proc. 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems (SEAMS 2026), ACM, 2026, 6 pages

详情
URL PDF HTML 收藏
2604.22156 2026-04-27 cs.LG cs.CV 79%

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

Sum-of-Checks: 用于手术安全的结构化推理方法基于大型视觉-语言模型

Weiqiu You, Cassandra Goldberg, Amin Madani, Daniel A. Hashimoto, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Surgery, University of Toronto(多伦多大学外科系) Surgical Artificial Intelligence Research Academy, University Health Network(外科人工智能研究学院,大学健康网络) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学外科系,佩雷尔曼医学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Sum-of-Checks框架,通过分解关键安全视图(CVS)标准为专家定义的检查,提升手术安全评估的准确性和透明性,实验显示其在三个模型上平均提升12-14%。

Comments IPCAI 2026 short communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21964 2026-04-27 cs.CY 79%

Lessons from External Review of DeepMind's Scheming Inability Safety Case

从深度思维的'谋略无能'安全案例外部评审中汲取的教训

Stephen Barrett, Francisco Javier Campos Zabala, Sean P. Fillingham, Umair Siddique, James Walpole, Robin Bloomfield, Henry Papadatos

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文通过应用Assurance 2.0框架对DeepMind的公开'谋略无能'安全案例进行外部评审,揭示了外部评审在提升AI安全论证质量中的作用,并提出具体建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18757 2026-04-22 cs.CV cs.AI 79%

REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

REVEAL:多模态视图-语言对齐的视网膜形态学与临床风险预测

Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学J. Crayton Pruitt家族生物医学工程系) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) Department of Applied Mathematics & Statistics, Stony Brook University(石溪大学应用数学与统计学系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 REVEAL通过多模态对齐视网膜形态学与临床风险因素,提前8年预测阿尔茨海默病和痴呆症,优于现有模型。

Comments Accepted for publication a MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00439 2026-04-22 cs.CL 79%

Improving the Distributional Alignment of LLMs using Supervision

通过监督改进大型语言模型的分布对齐

Gauri Kambhatla, Sanjana Gautam, Angela Zhang, Alex Liu, Ravi Srinivasan, Junyi Jessy Li, Matthew Lease

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文通过简单监督提升LLM在不同群体上的分布对齐,分析了三个数据集的对齐效果,并为未来研究提供基准。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18519 2026-04-21 cs.AI 79%

LLM Safety From Within: Detecting Harmful Content with Internal Representations

从内部检测有害内容:利用内部表示进行LLM安全

Difan Jiao, Yilun Liu, Ye Yuan, Zhenwei Tang, Linfeng Du, Haolun Wu, Ashton Anderson

机构 * University of Toronto(多伦多大学) McGill University(麦吉尔大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 SIREN通过利用内部层特征提升有害内容检测性能,相比现有模型更高效且泛化能力强。

Comments 17 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10693 2026-04-21 cs.AI 79%

FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning

FACT-E:基于因果的可信推理链评估

Yuxi Sun, Aoqi Zuo, Haotian Xie, Wei Gao, Mingming Gong, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 FACT-E通过因果方法评估推理链的可信度,结合内部一致性与推理-答案一致性,提升推理轨迹选择质量并增强噪声下的鲁棒性。

Comments Accepted to Association for Computational Linguistics Findings (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21977 2026-04-20 cs.AI 79%

Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions

分布偏移对齐有助于LLM模拟调查响应分布

Ji Huang, Mengfei Li, Shuai Shao

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Management, Fudan University(复旦大学管理学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DSA方法,通过两阶段微调对齐输出分布和偏移,提升LLM模拟调查响应的准确性与效率,在五个公开数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13850 2026-04-20 cs.CY cs.HC 79%

PADTHAI-MM: Principles-based Approach for Designing Trustworthy, Human-centered AI using MAST Methodology

PADTHAI-MM: 基于原则的方法用于使用MAST方法论设计可信、以人类为中心的AI

Myke C. Cohen, Nayoung Kim, Yang Ba, Anna Pan, Shawaiz Bhatti, Pouria Salehi, James Sung, Erik Blasch, Michelle V. Mancenido, Erin K. Chiou

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 本文提出PADTHAI-MM框架,通过MAST方法论设计可信AI系统,通过READIT平台验证,评估MAST对AI信任的影响,并探讨MAST评分与信任因素的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09363 2026-04-17 cs.AI cs.SY eess.SY 79%

BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems

BarrierBench: 评估大型语言模型在动态系统安全验证中的性能

Ali Taheri, Alireza Taban, Sadegh Soudjani, Ashutosh Trivedi

机构 * Isfahan University of Technology(伊斯法罕技术大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出BarrierBench基准,评估大型语言模型在动态系统安全验证中的能力,通过100个动态系统案例测试语言模型在生成安全证书和协调策略中的有效性。

Comments 8th Annual Learning for Dynamics & Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12216 2026-04-15 cs.CR cs.CL 79%

TimeMark: A Trustworthy Time Watermarking Framework for Exact Generation-Time Recovery from AIGC

TimeMark: 一种用于从AIGC中精确生成时间恢复的可信时间水印框架

Shangkun Che, Silin Du, Ge Gao

机构 * Economics and Management School, Wuhan University(武汉大学经济管理学院) School of Economics and Management, Tsinghua University(清华大学经济管理学院) School of Business Administration, Southwestern University of Finance and Economics(西南财经大学商学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文提出TimeMark框架,通过加密技术和监管监督下的时间依赖秘密密钥,实现100%准确的生成时间恢复,防止任意时间戳伪造,解决现有水印技术的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11174 2026-04-14 cs.RO cs.AI 79%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏