arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2603.18976 2026-03-20 cs.AI 79%

Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interaction

评估5W3H结构提示在人机交互中的意图对齐

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过对比三种提示条件,评估了基于5W3H的PPS框架在人机交互中提升意图对齐的效果,发现渲染化的PPS在高歧义任务中表现更优,且揭示了结构化提示在实际应用中的价值。

Comments 27 pages, figures, tables, and appendix. Primary category: human-computer interaction / human-AI interaction. Public artifact repository and implementation resources are referenced in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17373 2026-03-19 cs.CL 79%

SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems

SafeTutors: 评估AI辅导系统中的教学安全性

Rima Hazra, Bikram Ghuku, Ilona Marchenko, Yaroslava Tokarieva, Sayan Layek, Somnath Banerjee, Julia Stoyanovich, Mykola Pechenizkiy

机构 * Eindhoven University of Technology(埃因霍温理工大学) Indian Institute of Technology Kharagpur(印度理工学院Khargpur分校) Cisco Research(思科研究) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) National Technical University of Ukraine(乌克兰国家技术大学) New York University(纽约大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出SafeTutors基准,评估AI辅导系统在数学、物理和化学中的教学有效性与安全性,发现模型在多轮对话中教学失败率显著上升,且学科差异影响安全措施效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16143 2026-03-18 eess.SP cs.AI 79%

Structure-Aware Multimodal LLM Framework for Trustworthy Near-Field Beam Prediction

面向可信近场波束预测的结构感知多模态大语言模型框架

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-kai Wen, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Institute of Communications Engineering, National Sun Yat-sen University(通讯工程学院,国立中山大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的多模态框架,融合历史GPS数据、RGB图像、LiDAR数据及任务特定文本提示,以提升复杂低空环境中的近场波束对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16052 2026-03-18 cs.AI 79%

A Context Alignment Pre-processor for Enhancing the Coherence of Human-LLM Dialog

一种增强人与大语言模型对话连贯性的上下文对齐预处理模块

Ding Wei

机构 * College of Architecture, Nanjing Tech University(南京工业大学建筑学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出C.A.P.预处理框架,通过语义扩展、时间加权上下文检索和对齐验证,解决长对话中的上下文错位问题,提升对话连贯性与协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 79%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13247 2026-03-17 cs.AI cs.CR 79%

ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems

ILION:用于代理AI系统的确定性预执行安全闸门

Florin Adrian Chitan

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ILION通过五层架构实现代理AI系统的安全控制,无需训练数据和API依赖,达到高精度和低延迟的判定效果。

Comments 16 pages, 7 tables, 7 figures. Benchmark and code available at https://github.com/Athonitul/ilion-framework-simulator. Patent application A/00052, OSIM Romania

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12875 2026-03-16 cs.LG 79%

Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks

测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts

Kun Wang, Reinhard Heckel

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12701 2026-03-16 cs.HC cs.AI 79%

Seeing Eye to Eye: Enabling Cognitive Alignment Through Shared First-Person Perspective in Human-AI Collaboration

彼此相视:通过共享第一人称视角实现人机协作中的认知对齐

Zhuyu Teng, Pei Chen, Yichen Cai, Ruoqing Lu, Zhaoqu Jiang, Jiayang Li, Weitao You, Lingyun Sun

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Eye2Eye框架,通过共享第一人称视角实现人机认知对齐,解决沟通和理解鸿沟问题,实验表明其能提升协作效率和信任度。

Comments 19 pages, 11 figures. Accepted at ACM CHI 2026, Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11987 2026-03-13 cs.AI 79%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03666 2026-03-12 cs.CV cs.AI 79%

MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations

MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Guangyuan Yu, Haoyuan Xu, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22755 2026-03-11 cs.CL 79%

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AuditBench:对具有隐藏行为的模型进行对齐审计评估

Abhay Sheshadri, Aidan Ewart, Kai Fronsdal, Isha Gupta, Samuel R. Bowman, Sara Price, Samuel Marks, Rowan Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08321 2026-03-10 cs.AI 79%

CORE-Acu: Structured Reasoning Traces and Knowledge Graph Safety Verification for Acupuncture Clinical Decision Support

CORE-Acu: 结构化推理轨迹与知识图谱安全验证用于针灸临床决策支持

Liuyi Xu, Yun Guo, Ming Chen, Zihan Dun, Yining Qian, An-Yang Lu, Shuang Li, Lijun Liu

机构 * College of Information Science and Engineering, Northeastern University, Shenyang 110819, China(信息科学与工程学院,东北大学,沈阳110819,中国) School of Information Science and Engineering, Yanshan University, Qinhuangdao, Hebei 066000, China(信息科学与工程学院,燕山大学,秦皇岛,河北省066000,中国) School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(计算机科学与工程学院,东北大学,沈阳110819,中国) School of Artificial Intelligence, Beihang University, Beijing 100000, China(人工智能学院,北航,北京100000,中国) Key Laboratory of Bioresource Research and Development of Liaoning Province, Northeastern University, Shenyang 110169, China(辽宁省生物资源研究开发重点实验室,东北大学,沈阳110169,中国) College of Life and Health Sciences, Northeastern University, Shenyang 110169, China(生命与健康科学学院,东北大学,沈阳110169,中国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 CORE-Acu通过结构化推理轨迹与知识图谱安全验证,提升针灸临床决策支持的可解释性与安全性。

Comments 19 pages, 5 figures, 18 tables. Includes the Acu-Reasoning dataset and TCM knowledge graph schema

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06884 2026-03-10 cs.AI 79%

Distributed Legal Infrastructure for a Trustworthy Agentic Web

分布式法律基础设施用于可信代理网络

Tomer Jordi Chaffer, Victor Jiawei Zhang, Sante Dino Facchini, Botao Amber Hu, Helena Rong, Zihan Guo, Xisen Wang, Carlos Santana, Giovanni De Gasperis

机构 * Institute for Technoscience and Society(科技与社会研究所) Berkeley Center for Law & Technology(伯克利法与科技中心) U.C. Berkeley Law School(伯克利法学院) Technical University of Munich(慕尼黑技术大学) Università degli Studi dell’Aquila(阿奎拉大学) University of Oxford(牛津大学) Existential Risk Alliance(存在风险联盟) NYU Shanghai(纽约大学上海分校) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出分布式法律基础设施,旨在通过可互操作的协议构建可信代理网络,实现连贯治理与合法性维持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03098 2026-03-06 q-bio.QM cs.LG 79%

An AI Implementation Science Study to Improve Trustworthy Data in a Large Healthcare System

一项提升大型医疗系统中可信数据的AI实施科学研究

Benoit L. Marteau, Andrew Hornback, Shaun Q. Tan, Christian Lowson, Jason Woloff, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Shriners Hospitals for Children(夏皮罗儿童医院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本研究通过在大型医疗系统中实施AI技术,提升数据质量并整合可信AI原则,探索混合实施策略以促进医疗AI的发展。

Comments 10 pages, 7 figures. Preprint version. This manuscript has been accepted at IEEE BHI 2025. This is the author-prepared version and not the final published IEEE version. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21782 2026-03-05 cs.AI 79%

Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety

基于MLLM的网页理解基准测试:推理、鲁棒性与安全性

Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrui Zhang, Shuanghe Yu

机构 * Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出WebRRSBench基准测试,评估多模态大语言模型在网页理解中的推理、鲁棒性和安全性能力,揭示模型在复杂交互任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06743 2026-03-05 cs.RO cs.AI 79%

TPK: Trustworthy Trajectory Prediction Integrating Prior Knowledge For Interpretability and Kinematic Feasibility

TPK: 通过整合先验知识实现可解释性和运动学可行性轨迹预测

Marius Baden, Ahmed Abouelazm, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 TPK通过整合车辆、行人和自行车的交互和运动学先验知识,提高轨迹预测的可解释性和物理可行性。

Comments First and Second authors contributed equally; Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025) for oral presentation; Winner of the best paper award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03340 2026-03-05 cs.CY 79%

Trustworthy AI Posture (TAIP): A Framework for Continuous AI Assurance of Agentic Systems at Horizontal and Vertical scale

可信AI姿态(TAIP):一种用于在横向和纵向规模上持续确保代理系统AI可信度的框架

Guy Lupo, Bao Quoc Vo, Natania Locke

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 TAIP框架通过将可信度定义为持续生成的信号,提供了一种在横向和纵向尺度上持续确保代理系统AI可信度的方法,结合本体模型和证据门限基准,实现可重用的AI保证对象。

Comments 40 Pages, 13 Figures, 7 Tables,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17204 2026-03-05 cs.LG cs.CE 79%

SpecBridge: Bridging Mass Spectrometry and Molecular Representations via Cross-Modal Alignment

SpecBridge: 通过跨模态对齐弥合质谱与分子表示

Yinkai Wang, Yan Zhou Chen, Xiaohui Chen, Li-Ping Liu, Soha Hassoun

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 SpecBridge通过跨模态对齐方法提升质谱数据中分子鉴定的准确性,利用冻结的基础模型实现高效检索。

Comments We have found a problem in the preprocessing/evaluation pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02542 2026-03-04 cs.AI 79%

AnchorDrive: LLM Scenario Rollout with Anchor-Guided Diffusion Regeneration for Safety-Critical Scenario Generation

AnchorDrive: 基于锚点引导扩散再生的LLM场景回放用于安全关键场景生成

Zhulin Jiang, Zetao Li, Cheng Wang, Ziwen Wang, Chen Xiong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能系统工程学院,深圳,中国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 AnchorDrive通过结合LLM的可控生成和扩散模型的真实轨迹生成,实现安全关键场景的高效合成,提升场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00429 2026-03-03 cs.HC cs.AI 79%

Personalities at Play: Probing Alignment in AI Teammates

性格的博弈:探究AI队友的对齐

Mohammad Amin Samadi, Nia Nixon

机构 * School of Education University of California Irvine(教育学院 加州大学尔湾分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 研究探讨AI队友的性格对齐,通过多维度评估发现其性格表现受提示策略、供应商差异和记忆构建影响,强调需综合考虑记忆和系统设计以有效评估AI性格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23753 2026-03-02 cs.CL 79%

Structured Prompt Optimization for Few-Shot Text Classification via Semantic Alignment in Latent Space

通过潜在空间语义对齐的结构化提示优化实现少样本文本分类

Jiasen Zheng, Zijun Zhou, Huajun Zhang, Junjiang Lin, Jingyun Jia, Qi Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出通过潜在空间语义对齐的结构化提示优化方法,解决少样本文本分类中的语义冲突和标签模糊问题,提升分类性能和跨任务适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23075 2026-02-27 cs.CL cs.IR 79%

CiteLLM: An Agentic Platform for Trustworthy Scientific Reference Discovery

CiteLLM:一个用于可信科学引文发现的代理平台

Mengze Hong, Di Jiang, Chen Jason Zhang, Zichang Guo, Yawen Li, Jun Chen, Shaobo Cui, Zhiyang Su

机构 * Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Swiss Federal Technology Institute of Lausanne (EPFL)(洛桑联邦理工学院) Hong Kong University of Science and Technology (HKUST)(香港科学大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 CiteLLM通过在LaTeX编辑器中嵌入LLM工具,实现可信的科学引文发现,确保引文的准确性和可靠性。

Comments Accepted by TheWebConf 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04403 2026-02-27 cs.CV cs.CL cs.CR 79%

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

自适应数据集构建用于现实世界多模态安全场景

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出了一种图像导向的自适应数据集构建方法,用于构建现实世界多模态安全场景的数据集,通过生成35,000个图像-文本对及其指导响应,提升了安全评估的有效性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21829 2026-02-26 cs.CV cs.AI 79%

StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles

StoryMovie: 一个用于视觉故事语义对齐的语料库,结合电影剧本和字幕

Daniel Oliveira, David Martins de Matos

机构 * INESC-ID(INESC-ID研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 StoryMovie通过结合电影剧本和字幕,提升视觉叙事模型的语义对齐能力,使对话归属更准确。

Comments 15 pages, submitted to Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20628 2026-02-25 cs.AI 79%

When can we trust untrusted monitoring? A safety case sketch across collusion strategies

我们何时可以信任不可信的监控?跨合谋策略的安全案例草图

Nelson Gardner-Challis, Jonathan Bostock, Georgiy Kozhevnikov, Morgan Sinclaire, Joan Velja, Alessandro Abate, Charlie Griffin

机构 * LASR Labs(LASR实验室) University of Oxford(牛津大学) University of Wyoming(怀俄明大学) Imperial College London(伦敦帝国学院) UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种跨合谋策略的安全案例草图,探讨了不可信监控的安全性问题,分析了不同合谋策略的有效性,并指出了未解决的挑战。

Comments 66 pages, 14 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11876 2026-02-25 cs.CL 79%

EAMET: Robust Massive Model Editing via Embedding Alignment Optimization

EAMET: 通过嵌入对齐优化实现鲁棒的大规模模型编辑

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 EAMET通过嵌入对齐优化提升大规模模型编辑的鲁棒性和效率,实现90%的编辑效果

Comments This paper was accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23434 2026-02-25 cs.LG 79%

Towards Trustworthy GUI Agents: A Survey

迈向可信的GUI代理:综述

Yucheng Shi, Wenhao Yu, Jingyuan Huang, Wenlin Yao, Wenhu Chen, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。

Comments 14 pages, work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17910 2026-02-23 cs.AI 79%

Alignment in Time: Peak-Aware Orchestration for Long-Horizon Agentic Systems

时间对齐:面向长时间 horizon 代理系统的峰值感知 orchestration

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱维大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 APEMO通过时间-情感信号优化计算分配,提升长horizon代理系统轨迹质量和重用概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17106 2026-02-20 cs.AI 79%

Toward Trustworthy Evaluation of Sustainability Rating Methodologies: A Human-AI Collaborative Framework for Benchmark Dataset Construction

迈向可信的可持续性评级方法论评估:一种人机协作框架用于基准数据集构建

Xiaoran Cai, Wang Yang, Xiyu Ren, Chekun Law, Rohit Sharma, Peng Qi

机构 * Columbia University, USA(哥伦比亚大学) Case Western Reserve University, USA(凯斯西储大学) Hong Kong University of Science(香港科学大学) NVIDIA, USA(NVIDIA公司) Informatica Inc., USA(Informatica公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出一种人机协作框架,用于构建可信的可持续性评级方法论基准数据集,以提高评分的可比性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16984 2026-02-20 cs.AI 79%

Fundamental Limits of Black-Box Safety Evaluation: Information-Theoretic and Computational Barriers from Latent Context Conditioning

黑盒安全评估的根本限制:从潜在上下文条件化的信息论和计算障碍

Vishal Srivastava

机构 * Whiting School of Engineering(韦斯利工程学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了黑盒安全评估的根本限制,揭示了潜在上下文条件化策略在部署风险估计中的信息论和计算障碍,提出了被动和自适应评估的下界以及计算分离的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏