arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2608.20554 2026-08-24 cs.CR cs.LG 新提交 83%

aiXamine: Unified Black-Box Evaluation of Cross-Dimensional Trade-offs in LLM Safety, Security, and Privacy

aiXamine:针对大语言模型安全、安全与隐私的跨维度权衡的统一黑盒评估

Fatih Deniz, Yazan Boshmaf, Dorde Popovic, Issa Khalil

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 该研究推出aiXamine统一黑盒平台,对超120个LLM开展大规模联合评估,发现安全、隐私等跨维度权衡现象,揭示当前对齐方法将多维度可信性视为单一目标的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19825 2026-08-21 cs.CV cs.CL 新提交 83%

Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment

基于增强型视觉-语言对齐的临床可信医学图像描述生成研究

Yunseo Lee, Hyun Jun Kim, Heeseung Shin, Changwon Lim

机构 * Chung-Ang University(中央大学)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 本研究针对医学图像描述生成的临床可信性问题,提出分离训练与推理对齐的框架,结合多编码器、辅助学习及MedPAIR-SCST方法,通过选择与强化学习对齐提升临床一致性,在数据受限场景下改善医学图像描述的可信度。

Comments 10 pages, 2 figures, 7 tables. Preprint submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17183 2026-08-19 cs.AI cs.CR 新提交 83%

Benchmarking the Benchmarks: Evaluating Automated Safety Benchmarks for Small Language Models

基准的基准:评估小型语言模型的自动化安全基准

Nyamtulla Shaik, Fengjun Li, Bo Luo

机构 * University of Kansas(堪萨斯大学)

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 本研究通过评估5个基准套件在26个开源SLMs上的表现,发现现有以LLM为中心的安全基准无法可靠评估SLMs,模糊性会导致模型排名出现显著变化。

Comments This paper is accepted for publication at ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11528 2026-08-13 cs.CL 新提交 83%

Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

群体对齐诱导的谄媚性:可引导的多元对齐的双向评估

Haokai Zhao, Yunze Xiao, Weihao Xuan, Flora Salim, Benjamin Tag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学) Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。

Comments 9 pages main text, 23 pages in total, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 83%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10176 2026-08-12 cs.AI 新提交 83%

TRACE: Trustworthy Retrieval-Augmented Conversational Engine

TRACE:可信赖的检索增强对话引擎

Touseef Hasan, Laila Cure, Souvika Sarkar

机构 * Wichita State University(威奇托州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 研究人员提出TRACE框架,通过强化检索提升公共服务对话系统的约束满足度、减少幻觉,降低对模型规模的依赖,证实检索质量是系统稳健性的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29243 2026-08-12 cs.LG 版本更新 83%

KrishokChat: A Provenance-Traceable Multi-Task Bengali Agricultural Benchmark with Safety-Critical Chemical Advisory

KrishokChat: 一个基于引用的孟加拉语农业咨询数据集与基准

Khan Raiyan Ibne Reza, Sumaiya Tabassum Nimi, Omar Ibne Shahid

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 提出KrishokChat,首个基于引用的孟加拉语农业指令微调数据集,通过分层知识节点扩展生成14.55万QA对,并引入农夫基准评估,发现微调改善格式但化学剂量泛化仍困难,强调其作为RAG知识库的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07862 2026-08-11 cs.CL 新提交 83%

SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

SurakshaEval:面向多语言大语言模型的印度语安全基准

Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah, Xudong Han, Yuxia Wang, Parameswari Krishnamurthy, Utkarsh Agarwal, Atharva Kulkarni, Swaran Lata, Ayush Munot, Dhruv Sahnan, Aaryamonvikram Singh, Preslav Nakov, Monojit Choudhury

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 针对现有LLM安全评估数据集忽视印度语言文化安全风险的问题,本文推出SurakshaEval基准,测试发现多语言LLM在印度语场景下安全表现不足,凸显了适配区域数据的安全评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06202 2026-08-07 cs.HC cs.AI 新提交 83%

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

当前AI基准测试未测量的内容:模态、搜索、引用及其对安全评估的启示

Ro Encarnación, Tina Behzad, Emma Lurie, Danaé Metaxa

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究发现AI基准测试未涵盖模态、搜索等关键因素,以ChatGPT为例对比两种模态及搜索条件,发现这些因素会影响模型准确率、一致性等,主张AI安全评估需纳入这些维度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02684 2026-08-06 q-bio.QM cs.AI 版本更新 83%

A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models

对齐机制中的盲区:量化大语言模型的生物安全风险

Shu Quan, Tianfang Hao, Sitong Fang, He Geng, Jiayi Zhou, Boyuan Chen, Kaile Wang, Donghai Hong, Juntao Dai, Yaodong Yang, Jiaming Ji

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本研究针对大语言模型生物安全评估盲区,构建SPIKE-Bench评估框架,发现多数模型易生成毒素序列,提出BioSafe-Guard分类器降低功能风险并开源相关资源。

Comments Accepted to COLM 2026. 40 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21396 2026-08-06 cs.CV cs.AI 83%

VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

VG-CoT:通过 grounded Chain-of-Thought 实现可信的视觉推理

Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun, YoungBin Kim

机构 * Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University(高级影像科学、多媒体与电影研究生院, Chung-Ang 大学) Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出 VG-CoT 数据集,通过自动化三阶段流程将推理步骤与图像真实视觉证据联系起来,提升大视觉-语言模型的可信度和推理能力。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28685 2026-08-03 cs.AI cs.IR 新提交 83%

Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks

安全,还是仅仅是能力?智能体安全基准的有效性审计

Youting Wang, Xiao Han, Dingyan Shang, Yuan Tang, Bowen Liu

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究审计了R-Judge等四个智能体安全基准的有效性,发现其排名分歧源于小样本偏差,能力与对齐错误安全负相关,AgentHarm与越狱安全的关联为收敛效度而非通用安全,强调安全主张需明确关键要素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07853 2026-07-31 cs.CR cs.AI 版本更新 83%

FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments

FinVault:在执行 grounded 环境中评估金融代理安全性的基准测试

Zhi Yang, Runguo Li, Qiqi Qiang, Jiashun Wang, Fangqi Lou, Mengping Li, Dongpo Cheng, Rui Xu, Heng Lian, Shuo Zhang, Xiaolong Liang, Xiaoming Huang, Zheng Wei, Zhaowei Liu, Xin Guo, Huacan Wang, Ronghao Chen, Liwen Zhang

机构 * SUFE(上海财经大学) CUHKSZ(香港中文大学) SUIBE(上海对外经贸大学) FDU(福建大学) XDU(西安电子科技大学) BUPT(北京邮电大学) Tencent(腾讯) UCAS(中国科学院大学) PKU(北京大学) QuantaAlpha(量子Alpha)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

AI总结 FinVault 是首个针对金融代理的执行 grounded 安全基准测试,通过31个监管案例驱动的沙盒场景和963个测试用例,评估金融代理在现实金融环境中的安全性和防御有效性。

Comments After further review of the current submission, we have identified potential legal and intellectual property concerns associated with keeping the manuscript publicly available as a preprint. In particular, there are ongoing considerations regarding institutional affiliation information, intellectual property ownership, and related compliance matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06354 2026-07-31 cs.CY cs.HC cs.SY eess.SY 版本更新 83%

The Missing Variable: Socio-Technical Alignment in Risk Evaluation

缺失的变量:风险评估中的社会技术对齐

Niclas Flehmig, Mary Ann Lundteigen, Shen Yin

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CY

AI总结 本文提出社会技术对齐STA变量,用于改进AI安全关键系统风险评估,通过案例研究展示其在捕捉社会技术安全影响方面的贡献。

Comments This paper was accepted for the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18259 2026-07-22 cs.AI 新提交 83%

Probabilistic Concept-Aware Steering for Trustworthy LLM Inference

用于可信大语言模型推理的概率概念感知引导

Brian Becker, Rui Chu, Yingjie Lao

专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究针对大语言模型推理中现有引导向量方法的问题,提出概率概念感知引导框架,通过概念驱动检索和概率校准,在保留模型能力的同时实现可控、安全的语义偏差引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12985 2026-07-22 cs.AI 版本更新 83%

SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents

SENTINEL:面向基础模型基于具身代理的安全性评估多级形式框架

Simon Sinong Zhan, Philip Wang, Yao Liu, Yiyan Peng, Zinan Wang, Qineng Wang, Zhian Ruan, Xiangyu Shi, Xinyu Cao, Frank Yang, Zhenyang Ni, Kangrui Wang, Ruohan Zhang, Huajie Shao, Manling Li, Qi Zhu

机构 * Northwestern University, USA University of Southern California, USA College of William \& Mary

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 SENTINEL通过形式时序逻辑多级验证框架,系统性评估基础模型具身代理在模拟环境中的物理安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15992 2026-07-20 cs.AI 新提交 83%

Closing the AI Trust Gap: The Case for Independent Certification for Trustworthy AI

缩小人工智能信任差距:可信人工智能独立认证的案例

Trisevgeni Papakonstantinou, Cansu Canca, Farah Nanji, Waheedullah Pardess, Jen Weedon, Jasmijn Remmers, Eliza Krigman, Matthew Ball, Yalda Daryani, Kiran Iqbal, Francielle Vargas, María Llorente Sánchez, Joe Humphreys, Fendi Tsim, Kelly Fitzpatrick, Jeff Dunn, Catherine Feldman

机构 * University College London(伦敦大学学院) AI Ethics Lab(人工智能伦理实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) MATS Tech with Intention(技术与意图) University of Southern California(南加州大学) Kyushu University(九州大学) University of Chile(智利大学) BehSci Meets AI(行为科学与人工智能) Digital Trust Council(数字信任委员会)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究指出负责任AI虽有实践但未形成奖励可信度的市场,存在信任差距。原因包括关注重点偏差及三个复合失败。通过审查治理工具发现不足,进而提出以结果为导向的独立认证来缩小信任差距,补充监管与内部治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14570 2026-07-17 cs.AI cs.CR 新提交 83%

Democratizing Agent Deployment Safety: A Structural Monitoring Approach

使智能体部署安全民主化:一种结构监测方法

Preeti Ravindra, Rahul Tiwari, Vincent Wolowski

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。

Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26052 2026-07-15 cs.CL 版本更新 83%

From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Models

从提示风险到响应风险:大型语言模型安全行为的配对分析

Mengya Hu, Qiong Wei, Sandeep Atluri

机构 * Microsoft(微软)

专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 本研究通过配对分析人类标注的提示和响应记录,探讨了大型语言模型在四个危害类别(性、自残、仇恨和暴力)和有序严重性级别上的安全行为,发现61%的响应比提示减少了危害,3%的响应升级了危害,并揭示了安全行为与无害性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10871 2026-07-14 cs.AI cs.HC 新提交 83%

Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

迈向沉思型大语言模型:心理健康领域中评估与增强大语言模型对齐性的模块化框架

Asher Sprigler, Yang-Yang Feng, Iftach Amir, Jonathan E. Bogard, Todd S Braver, Yi Ding, David Kinney, Yixue Zhao

机构 * Purdue University(普渡大学) Washington University in St. Louis(圣路易斯华盛顿大学) Yixue Research Institute(易学研究所)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 针对新模型等涌现使评估沉思原则增强大语言模型对齐性具挑战的问题,提出模块化可扩展评估框架,能集成新元素并重现先进结果,支持交叉评估,其提示模块便于纳入伦理视角,为跨学科研究及有益人机生态系统奠定基础。

Comments Accepted as an oral presentation at HARMONY 2026 (Human-centered AI Research for Mental Health, an Open Networking Symposium), co-located with IEEE/ACM Conference on Connected Health: Applications, Systems, and Engineering Technologies (CHASE 2026) held in Pittsburgh, August 6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22706 2026-06-23 cs.AI 新提交 83%

Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

通过多任务风险融合的LLM生成驾驶员干预信息的安全感知评估

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究推进中心)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出DSAIS指标,结合规则与LLM评估五个维度,通过多任务风险融合框架提升干预信息质量,实验表明多任务集成使上下文相关性提升9.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 83%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交 83%

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18656 2026-06-18 cs.CL 新提交 83%

The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

错误的正确:量化和定位大语言模型中的失调对齐

Naihao Deng, Yiming Feng, Chimaobi Okite, Kaijian Zou, Lu Wang, Rada Mihalcea, Yulong Chen

机构 * University of Michigan(密歇根大学) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出VETO基准和失调对齐率(MAR)指标,发现所有LLM在刻板印象相关问题上均存在非平凡的失调对齐,且人类为0%,机制分析表明对齐诱导的线索会放大该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13884 2026-06-15 cs.AI 新提交 83%

Capability Minimization as a Safety Primitive: Risk-Aware Causal Gating for Least-Privilege LLM Agents

能力最小化作为安全原语:风险感知因果门控实现最小特权LLM代理

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出风险感知因果门控(RACG)框架,通过因果效应估计与校准风险控制决定是否采纳模型预测,显著降低高成本错误,同时保持非门控策略的大部分效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13854 2026-06-15 cs.HC cs.AI 新提交 83%

SpheriCity: Designing Trustworthy Conversational AI for Sustainability Decision Support

SpheriCity:为可持续发展决策支持设计可信赖的对话式AI

Ahmed Qayyum, Madison Werner, Kathryn Youngblood, Jenna R. Jambeck, Tahiya Chowdhury

机构 * Department of Computer Science, Colby College(科里尔学院计算机科学系) Circularity Informatics Lab, University of Georgia(佐治亚大学循环信息实验室)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出SpheriCity,一种基于来源的对话式AI原型,通过结构化合成和交互支架,支持从城市循环性评估报告中可信地获取知识,解决大语言模型在可持续性高风险领域中的透明度与信任问题。

Comments Accepted to ACM SIGCAS/SIGCHI Conference on Computing and Sustainable Societies (COMPASS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12797 2026-06-12 cs.AI 新提交 83%

The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements

遏制缺口:已部署的自主AI框架如何未能满足面向公众的安全要求

Md Jafrin Hossain, Mohammad Arif Hossain, Weiqi Liu, Nirwan Ansari

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究发现主流自主AI框架缺乏架构级安全保证,内存完整性漏洞可导致定向腐败,提出轻量级遏制机制消除攻击向量。

Comments ICML 2026 (AI4GOOD Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06703 2026-06-05 cs.AI 83%

ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents

ST-WebAgentBench:用于评估网络代理安全性和可信度的基准测试

Ido Levy, Ben Wiesel, Sami Marreed, Alon Oved, Avi Yaeli, Nir Mashkif, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出ST-WebAgentBench基准测试,用于评估网络代理在现实企业场景中的安全性和可信度,通过引入新的评估指标CuP和风险比,揭示了现有代理的安全性缺陷。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14760 2026-06-04 cs.CL 83%

Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation

推理边界:通过测试时深思增强规范对齐

Haoran Zhang, Yafu Li, Xuyang Hu, Dongrui Liu, Zhilin Wang, Bo Li, Yu Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 提出Align3方法,利用测试时深思(TTD)和分层反思修正来推理规范边界,并构建SpecBench基准,实验表明TTD能有效增强规范对齐。

Comments 10 pages main text, 52 pages total (including appendix). Code and resources are available at https://github.com/zzzhr97/SpecBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29667 2026-05-29 cs.CL 83%

Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese

超越英语与规避:用于高风险LLM中文安全评估的人工标注多领域基准

Wajdi Zaghouani, Kholoud K. Aldous, Yicheng Gao

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 针对LLM在中文环境下安全系统失效的问题,构建了包含1,897个对抗性提示的人工标注基准ChiSafe-PAS,覆盖四个高风险领域,并提供完整标注以评估模型安全对齐。

Journal ref Proceedings of The fourth international workshop on the role of resources in the age of large language models RESOURCEFUL-2026 at LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏