arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-08 至 2025-12-08 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2512.05501 2025-12-08 cs.CL 86%

SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures

SEA-SafeguardBench: 评估SEA语言和文化中的AI安全

Panuthep Tasawong, Jian Gang Ngui, Alham Fikri Aji, Trevor Cohn, Peerat Limkonchotiwat

机构 * VISTEC Google(谷歌) AI Singapore(AI新加坡)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL

AI总结 SEA-SafeguardBench是首个针对东南亚语言和文化的AI安全评估基准,通过八种语言21640个样本验证LLMs在文化特定危害场景下的表现。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16402 2025-12-08 cs.AI cs.CL cs.CV cs.LG cs.RO 82%

IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks

IS-Bench:评估由视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性

Xiaoya Lu, Zeren Chen, Xuhao Hu, Yijin Zhou, Weichen Zhang, Dongrui Liu, Lu Sheng, Jing Shao

机构 * Xiaoya Lu 1, 2(某大学) Zeren Chen 2, 3(某大学) Xuhao Hu 2, 4(某大学) Yijin Zhou 2(某大学) Weichen Zhang 2(某大学) Dongrui Liu 2(某大学) Lu Sheng 3(某研究所) Jing Shao 2(某研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IS-Bench通过多模态基准评估视觉语言模型驱动的具身智能体在日常家务任务中的交互安全性,揭示现有智能体缺乏安全意识的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05334 2025-12-08 cs.IR cs.AI cs.CL 62%

The Effect of Document Summarization on LLM-Based Relevance Judgments

文档摘要对基于大语言模型的相关性判断的影响

Samaneh Mohtadi, Kevin Roitero, Stefano Mizzaro, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了文档摘要对基于大语言模型的相关性判断可靠性及IR评估的影响,发现摘要判断在稳定性上与完整文档判断相当,但引入了系统性的标签偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00010 2025-12-08 cs.IR cs.AI cs.CL 62%

EnterpriseEM: Fine-tuned Embeddings for Enterprise Semantic Search

EnterpriseEM: 企业语义搜索的微调嵌入

Kamalkumar Rathinasamy, Jayarama Nettar, Amit Kumar, Vishal Manchanda, Arun Vijayakumar, Ayush Kataria, Venkateshprasanna Manjunath, Chidambaram GS, Jaskirat Singh Sodhi, Shoeb Shaikh, Wasim Akhtar Khan, Prashant Singh, Tanishq Dattatray Ige, Vipin Tiwari, Rajab Ali Mondal, Harshini K, S Reka, Chetana Amancharla, Faiz ur Rahman, Harikrishnan P A, Indraneel Saha, Bhavya Tiwary, Navin Shankar Patel, Pradeep T S, Balaji A J, Priyapravas, Mohammed Rafee Tarafdar

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EnterpriseEM方法,通过微调预训练嵌入模型提升企业语义搜索的精度与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05648 2025-12-08 cs.LG 57%

Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs

超越数据过滤:LLMs中能力移除的知识定位

Igor Shilov, Alex Cloud, Aryo Pradipta Gema, Jacob Goldman-Wetzler, Nina Panickssery, Henry Sleight, Erik Jones, Cem Anil

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出SGTM方法,通过局部化知识并屏蔽梯度来移除LLM中的危险能力,相比数据过滤和梯度路由,在标签噪声下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05576 2025-12-08 cs.AI 57%

CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning

CureAgent:一种无需训练的执行-分析框架用于临床推理

Ting-Ting Xie, Yixin Zhang

机构 * Cambridge(剑桥)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 CureAgent提出无需训练的执行-分析框架,通过模块化架构和分层集合策略提升临床推理性能,实现CURE-Bench上的最佳表现。

Comments 2nd Place Solution to the CURE-Bench Competition @ NeurIPS 2025. Code available at https://github.com/June01/CureAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05176 2025-12-08 cs.SE cs.AI cs.HC 57%

Towards A Cultural Intelligence and Values Inferences Quality Benchmark for Community Values and Common Knowledge

迈向社区价值观和常识的文化智能与价值观推理质量基准

Brittany Johnson, Erin Reddick, Angela D. R. Smith

机构 * George Mason University(乔治·马歇尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出CIVIQ基准,旨在通过社区价值观和常识对齐提升文化智能,填补美国文化多样性下的评估空白。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05559 2025-12-08 q-fin.CP 50%

A Unified AI System For Data Quality Control and DataOps Management in Regulated Environments

统一的AI系统用于受监管环境中的数据质量控制和DataOps管理

Devender Saini, Bhavika Jain, Nitish Ujjwal, Philip Sommer, Dan Romuald Mbanga, Dhagash Mehta

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种统一的AI驱动框架,用于受监管环境中数据质量控制和DataOps管理,通过整合多种方法提升数据管道的可靠性与合规性。

Comments 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05511 2025-12-08 cs.CV 50%

Rethinking Infrared Small Target Detection: A Foundation-Driven Efficient Paradigm

重新思考红外小目标检测:一种基础驱动的高效范式

Chuang Yu, Jinmiao Zhao, Yunpeng Liu, Yaokun Li, Xiujun Shu, Yuanhao Feng, Bo Wang, Yimian Dai, Xiangyu Yue

机构 * Key Laboratory of Opto-Electronic Information Processing, Chinese Academy of Sciences(光电信息处理重点实验室,中国科学院) Shenyang Institute of Automation, Chinese Academy of Sciences(沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Tencent(腾讯) Nankai University(南开大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FDEP范式,通过基础模型冻结表示与任务特征融合,提升红外小目标检测精度,构建综合评估指标,实现多数据集SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05470 2025-12-08 cs.SE 50%

Everything is Context: Agentic File System Abstraction for Context Engineering

一切皆为上下文:面向上下文工程的代理文件系统抽象

Xiwei Xu, Robert Mao, Quan Bai, Xuewu Gu, Yechao Li, Liming Zhu

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种基于文件系统的上下文工程抽象,通过统一挂载、元数据和访问控制,实现可验证的上下文管理,支持可问责和以人类为中心的AI协作。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14257 2025-12-08 cs.SE 50%

C2SaferRust: Transforming C Projects into Safer Rust with NeuroSymbolic Techniques

C2SaferRust:利用神经符号技术将C项目转化为更安全的Rust

Vikram Nitin, Rahul Krishna, Luiz Lemos do Valle, Baishakhi Ray

专题命中 安全评测 :safety(abstract)

AI总结 C2SaferRust结合规则系统和LLMs,将C代码转换为更安全的Rust,减少指针和unsafe代码,提升安全性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏