arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-04 至 2026-02-04 共收录 63 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2602.02824 2026-02-04 cs.CL 83%

CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment

CATNIP:通过校准和令牌化的负偏好对齐实现LLM去学习

Zhengbang Yang, Yisheng Zhong, Junyuan Hong, Zhuangdi Zhu

机构 * George Mason University(乔治·马歇尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 CATNIP通过校准和令牌化的负偏好对齐方法,实现有效LLM去学习,无需保留数据或对比对,提升知识遗忘与保留的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC 82%

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract)

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07743 2026-02-04 cs.CL 79%

OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment

OpenRubrics: 向奖励建模和大语言模型对齐的可扩展合成 rubric 生成迈进

Tianci Liu, Ran Xu, Tony Yu, Ilgee Hong, Carl Yang, Tuo Zhao, Haoyu Wang

机构 * Purdue University(普渡大学) Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.CL

AI总结 OpenRubrics 提出了一种基于对比的 rubric 生成方法,通过大规模(提示,rubric)对提升奖励建模和大语言模型对齐的性能。

Comments The first two authors contributed equally. Updated OpenRubrics dataset, RMs, and results

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03622 2026-02-04 cs.CL cs.AI cs.LG 75%

Align to Structure: Aligning Large Language Models with Structural Information

对齐结构:将大型语言模型与结构信息对齐

Zae Myung Kim, Anand Ramachandran, Farideh Tavazoee, Joo-Kyung Kim, Oleg Rokhlenko, Dongyeop Kang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过整合语言学话语框架到强化学习中,结构对齐方法提升LLMs在长文本生成和摘要任务中的连贯性和结构组织能力。

Comments Accepted to AAAI 2026 AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02383 2026-02-04 cs.LG 70%

SLIME: Stabilized Likelihood Implicit Margin Enforcement for Preference Optimization

SLIME:偏好优化中的稳定性似然隐边界的隐式约束

Maksim Afanasyev, Illarion Iov

机构 * Floating Point Sigma Lab(浮点数Sigma实验室)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 SLIME通过引入稳定性似然隐边界的隐式约束,解决偏好优化中的目标不匹配问题,提升模型生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 70%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07326 2026-02-04 cs.CL cs.AI cs.CY cs.LG 70%

Reward Model Interpretability via Optimal and Pessimal Tokens

通过最优和最劣 tokens 实现奖励模型可解释性

Brian Christian, Hannah Rose Kirk, Jessica A. F. Thompson, Christopher Summerfield, Tsvetomira Dumbalska

机构 * University of Oxford(牛津大学)

专题命中 偏好对齐 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过分析奖励模型对不同token的评分,揭示了模型间的异质性、评分不对称性及潜在偏见,挑战了奖励模型的可互换性及代理人类价值观的假设。

Comments Accepted for publication in Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT '25), to appear June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03635 2026-02-04 cs.CL cs.LG 62%

TRE: Encouraging Exploration in the Trust Region

TRE: 在信任区域中鼓励探索

Chao Huang, Yujing Lu, Quangang Li, Shenghe Wang, Yan Wang, Yueyang Zhang, Long Xia, Jiashu Zhao, Zhiyuan Sun, Daiting Shi, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Wilfrid Laurier University(威尔弗里德·劳里埃大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 TRE通过在模型信任区域内鼓励探索,提升了大型语言模型在数学推理、组合搜索和偏好对齐任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03097 2026-02-04 cs.AI 57%

De-conflating Preference and Qualification: Constrained Dual-Perspective Reasoning for Job Recommendation with Large Language Models

解构偏好与资格:基于大语言模型的约束双视角推理 job 推荐

Bryce Kan, Wei Yang, Emily Nguyen, Ganghui Yi, Bowen Yi, Chenxiao Yu, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 JobRec通过约束双视角推理解构偏好与资格,提升职位推荐的可控性和匹配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02178 2026-02-04 cs.CL 57%

AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?

AR-MAP:自回归大语言模型是否是扩散大语言模型的隐式教师?

Liang Lin, Feng Xiong, Zengbin Wang, Kun Wang, Junhao Dong, Xuecai Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(AMAP,阿里巴巴集团) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 AR-MAP通过利用自回归大语言模型作为隐式教师,有效提升扩散大语言模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2509.23286 2026-02-04 cs.CL cs.AI 88%

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

A2D: 任意顺序、任意步长的安全对齐用于扩散语言模型

Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Department of Computer Science and Engineering, Yonsei University(计算机科学与工程系,延世大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 A2D通过令牌级对齐方法,在扩散语言模型中实现任意顺序和步长攻击的鲁棒防御,显著降低有害输出生成概率并提升安全终止效率。

Comments Accepted at ICLR 2026. Code and models are available at https://ai-isl.github.io/A2D

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08951 2026-02-04 cs.CY cs.AI cs.CL 80%

PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm

PluriHarms:对AI危害全谱人类判断的基准测试

Jing-Jing Li, Joel Mire, Eve Fleisig, Valentina Pyatkin, Anne Collins, Maarten Sap, Sydney Levine

机构 * UC Berkeley(伯克利大学) Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能研究院) New York University(纽约大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 PluriHarms通过系统研究人类对AI危害的判断,旨在推动更安全的AI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17600 2026-02-04 cs.CY 70%

STAMP/STPA Informed Characterization of Factors Leading to Loss of Control in AI Systems

基于STAMP/STPA的AI系统失控因素特征化

Steve Barrett, Anna Bruvere, Sean P. Fillingham, Catherine Rhodes, Stefano Vergani

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文基于STAMP/STPA方法,提出一个结构化框架来特征化AI系统失控的因果因素,以提升AI系统安全运行的保障能力。

Comments This new version only corrects some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00755 2026-02-04 cs.MA cs.AI cs.NE 57%

Evolving Interpretable Constitutions for Multi-Agent Coordination

为多智能体协调演化可解释的宪法

Ujwal Kumar, Alice Saito, Hershraj Niranjani, Rayan Yessou, Phan Xuan Tan

机构 * College of Engineering Shibaura Institute of Technology(Shibaura Institute of Technology 工程学院) Faculty of Arts and Sciences The University of Tokyo(东京大学 文理学部) Department of EECS University of California, Berkeley(加州大学伯克利分校 电子工程与计算机科学系) Department of Informatics Università degli Studi di Milano-Bicocca(米兰-比科卡大学 信息学系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过进化算法自动发现多智能体协调的可解释宪法,通过实验展示进化宪法在提升社会稳定性方面的有效性。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02970 2026-02-04 cs.LG 57%

Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL

Co2PO:多智能体强化学习中的协调约束策略优化

Shrenik Patel, Christine Truong

机构 * Rutgers University, New Brunswick, NJ(罗杰斯大学,新不伦瑞克,新泽西) Carnegie Mellon University, Pittsburgh, PA(卡内基梅隆大学,匹兹堡,宾夕法尼亚)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 Co2PO通过引入共享黑板架构和风险预测机制,实现多智能体强化学习中的协调安全优化,提升探索效率并减少保守性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03248 2026-02-04 cs.RO physics.app-ph physics.optics 50%

A thin and soft optical tactile sensor for highly sensitive object perception

一种薄而柔软的光学触觉传感器用于高灵敏度物体感知

Yanchen Shen, Kohei Tsuji, Haruto Koizumi, Jiseon Hong, Tomoaki Niiyama, Hiroyuki Kuwabara, Hayato Ishida, Jun Hiramitsu, Mitsuhito Mase, Satoshi Sunada

机构 * Graduate School of Natural Science and Technology, Kanazawa University(自然科学技术研究生院,金泽大学) Faculty of Mechanical Engineering, Institute of Science and Engineering, Kanazawa University(机械工程学部,科学工程研究所,金泽大学) Hamamatsu Photonics K.K.(Hamamatsu光子株式会社)

专题命中 安全训练 :alignment(abstract)

AI总结 本研究提出了一种薄而柔软的光学触觉传感器,通过散射图案变化实现高灵敏度的力测量和纹理识别,适用于软机器人和可穿戴设备。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2510.05052 2026-02-04 cs.CR cs.CL 85%

Proactive defense against LLM Jailbreak

主动防御对抗大语言模型劫持

Weiliang Zhao, Jinjun Peng, Daniel Ben-Levi, Zhou Yu, Junfeng Yang

机构 * Department of Computer Science, Columbia University, US(计算机科学系,哥伦比亚大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 ProAct通过主动误导劫持方法,显著降低攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14103 2026-02-04 cs.CR cs.AI cs.LG cs.SD eess.AS 81%

AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models

AudioJailbreak: 对端到端大音频-语言模型的攻击

Guangke Chen, Fu Song, Zhe Zhao, Xiaojun Jia, Yang Liu, Yanchen Qiao, Weizhe Zhang, Weiping Tu, Yuhong Yang, Bo Du

机构 * Wuhan University(武汉大学) Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) State Key Laboratory of Cryptology(密码学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanjing Institute of Software Technology(南京软件技术研究所) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Zhejiang Lab(浙江实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 AUDIOJAILBREAK 提出了一种针对端到端大音频-语言模型的新型音频攻击方法,具备非同步性、通用性、隐蔽性和空中鲁棒性,适用于弱攻击者场景。

Comments Accepted by IEEE Transactions on Dependable and Secure Computing (TDSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02595 2026-02-04 cs.CR cs.AI cs.CY 73%

To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack

为抵御网络攻击,我们必须教AI代理黑客

Terry Yue Zhuo, Yangruibo Ding, Wenbo Guo, Ruijie Meng

机构 * Monash University(墨尔本大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文主张AI代理驱动的网络攻击不可避免,需转变防御策略,提出构建全面基准、发展训练代理发现漏洞及实施治理限制进攻性AI能力,以负责任地掌握进攻性AI能力作为防御基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10415 2026-02-04 cs.SE cs.AI 57%

How to Trick Your AI TA: A Systematic Study of Academic Jailbreaking in LLM Code Evaluation

如何欺骗你的AI助教:对LLM代码评估中学术劫持的系统研究

Devanshu Sahoo, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Dhruv Kumar

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文研究了学术情境中针对LLM代码评估器的劫持攻击,提出了一种新的攻击类型,并通过实验揭示了LLM在面对此类攻击时的脆弱性。

Comments This manuscript has been withdrawn by the authors because the methodology and results have been superseded by a more rigorous framework (SPACI and AST-ASIP). The corrected and expanded findings are now available in arXiv:2601.21360. Please cite the new manuscript instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03489 2026-02-04 cs.CR 50%

Detecting and Explaining Malware Family Evolution Using Rule-Based Drift Analysis

基于规则的漂移分析检测和解释恶意软件家族演变

Olha Jurečková, Martin Jureček

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文提出基于规则的漂移分析方法,用于检测和解释恶意软件家族演变,通过比较规则集识别特征变化,提供可操作的恶意软件行为洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2602.03792 2026-02-04 cs.CR cs.AI cs.CL 81%

WebSentinel: Detecting and Localizing Prompt Injection Attacks for Web Agents

WebSentinel: 检测和定位网页代理中的提示注入攻击

Xilong Wang, Yinuo Liu, Zhun Wang, Dawn Song, Neil Gong

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 WebSentinel通过两步方法有效检测和定位网页代理中的提示注入攻击,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2602.01769 2026-02-04 cs.LG cs.AI 73%

IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination

IRIS: 隐式奖励引导的内部筛选以缓解多模态幻觉

Yuanshuai Li, Yuping Yan, Jirui Han, Fei Ming, Lingjuan Lv, Yaochu Jin

机构 * Department of Artificial Intelligence, Westlake University, Hangzhou, China(人工智能系,西湖大学,杭州,中国) Sony Research, Sony(索尼研究,索尼)

专题命中 幻觉与事实性 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 IRIS通过隐式奖励引导内部筛选,有效缓解多模态大语言模型的幻觉问题,无需外部反馈且性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02888 2026-02-04 cs.CL cs.AI 62%

HALT: Hallucination Assessment via Log-probs as Time series

HALT:通过log-prob作为时间序列进行幻觉评估

Ahmad Shapiro, Karan Taneja, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 HALT通过log-prob时间序列检测幻觉,比Lettuce更高效且兼容专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03158 2026-02-04 cs.IR 50%

PAMAS: Self-Adaptive Multi-Agent System with Perspective Aggregation for Misinformation Detection

PAMAS:基于视角聚合的自适应多智能体系统用于虚假信息检测

Zongwei Wang, Min Gao, Junliang Yu, Tong Chen, Chenghua Lin

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 PAMAS通过自适应多智能体系统和视角聚合技术,有效解决虚假信息检测中的信息淹没问题,提升检测准确性和效率。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 3 篇

2602.01757 2026-02-04 cs.CL cs.LG 62%

Zero2Text: Zero-Training Cross-Domain Inversion Attacks on Textual Embeddings

Zero2Text: 无训练跨域反向攻击文本嵌入

Doohyun Kim, Donghwa Kang, Kyungjae Lee, Hyeongboo Baek, Brent Byunghoon Kang

机构 * School of Computing, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院计算学院) Graduate School of Information Security, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院信息安全研究生院) Department of Artificial Intelligence, University of Seoul, Seoul, Republic of Korea(首尔大学人工智能系) Department of Computer Science, University of Seoul, Seoul, Republic of Korea(首尔大学计算机科学系)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 Zero2Text通过递归在线对齐机制,在无训练情况下实现跨域文本嵌入反向攻击,有效对抗传统防御手段,实验显示其在恢复句子方面表现优异。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09396 2026-02-04 cs.LG cs.CR 57%

A hierarchical approach for assessing the vulnerability of tree-based classification models to membership inference attack

一种用于评估基于树的分类模型对成员推断攻击脆弱性的分层方法

Richard J. Preen, Jim Smith

机构 * Department of Computer Science and Creative Technologies(计算机科学与创意技术系) University of the West of England(西英格兰大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文提出分层方法评估基于树的分类模型对成员推断攻击的脆弱性,通过前瞻性分析和后置检查减少昂贵评估需求。

Journal ref Transactions on Data Privacy 19:1 (2026) 29-55

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03423 2026-02-04 cs.CR cs.CV cs.CY cs.HC 57%

Origin Lens: A Privacy-First Mobile Framework for Cryptographic Image Provenance and AI Detection

Origin Lens:面向隐私保护的移动框架,用于加密图像溯源与AI检测

Alexander Loth, Dominique Conceicao Rosario, Peter Ebinger, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(应用科学弗赖堡大学) Doctoral Center for Applied Computer Science (PZAI)(应用计算机科学博士中心(PZAI))

专题命中 隐私与版权 :alignment(abstract);分类 cs.CY

AI总结 Origin Lens是一款以隐私为核心、基于移动设备的框架,通过加密图像溯源和AI检测技术,为用户提供本地化的视觉信息验证服务。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 17 篇

2501.18533 2026-02-04 cs.CV cs.CL cs.CR 83%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI 83%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏