arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2602.05480 2026-02-06 cs.CV 78%

SOMA-1M: A Large-Scale SAR-Optical Multi-resolution Alignment Dataset for Multi-Task Remote Sensing

SOMA-1M: 一种大规模SAR-光学多分辨率对齐数据集用于多任务遥感

Peihao Wu, Yongxiang Yao, Yi Wan, Wenfei Zhang, Ruipeng Zhao, Jiayuan Li, Yongjun Zhang

机构 * School of Remote Sensing Information Engineering, Wuhan University(遥感信息工程学院,武汉大学) Hubei LuoJia Laboratory(湖北珞珈实验室) Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部)

专题命中 安全评测 :alignment(title,abstract)

AI总结 SOMA-1M是首个大规模SAR-光学多分辨率对齐数据集,用于提升多任务遥感图像处理的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21051 2026-02-06 cs.CL cs.AI cs.CY 78%

Language Models and Logic Programs for Trustworthy Tax Reasoning

语言模型与逻辑程序用于可信的税务推理

William Jurayj, Nils Holzenberger, Benjamin Van Durme

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出结合语言模型与符号求解器的方法,用于提升税务推理的准确性与经济可行性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17100 2026-01-29 cs.CV 78%

The SAGES Critical View of Safety Challenge: A Global Benchmark for AI-Assisted Surgical Quality Assessment

SAGES关键安全视角挑战:人工智能辅助手术质量评估的全球基准

Deepak Alapatt, Jennifer Eckhoff, Zhiliang Lyu, Yutong Ban, Jean-Paul Mazellier, Sarah Choksi, Kunyi Yang, Po-Hsing Chiang, Noemi Zorzetti, Samuele Cannas, Daniel Neimark, Omri Bar, Amine Yamlahi, Jakob Hennighausen, Xiaohan Wang, Rui Li, Long Liang, Yuxian Wang, Saurabh Koju, Binod Bhattarai, Tim Jaspers, Zhehua Mao, Anjana Wijekoon, Jun Ma, Yinan Xu, Zhilong Weng, Ammar M. Okran, Hatem A. Rashwan, Boyang Shen, Kaixiang Yang, Yutao Zhang, Hao Wang, 2024 CVS Challenge Consortium, Quanzheng Li, Filippo Filicori, Xiang Li, Pietro Mascagni, Daniel A. Hashimoto, Guy Rosman, Ozanan Meireles, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家医学研究院) ICube(ICube研究中心) UMR7357(法国国家科研机构(UMR7357)) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院) University Hospital Cologne(科隆大学医院) Global College(全球学院) Shanghai Jiao Tong University(上海交通大学) Chang Gung Memorial Hospital(长庚纪念医院) A. Costa Hospital(A. Costa医院) Maggiore Hospital - AUSL Bologna(马吉奥医院 - 玛格丽特医院) Institute for Research against Digestive Cancer (IRCAD)(消化道癌症研究机构(IRCAD)) Lenox Hill Hospital(Lenox Hill医院) Northwell Health(Northwell健康系统) Albany Medical Center(阿尔巴尼医疗中心) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) Stanford University(斯坦福大学) MultiModal Learning Lab(多模态学习实验室) NAAMII University of Aberdeen(阿伯丁大学) Eindhoven University of Technology(埃因霍温理工大学) UCL Hawkes Institute(UCL Hawkes研究所) Dept of Computer Science, University College London(计算机科学系,伦敦大学学院) University Health Network(大学健康网络) Institute for Biomedical Informatics(生物医学信息研究所) Rovira i Virgili University(罗维拉-维吉里大学) Huazhong University of Science(华中科技大学) Hefei University of Technology(合肥工业大学) University of Pennsylvania(宾夕法尼亚大学) Duke University(杜克大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 SAGES关键安全视角挑战通过全球协作和AI技术,提升手术质量评估的性能和鲁棒性,推动临床应用。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19540 2026-01-28 cs.HC 78%

"Do I Trust the AI?" Towards Trustworthy AI-Assisted Diagnosis: Understanding User Perception in LLM-Supported Reasoning

我是否信任AI?:迈向可信的AI辅助诊断:理解用户在LLM支持推理中的感知

Yuansong Xu, Yichao Zhu, Haokai Wang, Yuchen Wu, Yang Ouyang, Hanlu Li, Wenzhe Zhou, Xinyu Liu, Chang Jiang, Quan Li

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文研究医生对LLM临床推理能力的感知,通过实验揭示医生对LLM诊断能力的评估,并探讨提升医生与LLM协作可信度的方法。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI'26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19134 2026-01-28 cs.CR cs.SE 78%

Evaluating Nova 2.0 Lite model under Amazon's Frontier Model Safety Framework

在亚马逊前沿模型安全框架下评估Nova 2.0 Lite模型

Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spyros Matsoukas

专题命中 安全评测 :safety(title,abstract)

AI总结 本文在亚马逊前沿模型安全框架下评估了Nova 2.0 Lite模型,分析其在高风险领域的安全性和性能表现。

Comments Arxiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17540 2026-01-28 cs.SE 78%

SGCR: A Specification-Grounded Framework for Trustworthy LLM Code Review

SGCR:一种基于规范的可信大语言模型代码审查框架

Kai Wang, Bingcheng Mao, Shuai Jia, Yujie Ding, Dongming Han, Tianyi Ma, Bin Cao

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 SGCR通过规范引导LLMs实现可信代码审查,其双路径架构在工业环境中提升了42%的开发者采纳率。

Comments Accepted at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18850 2026-01-28 cs.SE 78%

Towards Safety-Compliant Transformer Architectures for Automotive Systems

面向汽车系统的安全合规Transformer架构

Sven Kirchner, Nils Purschke, Chengdong Wu, Alois Knoll

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种安全合规的Transformer架构,通过多模态基础模型提升汽车系统的容错性和鲁棒性,实现自动驾驶中的可认证AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03310 2026-01-27 eess.AS 78%

TASU: Text-Only Alignment for Speech Understanding

TASU:用于语音理解的纯文本对齐

Jing Peng, Yi Yang, Xu Li, Yu Xi, Quanwei Tang, Yangui Fang, Junjie Li, Kai Yu

专题命中 安全评测 :alignment(title,abstract)

AI总结 TASU通过纯文本数据实现语音理解的跨模态对齐,提升了零样本语音识别性能,并在多个基准测试中优于现有模型。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10250 2026-01-26 cs.CV 78%

GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection

GAMMA: 通过多任务和操控增强训练实现通用对齐的AI生成图像检测

Haozhen Yan, Yan Hong, Suning Lang, Jiahui Zhan, Yikun Ji, Yujie Gao, Huijia Zhu, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 安全评测 :alignment(title,abstract)

AI总结 GAMMA通过多任务和操控增强训练,提升AI生成图像检测的泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09195 2026-01-13 cs.CV 78%

Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives

迈向可信的皮肤科多模态大语言模型:一种基准和多模态评估器用于诊断叙述

Yuhao Shen, Jiahe Qian, Shuping Zhang, Zhangtianyi Chen, Tao Lu, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院)

专题命中 安全评测 :trustworthy(title);alignment(abstract)

AI总结 本文提出DermBench和DermEval用于评估皮肤科多模态大语言模型的诊断叙述,通过结合基准和自动评估器,实现临床意义的可重复评估,验证模型性能与专家评分的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23243 2026-01-12 cs.CV 78%

Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism

遥感图像的多模态解释:动态分辨率输入策略与多尺度视觉-语言对齐机制

Siyu Zhang, Lianlei Shan, Runhe Qiu

机构 * Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出动态分辨率输入策略与多尺度视觉-语言对齐机制,提升遥感图像多模态解释的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06142 2026-01-06 cs.CV 78%

SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models

SDEval: 多模态大语言模型的安全动态评估

Hanqing Wang, Yuan Tian, Mingyu Liu, Zhenhao Zhang, Xiangyang Zhu

专题命中 安全评测 :safety(title,abstract)

AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。

Comments AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01516 2025-12-30 cs.LG cs.AI cs.CL 78%

Quantifying True Robustness: Synonymity-Weighted Similarity for Trustworthy XAI Evaluation

量化真实鲁棒性:基于同义词加权的相似性用于可信XAI评估

Christopher Burger

机构 * The University of Mississippi(密苏里大学)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于同义词加权的相似性方法,用于更准确评估XAI系统的鲁棒性,防止攻击成功率的高估。

Comments 10 pages, 2 figures, 6 tables. Changes to title, abstract and minor edits to the content as a result of acceptance to the 59th Hawaii International Conference on System Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09814 2025-12-22 cs.CV 78%

On the dynamic evolution of CLIP texture-shape bias and its relationship to human alignment and model robustness

CLIP纹理-形状偏倚的动态演变及其与人类对齐和模型鲁棒性的关系

Pablo Hernández-Cámara, Jose Manuel Jaén-Lorites, Alexandra Gómez-Villa, Jorge Vila-Tomás, Valero Laparra, Jesus Malo

机构 * Image Processing Lab, Universitat de Valencia, Spain(瓦伦西亚大学图像处理实验室) Centro de Biomateriales e Ingenieria Tisular, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文研究CLIP模型在训练过程中纹理-形状偏倚的演变,揭示其与人类感知对齐及模型鲁棒性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16238 2025-12-22 cs.OS 78%

Trustworthy and Controllable Professional Knowledge Utilization in Large Language Models with TEE-GPU Execution

在大语言模型中实现可信且可控的专业知识利用:TEE-GPU执行

Yifeng Cai, Zhida An, Yuhan Meng, Houqian Liu, Pengli Wang, Hanwen Lei, Yao Guo, Ding Li

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出PKUS系统,通过将专业知识作为可分离的制品,实现大语言模型中可信且可控的专业知识利用,提升模型性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09603 2025-12-18 cs.CV 78%

Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior

多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试

Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau

专题命中 安全评测 :alignment(title,abstract)

AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。

Comments Project page: https://jiaying.link/HVSBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08233 2025-12-10 cs.RO 78%

Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior

语义-度量贝叶斯风险场:从人类视频中学习机器人安全性的方法

Timothy Chen, Marcus Dominguez-Kuhne, Aiden Swann, Xu Liu, Mac Schwager

机构 * Stanford University(斯坦福大学) California Institute of Technology(加州理工学院)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出基于贝叶斯框架的语义-度量风险场,通过人类视频学习机器人安全风险模型,实现类人风险评估与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22345 2025-12-05 cs.CV 78%

Flowing Backwards: Improving Normalizing Flows via Reverse Representation Alignment

反向流动:通过反向表征对齐改进规范化流

Yang Chen, Xiaowei Xu, Shuai Wang, Chenhui Zhu, Ruxue Wen, Xubin Li, Tiezheng Ge, Limin Wang

专题命中 安全评测 :alignment(title,abstract)

AI总结 通过反向表征对齐改进规范化流,提升生成质量和分类准确性,训练速度提升3.3倍,实现ImageNet新state-of-the-art结果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01373 2025-12-02 cs.CV 78%

SRAM: Shape-Realism Alignment Metric for No Reference 3D Shape Evaluation

SRAM:无参考3D形状评估的形状现实对齐度量

Sheng Liu, Tianyu Luan, Phani Nuney, Xuelu Feng, Junsong Yuan

专题命中 安全评测 :alignment(title,abstract)

AI总结 SRAM提出了一种基于大型语言模型的无参考3D形状评估度量,通过网格编码和现实感解码器实现与人类感知的对齐,优于现有方法并具有良好的泛化能力。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17730 2025-11-25 eess.SY cs.SY 78%

Safety and Risk Pathways in Cooperative Generative Multi-Agent Systems: A Telecom Perspective

合作生成多智能体系统的安全性和风险路径:电信视角

Zeinab Nezami, Shehr Bano, Abdelaziz Salama, Maryam Hafeez, Syed Ali Raza Zaidi

专题命中 安全评测 :safety(title,abstract)

AI总结 本文从电信视角探讨生成多智能体系统中的安全性和风险路径,提出模块化安全评估框架,揭示智能体多样性对系统稳定性的影响,并展示通过模拟验证的改进与持续存在的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24143 2025-11-21 cs.DC 78%

Enhancing Traffic Safety with AI and 6G: Latency Requirements and Real-Time Threat Detection

用AI和6G提升交通安全性:延迟需求与实时威胁检测

Kurt Horvath, Dragi Kimovski, Stojan Kitanov, Radu Prodan

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出基于6G和AI的交通安全框架,通过实时威胁检测和低延迟通信提升交通安全性。

Comments Sumbitted/Accepted ICINT 2025 (PrePrint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15206 2025-11-20 cs.CR cs.IT math.IT 78%

Trustworthy GenAI over 6G: Integrated Applications and Security Frameworks

Bui Duc Son, Trinh Van Chien, Dong In Kim

专题命中 安全评测 :trustworthy(title,abstract)

Comments 8 pages, 5 figures. Submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03565 2025-11-12 cs.CV 78%

Bridged Semantic Alignment for Zero-shot 3D Medical Image Diagnosis

Haoran Lai, Zihang Jiang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Weifu Lv, Wei Wei, S. Kevin Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research(苏州先进研究所) Stanford University(斯坦福大学) iFlytek Co. Ltd.(iFlytek公司) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, USTC(中国科学技术大学第一附属医院)

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00775 2025-10-28 cs.HC 78%

Efficiency with Rigor! A Trustworthy LLM-powered Workflow for Qualitative Data Analysis

Jie Gao, Zhiyao Shu, Shun Yi Yeo, Alok Prakash, Chien-Ming Huang, Mark Dredze, Ziang Xiao

专题命中 安全评测 :trustworthy(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21606 2025-10-27 cs.CV 78%

Modest-Align: Data-Efficient Alignment for Vision-Language Models

Jiaxiang Liu, Yuan Wang, Jiawei Du, Joey Tianyi Zhou, Mingkun Xu, Zuozhu Liu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ZJU-Angelalign R&D Center for Intelligence Healthcare(浙大天使align智能医疗研发中心) Centre for Frontier AI Research (CFAR)(前沿人工智能研究中心) Agency for Science, Technology and Research (A*STAR)(科技研究局) Institute of High Performance Computing (IHPC)(高性能计算研究所)

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21120 2025-10-27 cs.CV 78%

SafetyPairs: Isolating Safety Critical Image Features with Counterfactual Image Generation

Alec Helbling, Shruti Palaskar, Kundan Krishna, Polo Chau, Leon Gatys, Joseph Yitan Cheng

机构 * Georgia Tech(佐治亚理工学院) Apple(苹果公司)

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18550 2025-10-22 cs.NI 78%

JAUNT: Joint Alignment of User Intent and Network State for QoE-centric LLM Tool Routing

Enhan Li, Hongyang Du

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10086 2025-10-14 cs.RO 78%

Beyond ADE and FDE: A Comprehensive Evaluation Framework for Safety-Critical Prediction in Multi-Agent Autonomous Driving Scenarios

Feifei Liu, Haozhe Wang, Zejun Wei, Qirong Lu, Yiyang Wen, Xiaoyu Tang, Jingyan Jiang, Zhijian He

机构 * South China Normal University(华南师范大学) Shenzhen Technology University(深圳技术大学)

专题命中 安全评测 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17040 2025-10-14 cs.CV 78%

Multimodal Alignment and Fusion: A Survey

Songtao Li, Hao Tang

机构 * Peking University(北京大学) Northeastern University(东北大学) Sydney Smart Technology College(悉尼智能技术学院) School of Computer Science, Peking University(北京大学计算机学院) The State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室)

专题命中 安全评测 :alignment(title,abstract)

Comments Accepted to IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07652 2025-10-10 cs.CV 78%

Dual-Stream Alignment for Action Segmentation

Harshala Gammulle, Clinton Fookes, Sridha Sridharan, Simon Denman

机构 * Signal Processing, Artificial Intelligence and Vision Technologies (SAIVT) Lab(信号处理、人工智能与视觉技术实验室) Queensland University of Technology(昆士兰理工大学)

专题命中 安全评测 :alignment(title,abstract)

Comments Journal Submission

详情

展开后加载摘要…

URL PDF HTML 收藏