arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-28 至 2026-01-28 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2410.17520 2026-01-28 cs.LG cs.CL 84%

MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control

MobileSafetyBench: 评估移动设备控制自主代理的安全性

Juyong Lee, Dongyoon Hahm, June Suk Choi, W. Bradley Knox, Kimin Lee

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19507 2026-01-28 cs.CL 79%

Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs

自动化安全基准测试:一种用于大型视觉语言模型的多代理流程

Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Qi Jia, Chunyi Li, Renrui Zhang, Heng Li, Zongrui Wang, Wei Sun

机构 * Shanghai AI Lab(上海人工智能实验室) PolyU HK(PolyU香港分校) East China Normal University(东华大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 VLSafetyBencher通过多代理流程自动化构建高质量安全基准,有效区分不同模型的安全性,提升LVLMs的安全评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19540 2026-01-28 cs.HC 78%

"Do I Trust the AI?" Towards Trustworthy AI-Assisted Diagnosis: Understanding User Perception in LLM-Supported Reasoning

我是否信任AI?:迈向可信的AI辅助诊断:理解用户在LLM支持推理中的感知

Yuansong Xu, Yichao Zhu, Haokai Wang, Yuchen Wu, Yang Ouyang, Hanlu Li, Wenzhe Zhou, Xinyu Liu, Chang Jiang, Quan Li

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文研究医生对LLM临床推理能力的感知,通过实验揭示医生对LLM诊断能力的评估,并探讨提升医生与LLM协作可信度的方法。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI'26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19134 2026-01-28 cs.CR cs.SE 78%

Evaluating Nova 2.0 Lite model under Amazon's Frontier Model Safety Framework

在亚马逊前沿模型安全框架下评估Nova 2.0 Lite模型

Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spyros Matsoukas

专题命中 安全评测 :safety(title,abstract)

AI总结 本文在亚马逊前沿模型安全框架下评估了Nova 2.0 Lite模型,分析其在高风险领域的安全性和性能表现。

Comments Arxiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17540 2026-01-28 cs.SE 78%

SGCR: A Specification-Grounded Framework for Trustworthy LLM Code Review

SGCR:一种基于规范的可信大语言模型代码审查框架

Kai Wang, Bingcheng Mao, Shuai Jia, Yujie Ding, Dongming Han, Tianyi Ma, Bin Cao

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 SGCR通过规范引导LLMs实现可信代码审查,其双路径架构在工业环境中提升了42%的开发者采纳率。

Comments Accepted at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18850 2026-01-28 cs.SE 78%

Towards Safety-Compliant Transformer Architectures for Automotive Systems

面向汽车系统的安全合规Transformer架构

Sven Kirchner, Nils Purschke, Chengdong Wu, Alois Knoll

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种安全合规的Transformer架构,通过多模态基础模型提升汽车系统的容错性和鲁棒性,实现自动驾驶中的可认证AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00600 2026-01-28 cs.CL cs.LG 73%

A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models

一种面向上下文的双指标框架用于大型语言模型中的置信度估计

Mingruo Yuan, Shuyi Zhang, Ben Kao

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 CRUX是一种面向上下文的双指标框架,通过上下文熵减少和统一一致性检验提升大型语言模型的置信度估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18983 2026-01-28 cs.DC 71%

Trustworthy Scheduling for Big Data Applications

大数据应用中的可信调度

Dimitrios Tomaras, Vana Kalogeraki, Dimitrios Gunopulos

专题命中 安全评测 :trustworthy(title)

AI总结 X-Sched通过整合反事实解释与机器学习模型,提供可操作的资源配置指导,提升容器化环境中的任务执行效率和透明度。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06832 2026-01-28 cs.AI 70%

Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges

遥感图像智能解读的以语言为中心的视角:原理、方法与挑战

Haifeng Li, Wang Guo, Haiyang Wu, Mengwei Wu, Jipeng Zhang, Qing Zhu, Yu Liu, Xin Huang, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Faculty of Geosciences and Environmental Engineering, Southwest Jiaotong University(西南交通大学地质科学与环境工程学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) Institute of Remote Sensing Information Processing (IRSIP), Wuhan University(武汉大学遥感信息处理研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出以语言为中心的遥感图像解读框架,探讨LLMs作为认知核心的作用,并总结多模态表示、知识关联等核心挑战,为认知驱动的智能地理空间分析提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19337 2026-01-28 cs.AI cs.LG cs.SE 62%

SETA: Statistical Fault Attribution for Compound AI Systems

SETA:复合人工智能系统的统计故障归因

Sayak Chowdhury, Meenakshi D'Souza

机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 SETA提出了一种模块化鲁棒性测试框架,用于分析复合人工智能系统的故障归因,通过组件级分析和错误传播推理,实现细粒度的鲁棒性评估。

Comments Accepted to CAIN 2026 co-hosted with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19818 2026-01-28 cs.LG cs.NA math.NA 57%

Learn and Verify: A Framework for Rigorous Verification of Physics-Informed Neural Networks

学习与验证:用于物理信息神经网络严格验证的框架

Kazuaki Tanaka, Kohei Yatabe

机构 * Global Center for Science and Engineering(全球科学与工程中心) Waseda University(早稻田大学) Faculty of Engineering(工学院) Tokyo University of Agriculture and Technology(东京农业大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 该研究提出“学习与验证”框架,通过结合DSM损失和区间算术,为微分方程的解提供可计算的严格误差界,提升科学机器学习的可信度。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19325 2026-01-28 cs.CV cs.AI 57%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19197 2026-01-28 cs.IR cs.AI 57%

HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems

HELM:一种面向LLM推荐系统的以人为本的评估框架

Sushant Mehta

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 HELM框架通过五个以人为本的维度评估LLM推荐系统,揭示传统指标无法捕捉的关键质量维度,并展示GPT-4在解释质量与交互自然性上的优势及流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19106 2026-01-28 cs.SE cs.AI 57%

Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis

通过确定性AST分析检测和纠正LLM生成的代码中的幻觉

Dipin Khati, Daniel Rodriguez-Cardenas, Paul Pantzer, Denys Poshyvanyk

机构 * William & Mary(威廉玛丽大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过确定性AST分析检测并纠正LLM生成代码中的知识冲突幻觉,实现高精度和召回率的自动修复。

Comments Accepted to FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18998 2026-01-28 cs.CL 57%

Malicious Repurposing of Open Science Artefacts by Using Large Language Models

利用大语言模型恶意重用开放科学制品

Zahra Hashemi, Zhiqiang Zhong, Jun Pang, Wei Zhao

机构 * University of Luxemburg(卢森堡大学) University of Aberdeen(阿伯丁大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文研究了利用大语言模型恶意重用开放科学制品生成有害研究的可能性,通过端到端流程揭示LLMs在恶意评估中的局限性,强调人类评估在双用途风险评估中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10246 2026-01-28 cs.CL 57%

coTherapist: A Behavior-Aligned Small Language Model to Support Mental Healthcare Experts

coTherapist:一种行为对齐的小语言模型,用于支持心理健康专家

Prottay Kumar Adhikary, Reena Rawat, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 coTherapist通过小语言模型和领域微调等技术,为心理健康专家提供支持,展现出高同理心和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11254 2026-01-28 cs.CL 57%

Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality

心理测试在大语言模型中是否有效?对性别歧视、种族主义和道德的测试评估

Jana Jung, Marlene Lutz, Indira Sen, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究评估了心理测试在大语言模型上的有效性,发现其在性别歧视、种族主义和道德方面的测试分数与模型行为不一致,表明需进一步调整以适应LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12344 2026-01-28 cs.CL 57%

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

宣传AI:大型语言模型中语义分歧的分析

Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出RAVEN方法,用于检测大型语言模型中因概念提示引发的语义分歧,通过结合语义熵与跨模型分歧,揭示模型在特定主题上的异常响应,以提高对宣传影响的防范能力。

Comments Accepted at ICLR 2026, 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18900 2026-01-28 cs.CV cs.LG stat.ML 57%

RealStats: A Rigorous Real-Only Statistical Framework for Fake Image Detection

RealStats: 一种用于伪造图像检测的严谨实数统计框架

Haim Zisman, Uri Shaham

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 RealStats提出了一种基于统计学的无训练框架,通过整合多种检测器的无训练统计量,生成可解释的实图像概率评分,以提高伪造图像检测的鲁棒性。

Comments 22 pages, 14 figures. Accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19898 2026-01-28 cs.CV 50%

DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding

DuwatBench: 通过阿拉伯书法基准桥接语言与视觉遗产以实现多模态理解

Shubham Patle, Sara Ghaboura, Hania Tariq, Mohammad Usman Khan, Omkar Thawakar, Rao Muhammad Anwer, Salman Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) NUCES(努赛斯大学) NUST(努斯特大学) Australian National University(澳大利亚国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 DuwatBench通过阿拉伯书法基准推动多模态研究,揭示多模态模型在处理书法变体和艺术扭曲时的局限性。

Comments Accepted to EACL-2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV 50%

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

专题命中 安全评测 :alignment(abstract)

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19345 2026-01-28 cs.CR 50%

AI-driven Intrusion Detection for UAV in Smart Urban Ecosystems: A Comprehensive Survey

基于人工智能的无人机智能城市生态系统入侵检测:综述

Abdullah Khanfor, Raby Hamadi, Noureddine Lasla, Hakim Ghazzai

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了无人机在智能城市中的应用及安全挑战,探讨了人工智能技术在入侵检测中的作用,并提出了十个关键研究方向。

Comments 68 pages, 13 figures, 6 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19287 2026-01-28 cs.SE 50%

Understanding Dominant Themes in Reviewing Agentic AI-authored Code

理解代理AI生成代码的主导主题

Md. Asif Haider, Thomas Zimmermann

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了代理AI生成代码的评审主题,通过大规模实证分析发现,评审主要关注文档、重构和格式问题,而非功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏