arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-26 至 2026-01-26 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 15 篇

2601.16506 2026-01-26 cs.CR cs.AI 89%

SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment

SafeThinker: 通过风险推理深化安全对齐

Xianya Fang, Xianying Luo, Yadong Wang, Xiang Chen, Yu Tian, Zequn Sun, Rui Liu, Jun Fang, Naiqiang Tan, Yuanning Cui, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Didi International Business Group(滴滴国际商务集团) Institute for AI, Tsinghua University(清华大学人工智能研究院) Nanjing University of Information Science & Technology(南京信息科学技术大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 SafeThinker通过动态分配防御资源,有效提升模型对伪装攻击的防御能力,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21548 2026-01-26 cs.CL cs.AI cs.CY physics.soc-ph 82%

Fluent but Foreign: Even Regional LLMs Lack Cultural Alignment

流畅但异域:即使区域LLM也缺乏文化契合

Dhruv Agarwal, Anya Shukla, Sunayana Sitaram, Aditya Vashistha

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现,即使区域LLM也缺乏文化契合,需通过社区基础的数据和厚宽评估来构建真正主权的LLM。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18710 2026-01-26 q-bio.NC cs.AI 79%

Bridging Critical Gaps in Convergent Learning: How Representational Alignment Evolves Across Layers, Training, and Distribution Shifts

弥合收敛学习中的关键差距:表征对齐如何在层、训练和分布偏移中演变

Chaitanya Kapoor, Sudhanshu Srivastava, Meenakshi Khosla

机构 * Department of Cognitive Science University of California, San Diego(认知科学系加州大学圣地亚哥分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过大规模分析发现,正交变换在对齐表征上效果接近线性方法,且早期层在分布偏移下仍保持紧密对齐,揭示了表征对齐主要由输入统计和架构偏差驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10250 2026-01-26 cs.CV 78%

GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection

GAMMA: 通过多任务和操控增强训练实现通用对齐的AI生成图像检测

Haozhen Yan, Yan Hong, Suning Lang, Jiahui Zhan, Yikun Ji, Yujie Gao, Huijia Zhu, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 安全评测 :alignment(title,abstract)

AI总结 GAMMA通过多任务和操控增强训练,提升AI生成图像检测的泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23845 2026-01-26 cs.CL cs.AI 76%

CRADLE Bench: A Clinician-Annotated Benchmark for Multi-Faceted Mental Health Crisis and Safety Risk Detection

CRADLE Bench: 一种多维心理健康危机和安全风险检测的临床标注基准

Grace Byun, Rebecca Lipschutz, Sean T. Minton, Abigail Lott, Jinho D. Choi

机构 * Emory University, Department of Computer Science(埃默里大学计算机科学系) Emory University, Department of Psychiatry and Behavioral Sciences(埃默里大学精神病学与行为科学系)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI

AI总结 CRADLE Bench通过多维危机检测基准,结合临床标准和时间标签,提升语言模型对心理健康危机和安全风险的识别能力。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12409 2026-01-26 cs.LG cs.AI cs.NE 73%

Interpretable Fine-Gray Deep Survival Model for Competing Risks: Predicting Post-Discharge Foot Complications for Diabetic Patients in Ontario

可解释的细灰深度生存模型用于竞争风险:预测安大略省糖尿病患者出院后足部并发症

Dhanesh Ramachandram, Anne Loefler, Surain Roberts, Amol Verma, Maia Norman, Fahad Razak, Conrad Pow, Charles de Mestral

机构 * Vector Institute(向量研究所) GEMINI University of Toronto(多伦多大学) Diabetes Action Canada(加拿大糖尿病行动)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种可解释的细灰深度生存模型,用于预测糖尿病患者出院后足部并发症,通过透明的预测方法提高医疗AI的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16685 2026-01-26 cs.AI 70%

AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning

AgentsEval: 通过多智能体推理实现医学影像报告的临床可信评估

Suzhong Fu, Jingqi Dong, Xuan Ding, Rui Sun, Yiming Yang, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, The Chinese University of Hong Kong (Shenzhen) School of Science and Engineering(深圳FNii、香港中文大学(深圳)科学与工程学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 AgentsEval通过多智能体推理框架,实现医学影像报告的临床可信评估,提供结构化反馈和稳健的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16699 2026-01-26 cs.SE 67%

Supporting Stakeholder Requirements Expression with LLM Revisions: An Empirical Evaluation

通过LLM修订支持利益相关者需求表达:一项实证评估

Michael Mircea, Emre Gevrek, Elisa Schmid, Kurt Schneider

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文通过实证研究展示LLM在辅助利益相关者表达需求方面的有效性,证明其能提升需求表达的完整性、清晰度和一致性。

Comments This paper has been accepted at the research track of the 32nd International Working Conference on Requirements Engineering: Foundation for Software Quality (REFSQ 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16964 2026-01-26 cs.AI 57%

AgentDrive: An Open Benchmark Dataset for Agentic AI Reasoning with LLM-Generated Scenarios in Autonomous Systems

AgentDrive: 一个用于自主系统中基于LLM生成场景的代理AI推理开放基准数据集

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 AgentDrive是一个用于自主系统中基于LLM生成场景的代理AI推理开放基准数据集,包含300,000个驾驶场景和100,000个问题的多项选择基准,用于评估和训练自主代理。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16930 2026-01-26 cs.CY 57%

In Quest of an Extensible Multi-Level Harm Taxonomy for Adversarial AI: Heart of Security, Ethical Risk Scoring and Resilience Analytics

寻求可扩展的多级危害分类法以应对对抗性AI:安全的核心、道德风险评分与韧性分析

Javed I. Khan, Sharmila Rahman Prithula

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文提出了一种可扩展的多级危害分类法,结合伦理理论,系统化地定义危害类型,以提升对抗性AI的安全性和伦理分析能力。

Comments Manuscript accepted for presentation at the 12th International Conference on Computational Science and Computational Intelligence (CSCI 2025), Las Vegas, NV, USA, December 2025. Proceedings to be published by Springer Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09849 2026-01-26 cs.LG cs.HC 57%

A Survey on Human-Centered Evaluation of Explainable AI Methods in Clinical Decision Support Systems

可解释人工智能在临床决策支持系统中的人本评估综述

Alessandro Gambetti, Qiwei Han, Hong Shen, Claudia Soares

机构 * Nova School of Science and Technology, Universidade NOVA de Lisboa(诺瓦科学与技术学院,诺瓦里斯本大学) Nova School of Business and Economics, Universidade NOVA de Lisboa(诺瓦商学院与经济学院,诺瓦里斯本大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文综述了XAI在临床决策支持系统中的人本评估,指出多数研究采用事后方法,提出以利益相关者为中心的评估框架以提升XAI的临床可信度。

Comments 19 pages, 2 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16456 2026-01-26 cs.SE 50%

RubberDuckBench: A Benchmark for AI Coding Assistants

RubberDuckBench:AI代码助手的基准测试

Ferida Mohammad, Fatma Ayad, Petros Maniatis, Satish Chandra, Elizabeth Dinella

专题命中 安全评测 :trustworthy(abstract)

AI总结 RubberDuckBench通过评估20种LLM在代码问题上的表现,揭示了AI代码助手在一致性、准确性及谎言生成方面的不足,为未来研究提供基准。

Comments LLM4Code @ ICSE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05806 2026-01-26 cs.RO 50%

Modular Autonomy with Conversational Interaction: An LLM-driven Framework for Decision Making in Autonomous Driving

模块化自主性与对话交互:一种基于大语言模型的决策框架用于自动驾驶

Marvin Seegert, Korbinian Moller, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,技术大学慕尼黑工程与设计学院,技术大学慕尼黑)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于大语言模型的自动驾驶决策框架,通过交互层与Autoware集成,实现乘客高级命令的翻译与执行,提升模块化自动驾驶系统的安全性和扩展性。

Comments Submitted to the IEEE Intelligent Vehicles Symposium (IV 2026), Detroit, MI, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18306 2026-01-26 cs.HC 50%

Leveraging Peer, Self, and Teacher Assessments for Generative AI-Enhanced Feedback

利用同伴、自我和教师评估促进生成式AI增强的反馈

Alvaro Becerra, Ruth Cobos

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出在AICoFe系统中整合教师、同伴和自我评估,利用GenAI模型提升反馈效率与教学有效性。

Comments This paper has been accepted as a Full Paper in the main conference of the 2026 IEEE Global Engineering Education Conference (EDUCON)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18695 2026-01-26 cs.CV 50%

A Novel Deep Hybrid Framework with Ensemble-Based Feature Optimization for Robust Real-Time Human Activity Recognition

一种基于集成特征优化的新型深度混合框架用于鲁棒的实时人类活动识别

Wasi Ullah, Yasir Noman Khalid, Saddam Hussain Khan

机构 * Department of Computer Science, HITEC University(计算机科学系,HITEC大学) Department of Information Systems, College of Computer and Information Sciences, Princess Nourah bint Abdulrahman University (PNU)(信息系,计算机与信息科学学院,普里塞斯努拉·本·阿卜杜勒拉赫曼大学) University of Wollongong(沃林戈大学) College of Engineering and Technology, American University of Middle East(工程与技术学院,中东美国大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种基于集成特征优化的新型深度混合框架,通过自适应动态适应度共享和注意力机制提升实时人类活动识别的准确性和鲁棒性。

Comments 35 pages, 25 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏