arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-12 至 2026-02-12 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2511.11847 2026-02-12 cs.IR cs.AI cs.CY 81%

A Multimodal Manufacturing Safety Chatbot: Knowledge Base Design, Benchmark Development, and Evaluation of Multiple RAG Approaches

多模态制造安全聊天机器人:知识库设计、基准开发及多种RAG方法的评估

Ryan Singh, Austin Hamilton, Amanda White, Michael Wise, Ibrahim Yousif, Arthur Carvalho, Zhe Shan, Reza Abrisham Baf, Mohammad Mayyas, Lora A. Cavuoto, Fadel M. Megahed

机构 * Farmer School of Business, Miami University(Miami大学农业商学院) Department of Computer Science and Software Engineering, Miami University(Miami大学计算机科学与软件工程系) Department of Engineering Technology, Miami University(Miami大学工程技术系) Department of Mechanical and Manufacturing Engineering, Miami University(Miami大学机械与制造工程系) Department of Industrial and Systems Engineering, University at Buffalo(University at Buffalo工业与系统工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种多模态制造安全聊天机器人,通过RAG方法实现高准确率、低延迟和低成本的安全培训,展示了其在工业5.0环境中的应用价值。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00653 2026-02-12 cs.CV cs.AI 79%

Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment

非对比视觉语言学习与预测嵌入对齐

Lukas Kuhn, Giuseppe Serra, Florian Buettner

机构 * Goethe University Frankfurt(法兰克福歌德大学) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联合会(DKTK))

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 NOVA通过联合嵌入预测与分布正则化,实现非对比视觉语言学习,简化训练目标并提升稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-02-12 cs.CV cs.AI 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11717 2026-02-12 cs.RO cs.SY eess.SY 78%

Safety with Agency: Human-Centered Safety Filter with Application to AI-Assisted Motorsports

安全与代理:以人为中心的安全过滤器及其在AI辅助赛车中的应用

Donggeon David Oh, Justin Lidard, Haimin Hu, Himani Sinhmar, Elle Lazarski, Deepak Gopinath, Emily S. Sumner, Jonathan A. DeCastro, Guy Rosman, Naomi Ehrich Leonard, Jaime Fernández Fisac

机构 * Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Department of Mechanical and Aerospace Engineering, Princeton University(普林斯顿大学机械与航空航天工程系) Toyota Research Institute(丰田研究院)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种以人为中心的安全过滤器,通过神经安全价值函数和状态-动作控制障碍函数,提升AI辅助赛车中的安全性和用户体验。

Comments Accepted to Robotics: Science and Systems (R:SS) 2025, 22 pages, 16 figures, 7 tables Updates for v4: typos in Appendix Subsection A revised

Journal ref Proceedings of Robotics: Science and Systems (RSS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15676 2026-02-12 cs.MA cs.CR 71%

Trustworthy Decentralized Autonomous Machines: A New Paradigm in Automation Economy

可信去中心化自主机器:自动化经济的新范式

Fernando Castillo, Oscar Castillo, Eduardo Brito, Simon Espinola

专题命中 安全评测 :trustworthy(title)

AI总结 本文提出去中心化自主机器(DAMs)作为自动化经济的新范式,通过整合AI、区块链和物联网技术,实现无信任的资产管理和经济机会民主化。

Comments To be published in IEEE International Workshop on Decentralized Physical Infrastructure Networks 2025, in conjunction with ICBC'25. 7 pages. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00389 2026-02-12 cs.AI 70%

CyberBOT: Towards Reliable Cybersecurity Education via Ontology-Grounded Retrieval Augmented Generation

CyberBOT: 通过基于本体的检索增强生成实现可靠的网络安全教育

Chengshuai Zhao, Riccardo De Maria, Tharindu Kumarage, Kumar Satvik Chaudhary, Garima Agrawal, Yiwen Li, Jongchan Park, Yuli Deng, Ying-Chih Chen, Huan Liu

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 CyberBOT通过基于本体的检索增强生成技术,提供可靠的网络安全教育解决方案,提升教学效果和学生参与度。

Comments Accepted by The Conference on Information and Knowledge Management (CIKM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03083 2026-02-12 cs.DS cs.AI cs.CL 62%

Algorithmically Establishing Trust in Evaluators

算法上建立评估者的信任

Adrian de Wynter

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出无数据算法,通过连续挑战建立评估者信任,无需标注数据,适用于低资源语言标注场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18970 2026-02-12 cs.AI cs.LG 62%

Bridging Explainability and Embeddings: BEE Aware of Spuriousness

弥合可解释性与嵌入:BEE 意识到虚假相关性

Cristian Daniel Păduraru, Antonio Bărbălau, Radu Filipescu, Andrei Liviu Nicolicioiu, Elena Burceanu

机构 * Bitdefender University of Bucharest(布加勒斯特大学) Mila University of Montreal(蒙特利尔大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 BEE通过分析权重空间和嵌入几何揭示隐藏的虚假相关性,适用于多种数据集和模型,提升基础模型的可信度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11091 2026-02-12 cs.CL 57%

Can Large Language Models Make Everyone Happy?

大语言模型能否让所有人快乐?

Usman Naseem, Gautam Siddharth Kashyap, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Rafiq Ali

机构 * Macquarie University(麦考瑞大学) DSEU-Okhla University of Delhi(德里大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出MisAlign-Profile基准,通过构建MISALIGNTRADE数据集,评估大语言模型在安全、价值和文化维度间的不匹配权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10620 2026-02-12 cs.SE cs.CL 57%

ISD-Agent-Bench: A Comprehensive Benchmark for Evaluating LLM-based Instructional Design Agents

ISD-Agent-Bench: 一个用于评估基于大语言模型的教学系统设计代理的全面基准

YoungHoon Jeon, Suwan Kim, Haein Son, Sookbun Lee, Yeil Jeong, Unggi Lee

机构 * Upstage Opentutorials Indiana University Bloomington(印第安纳大学布卢明顿分校) Korea University Sejong Campus(韩国大学世宗校区)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 ISD-Agent-Bench通过结合经典ISD理论与现代推理方法,为评估基于LLM的教学系统设计代理提供了全面的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10367 2026-02-12 cs.AI 57%

LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation

LiveMedBench: 一个无污染的医疗基准测试,用于具有自动评分评估的LLM

Zhiling Yan, Dingjie Song, Zhe Fang, Yisheng Ji, Xiang Li, Quanzheng Li, Lichao Sun

机构 * Lehigh University(莱维大学) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 LiveMedBench通过持续更新和自动评分框架,提供无污染的医疗基准测试,验证LLM在临床推理中的性能,揭示数据污染和上下文适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15044 2026-02-12 cs.LG quant-ph 57%

IQNN-CS: Interpretable Quantum Neural Network for Credit Scoring

IQNN-CS:用于信用评分的可解释量子神经网络

Abdul Samad Khan, Nouhaila Innan, Aeysha Khalique, Muhammad Shafique

机构 * Lahore University of Management Sciences, Pakistan(拉合尔管理科学大学,巴基斯坦) eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究机构)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 IQNN-CS是一种用于信用评分的可解释量子神经网络,通过引入ICAA度量标准提升模型的可解释性和透明度,适用于金融决策中的高风险任务。

Comments Accepted for oral presentation at QUEST-IS'25. To appear in Springer proceedings

Journal ref International Conference on Quantum Engineering Sciences and Technologies for Industry and Services 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11118 2026-02-12 stat.ME stat.ML 50%

A Doubly Robust Machine Learning Approach for Disentangling Treatment Effect Heterogeneity with Functional Outcomes

一种用于解构功能性结果中治疗效应异质性的双重鲁棒机器学习方法

Filippo Salmaso, Lorenzo Testa, Francesca Chiaromonte

专题命中 安全评测 :trustworthy(abstract)

AI总结 FOCaL是一种针对功能性结果中治疗效应异质性估计的双重鲁棒机器学习方法,通过整合先进功能回归技术,实现了对复杂数据中个性化因果效应的稳健推断。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19899 2026-02-12 cs.CV 50%

VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering

VeriSciQA:一个用于科学视觉问答的自动验证数据集

Yuyi Li, Daoyuan Chen, Zhen Wang, Yutong Lu, Yaliang Li

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract)

AI总结 VeriSciQA通过跨模态验证框架生成并验证高质量科学视觉问答数据集,显著提升开源模型在科学图表问答任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏