arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2603.04423 2026-03-06 cs.CL cs.AI 62%

Generating Realistic, Protocol-Compliant Maritime Radio Dialogues using Self-Instruct and Low-Rank Adaptation

利用自指导和低秩适应生成符合协议的海上无线电对话

Gürsel Akdeniz, Emin Cagatay Nakilcioglu

机构 * Fraunhofer Center for Maritime Logistics and Services(弗劳恩霍夫海洋物流与服务研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种自指导和低秩适应方法,生成符合IMO SMCP协议的海上无线电对话,通过整合验证流程和高效微调技术,提升对话生成的准确性和合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04407 2026-03-06 cs.CL cs.AI 62%

Semantic Containment as a Fundamental Property of Emergent Misalignment

语义包容作为涌现偏差的根本属性

Rohan Saxena

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现语义触发器可自发诱导模型限制,无需混合无害和有害训练数据,揭示有害微调的潜在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04405 2026-03-06 cs.CV cs.AI cs.LG 62%

Lost in Translation: How Language Re-Aligns Vision for Cross-Species Pathology

迷失在翻译中:语言如何重新对齐视觉以实现跨物种病理学

Ekansh Arora

机构 * Thomas Jefferson High School for Science and Technology(泰勒斯·杰弗里斯高中科学与技术学校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入语义锚定机制,利用语言对齐解决跨物种病理学中的视觉-语言对齐问题,提升模型在跨物种任务中的性能。

Comments 27 pages, 6 figures, 7 tables. Code and data available at https://github.com/ekansh-arora0/cross-species-pathology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03911 2026-03-05 cs.AI cs.CL cs.CR 62%

From Threat Intelligence to Firewall Rules: Semantic Relations in Hybrid AI Agent and Expert System Architectures

从威胁情报到防火墙规则:混合AI代理和专家系统架构中的语义关系

Chiara Bonfanti, Davide Colaiacomo, Luca Cagliero, Cataldo Basile

机构 * Department of Control and Computer Engineering(控制与计算机工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用语义关系从威胁情报中提取信息,通过神经符号方法生成防火墙规则以缓解网络威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24178 2026-03-05 cs.CL cs.AI 62%

MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations

MuSaG:一个包含完整模态标注的多模态德语讽刺数据集

Aaron Scott, Maike Züfle, Jan Niehues

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 MuSaG是一个包含多模态标注的德语讽刺数据集,通过对比人类标注与多种模型性能,揭示了多模态模型在现实场景中的改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25106 2026-03-05 cs.CL cs.AI cs.IR 62%

Towards Personalized Deep Research: Benchmarks and Evaluations

迈向个性化深度研究:基准与评估

Yuan Liang, Jiaxian Li, Yuqing Wang, Piaohong Wang, Motong Tian, Pai Liu, Shuofei Qiao, Runnan Fang, He Zhu, Ge Zhang, Minghao Liu, Yuchen Eleanor Jiang, Ningyu Zhang, Wangchunshu Zhou

机构 * OPPO Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PDR-Bench,首个用于评估深度研究代理个性化能力的基准,通过结合多样化任务与真实用户档案,评估个性化对齐、内容质量和事实可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16985 2026-03-05 cs.CV cs.AI cs.LG cs.RO 62%

Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation

极简多模态异常合成用于分布外检测与分割

Moru Liu, Hao Dong, Jessica Kelly, Olga Fink, Mario Trapp

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) Fraunhofer IKS(弗劳恩霍夫研究所) EPFL(苏黎世联邦理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出极简多模态异常合成方法Feature Mixing,通过理论支持提升OOD检测性能,实验表明其在多个数据集上达到最优效果,速度提升显著。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03330 2026-03-05 cs.CL cs.AI 62%

Certainty robustness: Evaluating LLM stability under self-challenging prompts

确定性鲁棒性:在自我挑战提示下评估LLM的稳定性

Mohammadreza Saadat, Steve Nemzer

机构 * TELUS Digital(TELUS数字公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出确定性鲁棒性基准,评估LLM在自我挑战提示下的稳定性与适应性平衡,揭示模型在交互压力下的可靠性差异。

Comments 20 pages, 7 tables Benchmark and evaluation study of large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03047 2026-03-04 cs.CL cs.AI 62%

TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health

TrustMH-Bench: 一个用于评估大语言模型在心理健康领域可信度的综合基准

Zixin Xiong, Ziteng Wang, Haotian Fan, Xinjie Zhang, Wenxuan Wang

机构 * Renmin University of China, China(中国人民大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) Hefei University of Technology, China(合肥工业大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 TrustMH-Bench提出了一种综合基准,用于评估大语言模型在心理健康领域的可信度,揭示了现有模型在关键维度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02219 2026-03-04 cs.LG cs.AI 62%

NExT-Guard: Training-Free Streaming Safeguard without Token-Level Labels

NExT-Guard: 不依赖令牌级标签的无训练流式安全防护

Junfeng Fang, Nachuan Chen, Houcheng Jiang, Dan Zhang, Fei Shen, Xiang Wang, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 NExT-Guard通过监控稀疏自编码器的潜在特征,实现无训练的流式安全防护,优于基于监督训练的防护方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01343 2026-03-03 cs.CL cs.AI 62%

PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology

PanCanBench: 用于评估大型语言模型在胰腺肿瘤学中的综合基准

Yimin Zhao, Sheela R. Damle, Simone E. Dekker, Scott Geng, Karly Williams Silva, Jesse J Hubbard, Manuel F Fernandez, Fatima Zelada-Arenas, Alejandra Alvarez, Brianne Flores, Alexis Rodriguez, Stephen Salerno, Carrie Wright, Zihao Wang, Pang Wei Koh, Jeffrey T. Leek

机构 * Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) Clinical Research Division, Fred Hutch Cancer Center(Fred Hutch癌症中心临床研究部) Division of Hematology and Oncology, Department of Medicine, University of Washington(华盛顿大学医学系血液学与肿瘤学分会) Allen Institute for AI(Allen人工智能研究所) Department of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程系) Public Health Sciences, Biostatistics, Fred Hutchinson Cancer Center(Fred Hutchinson癌症中心公共卫生科学与生物统计学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 PanCanBench通过评估22种LLM在胰腺肿瘤学问题上的表现,揭示了模型在事实准确性、临床完整性和网络搜索整合方面的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18182 2026-03-03 cs.LG cs.AI 62%

Capabilities Ain't All You Need: Measuring Propensities in AI

能力并非全部所需:测量AI倾向性

Daniel Romero-Alvarado, Fernando Martínez-Plumed, Lorenzo Pacchiardi, Hugo Save, Siddhesh Milind Pawar, Behzad Mehrbakhsh, Pablo Antonio Moreno Casares, Ben Slater, Paolo Bova, Peter Romero, Zachary R. Tidler, Jonathan Prunty, Luning Sun, Jose Hernandez-Orallo

机构 * Valencian Research Institute of Artificial Intelligence, Universitat Politècnica de València, Valencia, Spain University of Copenhagen, Denmark work done while at University of Cambridge Existential Risk Observatory, Amsterdam, Netherlands Leverhulme Centre for the Future of Intelligence, University of Cambridge The Psychometrics Centre, University of Cambridge Department of Computing \& Games, University of Teesside Georgia Institute of Technology University of Cambridge

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个测量AI倾向性的正式框架,通过双逻辑模型评估模型倾向性对任务性能的影响,并展示结合倾向性和能力可提升预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20487 2026-03-03 cs.CL cs.AI 62%

Steering Evaluation-Aware Language Models to Act Like They Are Deployed

引导评估意识语言模型以使其表现得像已部署

Tim Tian Hua, Andrew Qin, Samuel Marks, Neel Nanda

机构 * MATS

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过引导向量抑制LLM的评估意识,使其在评估时表现得像已部署,从而提高安全评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22837 2026-03-03 cs.LG cs.AI 62%

xLSTMAD: A Powerful xLSTM-based Method for Anomaly Detection

xLSTMAD: 一种基于xLSTM的强大异常检测方法

Kamil Faber, Marcin Pietroń, Dominik Żurek, Roberto Corizzo

机构 * AGH University of Krakow, Poland(克拉科夫AGH大学) American University, Washington DC, USA(美国美国大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出xLSTMAD,一种基于xLSTM的异常检测方法,通过编码器-解码器架构在多变量时间序列中实现高精度异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11999 2026-03-03 cs.CV cs.AI cs.IR cs.LG 62%

MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding

MOON: 基于生成式多模态大语言模型的电商产品理解多模态表示学习

Daoze Zhang, Chenghan Fu, Zhanheng Nie, Jianyu Liu, Wanxian Guan, Yuan Gao, Jun Song, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MOON通过生成式多模态大语言模型改进电商产品理解的多模态表示学习,引入引导的MoE模块、核心语义区域检测和负采样策略,提升零样本性能和泛化能力。

Comments Accepted by WSDM 2026 (oral). 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00044 2026-03-03 cs.LG cs.AI cs.SE 62%

Property-Driven Evaluation of GNN Expressiveness at Scale: Datasets, Framework, and Study

基于属性的大规模GNN表达性评估:数据集、框架与研究

Sicong Che, Jiayi Yang, Sarfraz Khurshid, Wenxi Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于属性的GNN表达性评估方法,通过生成大规模数据集和评估框架,研究了不同池化方法对GNN表达性的影响,揭示了不同方法在通用性、敏感性和鲁棒性上的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07319 2026-03-02 cs.CL cs.AI 62%

Beyond Accuracy: Risk-Sensitive Evaluation of Hallucinated Medical Advice

超越准确性:对幻觉医疗建议的风险敏感评估

Savan Doshi

机构 * ASU(亚利桑那州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种风险敏感的评估框架,用于评估医疗建议中的幻觉风险,通过量化风险性语言来识别高风险、低支撑的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21283 2026-03-02 cs.LG cs.AI 62%

DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher

DUET:基于高效上下文化教师的蒸馏式大语言模型去学习

Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu

机构 * George Mason University(乔治·玛森大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 DUET通过结合上下文化和蒸馏方法,实现高效大语言模型去学习,提升遗忘控制与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22828 2026-02-27 cs.CL cs.AI 62%

TCM-DiffRAG: Personalized Syndrome Differentiation Reasoning Method for Traditional Chinese Medicine based on Knowledge Graph and Chain of Thought

基于知识图谱和推理链的TCM-DiffRAG:一种用于传统中医个性化辨证的推理方法

Jianmin Li, Ying Chang, Su-Kit Tang, Yujia Liu, Yanwen Wang, Shuyuan Lin, Binkai Ou

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 TCM-DiffRAG结合知识图谱与推理链,提升中医个性化诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19922 2026-02-26 cs.CL cs.AI 62%

HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue

HEART:一个评估人类和大语言模型在情感支持对话中能力的统一基准

Laya Iyer, Kriti Aggarwal, Sanmi Koyejo, Gail Heyman, Desmond C. Ong, Subhabrata Mukherjee

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 HEART通过多轮情感支持对话评估人类与大语言模型的能力差异,揭示两者在共情、一致性等维度上的表现及趋同趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 62%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20170 2026-02-25 cs.CY cs.AI 62%

CAGE: A Framework for Culturally Adaptive Red-Teaming Benchmark Generation

CAGE:一种用于文化适应性红队基准生成的框架

Chaeyun Kim, YongTaek Lim, Kihyun Kim, Junghwan Kim, Minwoo Kim

机构 * Seoul National University(首尔国立大学) AI Safety Team, DATUMO INC(DATUMO公司人工智能安全团队)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 CAGE框架通过文化适应性生成方法,系统地调整红队提示以适应不同文化背景,从而生成更有效的安全评估基准。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20162 2026-02-25 cs.CL cs.AI 62%

Talking to Yourself: Defying Forgetting in Large Language Models

与自己对话:在大型语言模型中克服遗忘

Yutao Sun, Mingshuai Chen, Tiancheng Zhao, Phillip Miao, Zilun Zhang, Haozhan Shen, Ruizhe Zhu, Jianwei Yin

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Om AI Research(奥姆人工智能研究) Stanford University(斯坦福大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SA-SFT方法,通过让LLM生成自我对话来缓解微调过程中的灾难性遗忘,提升领域性能并优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02094 2026-02-24 cs.LG cs.CY stat.AP 62%

Crash Severity Risk Modeling Strategies under Data Imbalance

在数据不平衡情况下工作区碰撞严重性风险建模策略

Abdullah Al Mamun, Abyad Enan, Debbie A. Indah, Judith Mwakalonge, Gurcan Comert, Mashrur Chowdhury

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

AI总结 本研究探讨了在数据不平衡情况下,利用DMI特征选择和不同模型提升HS碰撞预测性能的方法。

Comments This second revised version has been resubmitted to the Transportation Research Record: Journal of the Transportation Research Board after addressing the reviewers' comments and is currently awaiting the final decision

Journal ref Transportation Research Record (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19584 2026-02-24 cs.LG cs.AI 62%

Interpolation-Driven Machine Learning Approaches for Plume Shine Dose Estimation: A Comparison of XGBoost, Random Forest, and TabNet

基于插值驱动的机器学习方法用于烟云闪烁剂量估计:XGBoost、随机森林和TabNet的比较

Biswajit Sadhu, Kalpak Gupte, Trijit Sadhu, S. Anand

机构 * Health Physics Division, Health Safety \& Environment Group, Bhabha Atomic Research Center, Mumbai – 400085, India Birla Institute of Technology And Science, Pilani, Rajasthan – 333031, India Environment Group, Bhabha Atomic Research Center, Mumbai – 400085, India

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于插值驱动的机器学习方法,比较了XGBoost、随机森林和TabNet在烟云闪烁剂量估计中的性能,发现XGBoost在预测准确性上表现最佳。

Comments 28 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14488 2026-02-24 cs.CL cs.AI 62%

BETA-Labeling for Multilingual Dataset Construction in Low-Resource IR

BETA-标注用于低资源信息检索中多语言数据集构建

Md. Najib Hasan, Mst. Jannatun Ferdous Rain, Fyad Mohammed, Nazmul Siddique

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BETA-标注框架构建低资源语言信息检索数据集,探讨跨语言数据集重用的可行性和风险,揭示语言依赖性偏差对数据集可靠性的影响。

Comments This work was submitted without the consent of my current adviser. Additionally, it overlaps with my unpublished research work. In order to avoid potential academic and authorship conflicts, I am requesting withdrawal of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18891 2026-02-24 cs.CY cs.AI cs.HC 62%

Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation

协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究

Yuan An

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18462 2026-02-24 cs.CY cs.AI 62%

Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents

评估基于人设的大型语言模型作为合成调查受访者可靠性

Erika Elizabeth Taday Morocho, Lorenzo Cima, Tiziano Fagni, Marco Avvenuti, Stefano Cresci

机构 * IIT-CNR, University of Pisa(IIT-CNR与比萨大学) University of Florence(佛罗伦萨大学) University of Pisa(比萨大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文评估了基于人设的LLM作为合成调查受访者可靠性,发现多属性提示可能引入偏差,影响子群体的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18460 2026-02-24 cs.CY cs.AI cs.HC 62%

The Doctor Will (Still) See You Now: On the Structural Limits of Agentic AI in Healthcare

医生还会见你:论代理AI在医疗领域的结构性限制

Gabriela Aránguiz Dias, Kiana Jafari, Allie Griffith, Carolina Aránguiz Dias, Grace Ra Kim, Lana Saadeddin, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学) University of Florida(佛罗里达大学) Montclair State University(蒙特克莱尔州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了代理AI在医疗领域应用中的结构性限制,指出技术期望、商业激励和临床约束的交汇对患者安全和责任归属产生实质性影响。

Comments 17 pages, 3 pages of appendix, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18456 2026-02-24 cs.CY cs.AI cs.HC 62%

Beyond single-channel agentic benchmarking

超越单一通道代理基准测试

Nelu D. Radpour

机构 * Florida State University(佛罗里达州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过人类-人工智能双元组的可靠性评估代理安全性,强调不相关错误模式对风险降低的重要性,以改进AI安全性评估方法。

Comments 8 pages; 1 figure; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏