arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2602.06268 2026-02-09 cs.CL cs.LG 88%

MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs

MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准

Junhyeok Lee, Han Jang, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University(首尔国立大学) Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)

专题命中 安全评测 :safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.LG

AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06650 2026-02-09 cs.CL 88%

Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought

超越静态对齐:通过风险感知的思维链实现LLM安全的分层策略控制

Jianfeng Si, Lin Sun, Weihong Lin, Xiangzheng Zhang

机构 * Qiyuan Tech, Beijing, China(奇渊科技,北京,中国)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 PACT通过分层策略架构和风险感知推理,解决LLM安全与有用性之间的权衡问题,提升动态安全控制和可控性。

Comments 13 pages, 5 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06443 2026-02-09 cs.CR cs.AI 83%

TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents

TrajAD:用于可信大语言模型代理的轨迹异常检测

Yibing Liu, Chong Zhang, Zhongyi Han, Hansong Liu, Yong Wang, Yang Yu, Xiaoyan Wang, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Sonli Holding Group Co., Ltd.(山东利集团有限公司) Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司) Information Technology Service Center of People’s Court(人民法院信息技术服务中心)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 TrajAD通过细粒度过程监督训练的专用验证器,解决大语言模型代理轨迹异常检测问题,提升过程可靠性。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04836 2026-02-09 cs.AI 70%

Are AI Capabilities Increasing Exponentially? A Competing Hypothesis

人工智能能力是否呈指数增长?一个竞争性假设

Haosen Ge, Hamsa Bastani, Osbert Bastani

机构 * Wharton AI \& Analytics Initiative, The Wharton School, University of Pennsylvania, USA Department of Operations, Information Decisions, The Wharton School, University of Pennsylvania, USA Department of Computer Information Science, University of Pennsylvania, USA

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文通过分析数据和提出复杂模型,质疑人工智能能力的指数增长假设,指出拐点已过去并提出未来可能的转折点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06446 2026-02-09 cs.CL cs.AI cs.LG 67%

CORE: Comprehensive Ontological Relation Evaluation for Large Language Models

CORE:面向大语言模型的全面本体关系评估

Satyam Dwivedi, Sanjukta Ghosh, Shivam Dwivedi, Nishi Kumari, Anil Thakur, Anurag Purushottam, Deepak Alok, Praveen Gatla, Manjuprasad B, Bipasha Patgiri

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06256 2026-02-09 cs.LG cs.AI cs.CL 67%

Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions

在悬崖边转向还是偏离?重新思考推断时间干预中的特异性和鲁棒性

Navita Goyal, Hal Daumé

机构 * University of Maryland College Park(马里兰大学学院市)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出模型转向中特异性和鲁棒性的评估框架,揭示转向方法在提升效率的同时可能牺牲安全性。

Comments EACL 2026 Main, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06395 2026-02-09 cs.CR cs.AI cs.LG 62%

Empirical Analysis of Adversarial Robustness and Explainability Drift in Cybersecurity Classifiers

对抗鲁棒性与可解释性漂移的实证分析:在网络安全分类器中的应用

Mona Rajhans, Vishal Khawarey

机构 * Palo Alto Networks(帕洛阿尔托网络公司) Quicken Inc(Quicken公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证研究分析了网络安全分类器中对抗鲁棒性与可解释性漂移的问题,提出鲁棒性指数指标,并展示了对抗训练对提升鲁棒性的效果。

Comments Accepted for publication in 18th ACM International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05183 2026-02-09 cs.LG cs.AI 62%

Data-Centric Interpretability for LLM-based Multi-Agent Reinforcement Learning

面向大语言模型多智能体强化学习的数据导向可解释性

John Yan, Michael Yu, Yuqi Sun, Alexander Duffy, Tyler Marques, Matthew Lyle Olson

机构 * goodstartlabs(Good Start Labs)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Meta-Autointerp方法,利用SAEs和LLM总结器分析多智能体强化学习行为,发现细粒度行为及奖励黑客,验证SAE特征的有效性并提升智能体性能。

Comments authors 1, 2 and 3 contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04301 2026-02-09 cs.LG cs.CL 62%

Quantifying the Effect of Test Set Contamination on Generative Evaluations

量化测试集污染对生成评估的影响

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi, Ken Ziyu Liu, Brando Miranda, Ahmed Ahmed, Fazl Berez, Abhay Puri, Stella Biderman, Niloofar Mireshghallah, Sanmi Koyejo

机构 * University of Oxford(牛津大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06955 2026-02-09 cs.LG 57%

Improving Credit Card Fraud Detection with an Optimized Explainable Boosting Machine

通过优化可解释提升机改善信用卡欺诈检测

Reza E. Fazel, Arash Bakhtiary, Siavash A. Bigdeli

机构 * ReDi School(ReDi学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过优化可解释提升机算法,提升信用卡欺诈检测的准确性和可解释性,实验结果显示其在ROC-AUC指标上优于多种传统方法。

Comments 22 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06631 2026-02-09 cs.CY 57%

Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus

利用LLM估算考试题目难度:在巴西ENEM语料库上的基准测试

Thiago Brant, Julien Kühn, Jun Pang

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文研究了LLM在估算考试题目难度上的表现,发现其在单模态问题上表现中等,但对多模态问题和人口统计数据提示的适应性有限,建议采用评估后再生成的流程进行负责任的评估设计。

Comments 42 pages, 19 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06616 2026-02-09 cs.CR cs.LG 57%

Confundo: Learning to Generate Robust Poison for Practical RAG Systems

Confundo: 学习生成稳健的毒药以应对实际RAG系统

Haoyang Hu, Zhejun Jiang, Yueming Lyu, Junyuan Zhang, Yi Liu, Ka-Ho Chow

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 Confundo是一种学习生成毒药的框架,通过微调大型语言模型以提高RAG系统的鲁棒性和隐蔽性,有效应对实际系统中的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06384 2026-02-09 cs.CL 57%

FMBench: Adaptive Large Language Model Output Formatting

FMBench: 自适应大语言模型输出格式化

Yaoting Wang, Yun Zhou, Henghui Ding

机构 * Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 FMBench通过结合监督微调和强化学习微调,提升大语言模型在Markdown格式化任务中的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00169 2026-02-09 cond-mat.mtrl-sci cs.AI 57%

Towards Agentic Intelligence for Materials Science

迈向材料科学的代理智能

Huan Zhang, Yizhan Li, Wenhao Huang, Ziyu Hou, Yu Song, Xuye Liu, Farshid Effaty, Jinya Jiang, Sifan Wu, Qianggang Ding, Izumi Takahara, Leonard R. MacGillivray, Teruyasu Mizoguchi, Tianshu Yu, Lizi Liao, Yuyu Luo, Yu Rong, Jia Li, Ying Diao, Heng Ji, Bang Liu

机构 * DIRO & Institut Courtois, Université de Montréal(蒙特利尔大学DIRO与Courtois研究所) Mila – Quebec AI Institute(魁北克AI研究所) University of Waterloo(滑铁卢大学) Université de Sherbrooke(Sherbrooke大学) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Singapore Management University(新加坡管理学院) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州)) Alibaba DAMO Academy(阿里巴巴达摩院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出以流程为中心的代理系统框架,通过整合人工智能与材料科学,推动材料发现的自主化与智能化。

Comments 81 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06887 2026-02-09 cs.CR 50%

Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations

柏拉图的形:通过原型表示向 LLMs 提供后门防御即服务

Chen Chen, Yuchen Sun, Jiaxin Gao, Yanwen Jia, Xueluan Gong, Qian Wang, Kwok-Yan Lam

专题命中 安全评测 :alignment(abstract)

AI总结 PROTOPURIFY通过原型表示实现LLMs的后门防御即服务,有效降低后门攻击成功率并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06831 2026-02-09 cs.SE 50%

Statistical-Based Metric Threshold Setting Method for Software Fault Prediction in Firmware Projects: An Industrial Experience

基于统计的软件故障预测指标阈值设置方法:在固件项目中的工业经验

Marco De Luca, Domenico Amalfitano, Anna Rita Fasolino, Porfirio Tramontana

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于统计的软件故障预测指标阈值设置方法,通过实证研究验证了其在工业环境中的有效性,为故障预测提供可解释的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06594 2026-02-09 cs.DB 50%

Machine Learning Practitioners' Views on Data Quality in Light of EU Regulatory Requirements: A European Online Survey

机器学习从业者在欧盟监管要求下的数据质量观点:一项欧洲在线调查

Yichun Wang, Kristina Irion, Paul Groth, Hazar Harmouch

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文通过欧洲在线调查,探讨了欧盟监管下机器学习从业者对数据质量的认知与实践,揭示了当前数据质量实践与监管要求之间的差距,并提出改进数据质量工具和协作的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06582 2026-02-09 cs.GT econ.TH 50%

The Impossibility of Strategyproof Rank Aggregation

策略证明排名聚合的不可能性

Manuel Eberl, Patrick Lederer

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文证明了在至少四个选项的情况下,不存在同时满足一致性和策略证明性的排名聚合方法。

Comments Published as full paper at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06507 2026-02-09 cs.CV 50%

FloorplanVLM: A Vision-Language Model for Floorplan Vectorization

FloorplanVLM:一种用于平面图向量化的视觉-语言模型

Yuanqing Liu, Ziming Yang, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 安全评测 :alignment(abstract)

AI总结 FloorplanVLM通过像素到序列的范式,实现复杂平面图向量化的高精度与高鲁棒性,其统一框架和渐进训练策略在工程级向量化任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06494 2026-02-09 cs.CV 50%

DreamHome-Pano: Design-Aware and Conflict-Free Panoramic Interior Generation

DreamHome-Pano: 基于设计意识和无冲突的全景室内生成

Lulu Chen, Yijiang Hu, Yuanqing Liu, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 安全评测 :alignment(abstract)

AI总结 DreamHome-Pano通过引入Prompt-LLM和无冲突控制架构,实现了高保真的全景室内生成,平衡了美学质量和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏