arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 52 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2602.06446 2026-02-09 cs.CL cs.AI cs.LG 67%

CORE: Comprehensive Ontological Relation Evaluation for Large Language Models

CORE:面向大语言模型的全面本体关系评估

Satyam Dwivedi, Sanjukta Ghosh, Shivam Dwivedi, Nishi Kumari, Anil Thakur, Anurag Purushottam, Deepak Alok, Praveen Gatla, Manjuprasad B, Bipasha Patgiri

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06256 2026-02-09 cs.LG cs.AI cs.CL 67%

Steering Safely or Off a Cliff? Rethinking Specificity and Robustness in Inference-Time Interventions

在悬崖边转向还是偏离?重新思考推断时间干预中的特异性和鲁棒性

Navita Goyal, Hal Daumé

机构 * University of Maryland College Park(马里兰大学学院市)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出模型转向中特异性和鲁棒性的评估框架,揭示转向方法在提升效率的同时可能牺牲安全性。

Comments EACL 2026 Main, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06395 2026-02-09 cs.CR cs.AI cs.LG 62%

Empirical Analysis of Adversarial Robustness and Explainability Drift in Cybersecurity Classifiers

对抗鲁棒性与可解释性漂移的实证分析:在网络安全分类器中的应用

Mona Rajhans, Vishal Khawarey

机构 * Palo Alto Networks(帕洛阿尔托网络公司) Quicken Inc(Quicken公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证研究分析了网络安全分类器中对抗鲁棒性与可解释性漂移的问题,提出鲁棒性指数指标,并展示了对抗训练对提升鲁棒性的效果。

Comments Accepted for publication in 18th ACM International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05183 2026-02-09 cs.LG cs.AI 62%

Data-Centric Interpretability for LLM-based Multi-Agent Reinforcement Learning

面向大语言模型多智能体强化学习的数据导向可解释性

John Yan, Michael Yu, Yuqi Sun, Alexander Duffy, Tyler Marques, Matthew Lyle Olson

机构 * goodstartlabs(Good Start Labs)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Meta-Autointerp方法,利用SAEs和LLM总结器分析多智能体强化学习行为,发现细粒度行为及奖励黑客,验证SAE特征的有效性并提升智能体性能。

Comments authors 1, 2 and 3 contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04301 2026-02-09 cs.LG cs.CL 62%

Quantifying the Effect of Test Set Contamination on Generative Evaluations

量化测试集污染对生成评估的影响

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi, Ken Ziyu Liu, Brando Miranda, Ahmed Ahmed, Fazl Berez, Abhay Puri, Stella Biderman, Niloofar Mireshghallah, Sanmi Koyejo

机构 * University of Oxford(牛津大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06955 2026-02-09 cs.LG 57%

Improving Credit Card Fraud Detection with an Optimized Explainable Boosting Machine

通过优化可解释提升机改善信用卡欺诈检测

Reza E. Fazel, Arash Bakhtiary, Siavash A. Bigdeli

机构 * ReDi School(ReDi学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过优化可解释提升机算法,提升信用卡欺诈检测的准确性和可解释性,实验结果显示其在ROC-AUC指标上优于多种传统方法。

Comments 22 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06631 2026-02-09 cs.CY 57%

Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus

利用LLM估算考试题目难度:在巴西ENEM语料库上的基准测试

Thiago Brant, Julien Kühn, Jun Pang

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文研究了LLM在估算考试题目难度上的表现,发现其在单模态问题上表现中等,但对多模态问题和人口统计数据提示的适应性有限,建议采用评估后再生成的流程进行负责任的评估设计。

Comments 42 pages, 19 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06616 2026-02-09 cs.CR cs.LG 57%

Confundo: Learning to Generate Robust Poison for Practical RAG Systems

Confundo: 学习生成稳健的毒药以应对实际RAG系统

Haoyang Hu, Zhejun Jiang, Yueming Lyu, Junyuan Zhang, Yi Liu, Ka-Ho Chow

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 Confundo是一种学习生成毒药的框架,通过微调大型语言模型以提高RAG系统的鲁棒性和隐蔽性,有效应对实际系统中的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06384 2026-02-09 cs.CL 57%

FMBench: Adaptive Large Language Model Output Formatting

FMBench: 自适应大语言模型输出格式化

Yaoting Wang, Yun Zhou, Henghui Ding

机构 * Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 FMBench通过结合监督微调和强化学习微调,提升大语言模型在Markdown格式化任务中的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00169 2026-02-09 cond-mat.mtrl-sci cs.AI 57%

Towards Agentic Intelligence for Materials Science

迈向材料科学的代理智能

Huan Zhang, Yizhan Li, Wenhao Huang, Ziyu Hou, Yu Song, Xuye Liu, Farshid Effaty, Jinya Jiang, Sifan Wu, Qianggang Ding, Izumi Takahara, Leonard R. MacGillivray, Teruyasu Mizoguchi, Tianshu Yu, Lizi Liao, Yuyu Luo, Yu Rong, Jia Li, Ying Diao, Heng Ji, Bang Liu

机构 * DIRO & Institut Courtois, Université de Montréal(蒙特利尔大学DIRO与Courtois研究所) Mila – Quebec AI Institute(魁北克AI研究所) University of Waterloo(滑铁卢大学) Université de Sherbrooke(Sherbrooke大学) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Singapore Management University(新加坡管理学院) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州)) Alibaba DAMO Academy(阿里巴巴达摩院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出以流程为中心的代理系统框架,通过整合人工智能与材料科学,推动材料发现的自主化与智能化。

Comments 81 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06887 2026-02-09 cs.CR 50%

Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations

柏拉图的形:通过原型表示向 LLMs 提供后门防御即服务

Chen Chen, Yuchen Sun, Jiaxin Gao, Yanwen Jia, Xueluan Gong, Qian Wang, Kwok-Yan Lam

专题命中 安全评测 :alignment(abstract)

AI总结 PROTOPURIFY通过原型表示实现LLMs的后门防御即服务,有效降低后门攻击成功率并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06831 2026-02-09 cs.SE 50%

Statistical-Based Metric Threshold Setting Method for Software Fault Prediction in Firmware Projects: An Industrial Experience

基于统计的软件故障预测指标阈值设置方法:在固件项目中的工业经验

Marco De Luca, Domenico Amalfitano, Anna Rita Fasolino, Porfirio Tramontana

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于统计的软件故障预测指标阈值设置方法,通过实证研究验证了其在工业环境中的有效性,为故障预测提供可解释的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06594 2026-02-09 cs.DB 50%

Machine Learning Practitioners' Views on Data Quality in Light of EU Regulatory Requirements: A European Online Survey

机器学习从业者在欧盟监管要求下的数据质量观点:一项欧洲在线调查

Yichun Wang, Kristina Irion, Paul Groth, Hazar Harmouch

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文通过欧洲在线调查,探讨了欧盟监管下机器学习从业者对数据质量的认知与实践,揭示了当前数据质量实践与监管要求之间的差距,并提出改进数据质量工具和协作的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06582 2026-02-09 cs.GT econ.TH 50%

The Impossibility of Strategyproof Rank Aggregation

策略证明排名聚合的不可能性

Manuel Eberl, Patrick Lederer

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文证明了在至少四个选项的情况下,不存在同时满足一致性和策略证明性的排名聚合方法。

Comments Published as full paper at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06507 2026-02-09 cs.CV 50%

FloorplanVLM: A Vision-Language Model for Floorplan Vectorization

FloorplanVLM:一种用于平面图向量化的视觉-语言模型

Yuanqing Liu, Ziming Yang, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 安全评测 :alignment(abstract)

AI总结 FloorplanVLM通过像素到序列的范式,实现复杂平面图向量化的高精度与高鲁棒性,其统一框架和渐进训练策略在工程级向量化任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06494 2026-02-09 cs.CV 50%

DreamHome-Pano: Design-Aware and Conflict-Free Panoramic Interior Generation

DreamHome-Pano: 基于设计意识和无冲突的全景室内生成

Lulu Chen, Yijiang Hu, Yuanqing Liu, Yulong Li, Yue Yang

机构 * Beike(贝克)

专题命中 安全评测 :alignment(abstract)

AI总结 DreamHome-Pano通过引入Prompt-LLM和无冲突控制架构,实现了高保真的全景室内生成,平衡了美学质量和结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2305.02748 2026-02-09 cs.AI cs.CY cs.MA 62%

A computational framework for human values

人类价值观的计算框架

Nardine Osman, Mark d'Inverno

机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究 institute (IIIA-CSIC))

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一个基于社会科学的正式框架,用于系统研究如何通过人类价值观设计伦理人工智能。

Journal ref Proceedings of the 23rd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2024), pp. 1531-1539

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06107 2026-02-09 cs.AI 57%

Jackpot: Optimal Budgeted Rejection Sampling for Extreme Actor-Policy Mismatch Reinforcement Learning

Jackpot: 为极端演员-策略不匹配强化学习的最优预算拒绝采样

Zhuoming Chen, Hongyi Liu, Yang Zhou, Haizhong Zheng, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 Jackpot通过最优预算拒绝采样方法,有效减少rollout模型与策略之间的分布差异,提升大语言模型强化学习的训练稳定性与效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 4 篇

2602.06869 2026-02-09 cs.CL cs.LG 81%

Uncovering Cross-Objective Interference in Multi-Objective Alignment

揭示多目标对齐中的跨目标干扰

Yining Lu, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CTWA方法,通过保持目标奖励与训练信号的正协方差来缓解多目标对齐中的跨目标干扰问题,并分析了干扰与模型几何属性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04210 2026-02-09 cs.AI cs.LG 62%

Steering LLMs via Scalable Interactive Oversight

通过可扩展的交互监督引导大语言模型

Enyu Zhou, Zhiheng Xi, Long Ma, Zhihao Zhang, Shihan Dou, Zhikai Lei, Guoteng Wang, Rui Zheng, Hang Yan, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出可扩展的交互监督框架,通过递归决策树提升人类对AI任务的引导能力,实现非专家生成高质量产品需求文档,并通过强化学习优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14625 2026-02-09 cs.CL cs.AI 62%

Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models

概率聚合与定向嵌入优化用于大语言模型中的集体道德推理

Chenchen Yuan, Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06325 2026-02-09 cs.CR cs.SE 50%

Identifying Adversary Tactics and Techniques in Malware Binaries with an LLM Agent

利用LLM代理识别恶意软件二进制中的攻击战术与技术

Zhou Xuan, Xiangzhe Xu, Mingwei Zheng, Louis Zheng-Hua Tan, Jinyao Guo, Tiantai Zhang, Le Yu, Chengpeng Wang, Xiangyu Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 TTPDetect通过结合密集检索与LLM神经检索,利用LLM代理识别恶意软件二进制中的TTPs,实现高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏