arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2602.18450 2026-02-24 cs.CL cs.IT cs.LG math.IT 62%

Asymptotic Semantic Collapse in Hierarchical Optimization

层次优化中的渐近语义崩溃

Faruk Alpay, Bugra Kilictas

机构 * Department of Computer Engineering, Bahçeşehir University(计算机工程系,巴切希尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示了层次优化中语义逐渐趋同的现象,通过数学模型和实验验证了语义状态收敛及信息熵消失的特性。

Comments 23 pages, 2 figures. Includes a dataset-free benchmark with full metric reporting

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18351 2026-02-23 cs.CL cs.AI 62%

Validating Political Position Predictions of Arguments

验证论证中政治立场预测的准确性

Jordan Robinson, Angus R. Williams, Katie Atkinson, Anthony G. Cohn

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双尺度验证框架,通过点评和成对验证方法验证论证中政治立场预测的准确性,构建了大规模政治立场知识库,提升了政治领域知识表示能力。

Comments 13 pages, 6 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01865 2026-02-23 cs.CL cs.AI 62%

Cross-Lingual Interleaving for Speech Language Models

跨语言交织用于语音语言模型

Adel Moumen, Guangzhi Sun, Philip C. Woodland

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨语言交织方法,通过混合多语言语音标记提升SLMs的跨语言理解和生成能力,并发布相关数据集和基准以促进多语言语音模型的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 62%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08646 2026-02-20 cs.CL cs.CY 62%

QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models

QSTN: 一种用于大型语言模型鲁棒问卷推断的模块化框架

Maximilian Kreutner, Jens Rupprecht, Georg Ahnert, Ahmed Salem, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) CSH Vienna(维也纳CSH)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 QSTN是一种模块化框架,通过无需编码的界面实现大型语言模型在问卷推断中的稳健评估与高效响应生成。

Comments Accepted at 2026 EACL System Demonstrations The Python package is available at https://github.com/dess-mannheim/QSTN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04220 2026-02-20 cs.CL cs.AI 62%

BEADs: Bias Evaluation Across Domains

BEADs: 跨领域偏差评估

Shaina Raza, Mizanur Rahman, Michael R. Zhang

机构 * Vector Institute(向量研究所) Royal Bank of Canada(皇家银行) University of Toronto(多伦多大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 BEADs数据集通过跨领域偏差评估,提供广泛NLP任务的偏差检测与模型评估方案,揭示现有模型在人口群体上的系统性偏差问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16740 2026-02-20 cs.LG cs.AI 62%

Quantifying LLM Attention-Head Stability: Implications for Circuit Universality

量化大语言模型注意力头的稳定性:对电路通用性的启示

Karan Bali, Jack Stanley, Praneet Suresh, Danilo Bzdok

机构 * Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究量化了大语言模型注意力头的稳定性,发现中层头最不稳定但表示最独特,深层模型中层分歧更明显,权重衰减优化提升稳定性,残差流较稳定,为AI系统白盒监控提供新视角。

Comments Main Body: 8 pages, Total length: 33 pages, Code repo: https://github.com/karanbali/attention_head_seed_stability , Weights repo: https://huggingface.co/karanbali/attention_head_seed_stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23339 2026-02-20 cs.AI cs.CL cs.HC 62%

A Scalable Framework for Evaluating Health Language Models

可扩展的健康语言模型评估框架

Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Speed, Mark Malhotra, Shwetak Patel, Javier L. Prieto, Daniel McDuff, Ahmed A. Metwally

机构 * Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自适应精确布尔评估框架,用于高效评估健康领域语言模型,提升评估效率和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10515 2026-02-19 cs.CL cs.AI physics.ed-ph 62%

Mastering Olympiad-Level Physics with Artificial Intelligence

用人工智能掌握竞赛级物理

Dong-Shan Jian, Xiang Li, Chen-Xu Yan, Hui-Wen Zheng, Zhi-Zhang Bian, You-Le Fang, Ren-Xi He, Jing-Tian Zhang, Ce Meng, Ling-Shi Meng, Bing-Rui Gong, Sheng-Qi Zhang, Yan-Qing Ma

机构 * School of Physics, Peking University(物理系,北京大学) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学系,北京大学) Center for High Energy Physics, Peking University(高能物理中心,北京大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOCA框架,通过逻辑链增强方法在物理竞赛中实现接近完美的成绩,展示了AI在复杂物理推理中的强大能力。

Comments 8 pages, 3 figures, Content from the previous article 2510.01249 is included

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06601 2026-02-18 cs.LG cs.AI 62%

Deep Ignorance: Filtering Pretraining Data Builds Tamper-Resistant Safeguards into Open-Weight LLMs

深度无知:过滤预训练数据在开放权重大语言模型中构建抗篡改的安全保障

Kyle O'Brien, Stephen Casper, Quentin Anthony, Tomek Korbak, Robert Kirk, Xander Davies, Ishan Mishra, Geoffrey Irving, Yarin Gal, Stella Biderman

机构 * EleutherAI UK AI Security Institute(英国人工智能安全研究所) University of Oxford(牛津大学) OATML, University of Oxford(OATML,牛津大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过过滤预训练数据中的双用途内容,增强开放权重大语言模型的抗篡改能力,实验显示其在对抗微调攻击上表现优异,且未影响其他能力。

Comments https://deepignorance.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14024 2026-02-17 cs.LG cs.AI 62%

EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models

EIDOS:用于时间序列基础模型的潜在空间预测学习

Xinxing Zhou, Qingren Yao, Yiji Zhao, Chenghao Liu, Flora Salim, Xiaojie Yuan, Yanlong Wen, Ming Jin

机构 * Nankai University(南开大学) Eindhoven University of Technology(埃因霍温理工大学) Yunnan University(云南大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 EIDOS通过潜在空间预测学习提升时间序列基础模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12247 2026-02-17 cs.LG cs.AI 62%

ExtractBench: A Benchmark and Evaluation Methodology for Complex Structured Extraction

ExtractBench: 一种复杂结构提取的基准和评估方法

Nick Ferguson, Josh Pennington, Narek Beghian, Aravind Mohan, Douwe Kiela, Sheshansh Agrawal, Thien Hang Nguyen

机构 * Contextual AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ExtractBench提出了一种开源基准和评估框架,用于评估PDF到JSON结构提取的准确性和可靠性,揭示了前沿模型在复杂模式下的性能不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12285 2026-02-16 cs.CL cs.AI 62%

From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness

从有偏聊天机器人到有偏代理:检验角色分配对LLM代理鲁棒性的影响

Linbo Cao, Lihao Sun, Yang Yue

专题命中 安全评测 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 研究发现基于人口统计学的人设分配会影响LLM代理的行为和性能,导致高达26.2%的降级,揭示了代理系统中隐含偏见和行为波动的风险。

Comments Accepted to the AAAI 2026 TrustAgent Workshop. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11877 2026-02-13 cs.CL cs.AI 62%

Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems

迈向协作大语言模型系统中路由器的公平且全面评估

Wanxing Wu, He Zhu, Yixia Li, Lei Yang, Jiehui Zhao, Hongru Wang, Jian Yang, Benyou Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Institut Polytechnique de Paris(巴黎政治学院) Peking University(北京大学) Deepexi Technology Co. Ltd.(深醒科技有限公司) University of Edinburgh(爱丁堡大学) Beihang University(北航) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RouterXBench框架和ProbeDirichlet路由器,通过内部隐藏状态提升路由能力与跨领域鲁棒性,实现对协作大语言模型系统中路由器的公平全面评估。

Comments Our code is publicly available at https://github.com/zhuchichi56/RouterXBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11690 2026-02-13 cs.LG cs.AI 62%

ANML: Attribution-Native Machine Learning with Guaranteed Robustness

ANML:具有保证鲁棒性的属性原生机器学习

Oliver Zahn, Matt Beton, Simran Chana

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ANML通过质量加权训练提升模型性能和归因能力,在多个数据集上显著减少误差。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11666 2026-02-13 cs.AI cs.CL 62%

PhyNiKCE: A Neurosymbolic Agentic Framework for Autonomous Computational Fluid Dynamics

PhyNiKCE:一种用于自主计算流体动力学的神经符号代理框架

E Fan, Lisong Shi, Zhengtong Li, Chih-yung Wen

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 PhyNiKCE通过神经符号框架提升CFD模拟的可信度与效率,实现96%的性能提升并减少59%的自我校正循环。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11165 2026-02-13 cs.CL cs.AI 62%

Assessing LLM Reliability on Temporally Recent Open-Domain Questions

评估LLM在近期开放领域问题上的可靠性

Pushwitha Krishnappa, Amit Das, Vinija Jain, Tathagata Mukherjee, Aman Chadha

机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) University of North Alabama(北阿拉巴马大学) Stanford University(斯坦福大学) Google(谷歌) Apple(苹果公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 RECOM研究通过分析15000个Reddit问题,发现LLM在语义对齐上表现优异,但词汇重合度低,揭示模型通过改写保留意义,挑战传统词汇度量的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03083 2026-02-12 cs.DS cs.AI cs.CL 62%

Algorithmically Establishing Trust in Evaluators

算法上建立评估者的信任

Adrian de Wynter

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出无数据算法,通过连续挑战建立评估者信任,无需标注数据,适用于低资源语言标注场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18970 2026-02-12 cs.AI cs.LG 62%

Bridging Explainability and Embeddings: BEE Aware of Spuriousness

弥合可解释性与嵌入:BEE 意识到虚假相关性

Cristian Daniel Păduraru, Antonio Bărbălau, Radu Filipescu, Andrei Liviu Nicolicioiu, Elena Burceanu

机构 * Bitdefender University of Bucharest(布加勒斯特大学) Mila University of Montreal(蒙特利尔大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 BEE通过分析权重空间和嵌入几何揭示隐藏的虚假相关性,适用于多种数据集和模型,提升基础模型的可信度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08672 2026-02-10 cs.CL cs.LG 62%

Learning to Judge: LLMs Designing and Applying Evaluation Rubrics

学习评判:LLMs设计与应用评价量规

Clemencia Siro, Pourya Aliannejadi, Mohammad Aliannejadi

机构 * Centrum Wiskunde & Informatica (CWI)(荷兰阿姆斯特丹数学与信息学中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究LLMs能否自主设计和应用评价量规,发现其在一致性与跨模型泛化上存在差异,需联合建模人类与LLM的评估语言以提升可靠性。

Comments Accepted at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16773 2026-02-10 cs.CY cs.LG stat.AP stat.ML 62%

Advance Real-time Detection of Traffic Incidents in Highways using Vehicle Trajectory Data

利用车辆轨迹数据实现高速公路交通事故的先进实时检测

Sudipta Roy, Samiul Hasan

专题命中 安全评测 :safety(abstract);分类 cs.CY、cs.LG

AI总结 本研究利用车辆轨迹数据和机器学习算法,通过随机森林模型实现高速公路交通事故的先进实时检测,提升事故预警能力。

Comments 19 Pages, 4 Tables, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07562 2026-02-10 cs.LG cs.AI stat.ML 62%

Gaussian Match-and-Copy: A Minimalist Benchmark for Studying Transformer Induction

高斯匹配与复制:一种研究Transformer归纳的极简基准

Antoine Gonon, Alexandre Cordonnier, Nicolas Boumal

机构 * Institute of Mathematics, EPFL, Switzerland(数学研究所,瑞士联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出高斯匹配与复制基准,用于研究Transformer的匹配与复制机制,通过隔离长距离检索信号,分析模型在检索能力上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06395 2026-02-09 cs.CR cs.AI cs.LG 62%

Empirical Analysis of Adversarial Robustness and Explainability Drift in Cybersecurity Classifiers

对抗鲁棒性与可解释性漂移的实证分析:在网络安全分类器中的应用

Mona Rajhans, Vishal Khawarey

机构 * Palo Alto Networks(帕洛阿尔托网络公司) Quicken Inc(Quicken公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文通过实证研究分析了网络安全分类器中对抗鲁棒性与可解释性漂移的问题,提出鲁棒性指数指标,并展示了对抗训练对提升鲁棒性的效果。

Comments Accepted for publication in 18th ACM International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05183 2026-02-09 cs.LG cs.AI 62%

Data-Centric Interpretability for LLM-based Multi-Agent Reinforcement Learning

面向大语言模型多智能体强化学习的数据导向可解释性

John Yan, Michael Yu, Yuqi Sun, Alexander Duffy, Tyler Marques, Matthew Lyle Olson

机构 * goodstartlabs(Good Start Labs)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Meta-Autointerp方法,利用SAEs和LLM总结器分析多智能体强化学习行为,发现细粒度行为及奖励黑客,验证SAE特征的有效性并提升智能体性能。

Comments authors 1, 2 and 3 contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04301 2026-02-09 cs.LG cs.CL 62%

Quantifying the Effect of Test Set Contamination on Generative Evaluations

量化测试集污染对生成评估的影响

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi, Ken Ziyu Liu, Brando Miranda, Ahmed Ahmed, Fazl Berez, Abhay Puri, Stella Biderman, Niloofar Mireshghallah, Sanmi Koyejo

机构 * University of Oxford(牛津大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01741 2026-02-06 cs.SE cs.AI cs.CL 62%

How Toxic Can You Get? Search-based Toxicity Testing for Large Language Models

你能有多有毒?基于搜索的大型语言模型毒性测试

Simone Corbo, Luca Bancale, Valeria De Gennaro, Livia Lestingi, Vincenzo Scotti, Matteo Camilli

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 EvoTox通过迭代进化策略评估LLM的毒性倾向,有效检测毒性水平并控制成本开销。

Journal ref IEEE Transactions on Software Engineering, Nov. 2025, pp. 3056-3071, vol. 51

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05082 2026-02-06 cs.LG cs.AI stat.ML 62%

Reliable Explanations or Random Noise? A Reliability Metric for XAI

可靠的解释还是随机噪声?XAI的可靠性度量

Poushali Sengupta, Sabita Maharjan, Frank Eliassen, Shashi Raj Pandey, Yan Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了解释可靠性指数(ERI),通过四个可靠性公理评估解释稳定性,揭示现有解释方法在现实部署中的可靠性问题,推动更可信的可解释人工智能系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03969 2026-02-06 cs.AI cs.CR cs.LG 62%

How Catastrophic is Your LLM? Certifying Risk in Conversation

你的LLM有多危险?对话中风险的认证

Chengxiao Wang, Isha Chaudhary, Qian Hu, Weitong Ruan, Rahul Gupta, Gagandeep Singh

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出C$^3$LLM框架,通过统计方法认证LLMs在多轮对话中的灾难性风险,揭示前沿模型中高达70%的潜在风险,强调改进安全训练的必要性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY 62%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 62%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏