arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-02 至 2026-02-02 共收录 72 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2601.22434 2026-02-02 cs.CR cs.CY cs.LG 62%

Rethinking Anonymity Claims in Synthetic Data Generation: A Model-Centric Privacy Attack Perspective

重新思考合成数据生成中的匿名性主张:一种以模型为中心的隐私攻击视角

Georgi Ganev, Emiliano De Cristofaro

机构 * UCL(伦敦大学学院) SAS(SAS公司) UC Riverside(加州大学河滨分校)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CY、cs.LG

AI总结 本文从模型为中心的视角重新审视合成数据生成中的匿名性主张,强调需考虑生成模型能力和隐私攻击,指出合成数据技术不足以保证匿名性,并比较差分隐私与相似性隐私度量的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22935 2026-02-02 cs.CR cs.AI 57%

Protecting Private Code in IDE Autocomplete using Differential Privacy

在IDE自动补全中使用差分隐私保护私有代码

Evgeny Grigorenko, David Stanojević, David Ilić, Egor Bogomolov, Kostadin Cvejoski

机构 * JetBrains Research(JetBrains研究)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出利用差分隐私保护IDE自动补全中用户代码隐私,通过DP训练模型有效防御成员推断攻击,同时保持模型性能。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20161 2026-02-02 cs.HC 50%

Supporting Informed Self-Disclosure: Design Recommendations for Presenting AI-Estimates of Privacy Risks to Users

支持知情自我披露:为向用户呈现AI估计的隐私风险提供设计建议

Isadora Krsek, Meryl Ye, Wei Xu, Alan Ritter, Laura Dabbish, Sauvik Das

专题命中 隐私与版权 :safety(abstract)

AI总结 本文通过设计虚构和漫画板方法,提出四个设计建议,帮助用户理解AI估计的隐私风险,以促进知情的自我披露决策。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全评测 11 篇

2109.09807 2026-02-02 cs.RO cs.AI cs.GT cs.MA 79%

I Know You Can't See Me: Dynamic Occlusion-Aware Safety Validation of Strategic Planners for Autonomous Vehicles Using Hypergames

我无法看到你:基于超游戏的动态遮挡感知的自动驾驶战略规划器安全验证

Maximilian Kahn, Atrisha Sarkar, Krzysztof Czarnecki

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出基于超游戏理论的动态遮挡风险度量方法和加速安全验证框架,用于提升自动驾驶战略规划器的安全性。

Comments This work is 6 pages long and contains 5 figures. For the supplementary video, see https://youtu.be/-crio3rA_IU

Journal ref 2022 International Conference on Robotics and Automation (ICRA). IEEE, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22696 2026-02-02 cs.CV cs.LG 79%

Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding

Bi-MCQ:重新表述视觉-语言对齐以理解否定

Tae Hun Kim, Hyun Gyu Lee

机构 * Department of Electrical and Computer Engineering, Inha University, Republic of Korea(电气与计算机工程系,印哈大学,大韩民国) College of Medicine, Inha University, Republic of Korea(医学学院,印哈大学,大韩民国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 Bi-MCQ通过重新表述视觉-语言对齐为条件语义比较,提升医学VLM对否定理解的性能。

Comments 15 pages, 4 figures, Submitted to ICPR 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10691 2026-02-02 cs.CL cs.AI 79%

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

从温和到动态对抗的评估:一个大型语言模型的鱿鱼游戏

Zijian Chen, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出鱿鱼游戏,一个动态对抗性评估环境,用于评估大型语言模型的多方面能力,并揭示静态基准中可能存在的评估范式污染问题。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22653 2026-02-02 cs.HC cs.AI cs.CR 74%

Human-Centered Explainability in AI-Enhanced UI Security Interfaces: Designing Trustworthy Copilots for Cybersecurity Analysts

面向AI增强的用户界面安全性的以人为本的可解释性:为网络安全分析师设计可信的copilot

Mona Rajhans

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出了一种面向AI增强用户界面安全性的以人为本的可解释性方法,通过设计可信的copilot,提升网络安全分析师对AI输出的信任和决策准确性。

Comments To appear in IEEE ICCA 2025 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22769 2026-02-02 cs.CY cs.AI 62%

Beyond Abstract Compliance: Operationalising trust in AI as a moral relationship

超越抽象合规:将人工智能中的信任视为一种道德关系

Lameck Mbangula Amugongo, Tutaleni Asino, Nicola J Bidwell

机构 * Boehringer Ingelheim Pharma GmbH \& Co. KG Birkendorfer Str. 65 Biberach an der Riss Germany 88400 Carnegie Mellon University Pittsburgh, PA USA Rhodes University Makhanda South Africa International University of Management Namibia Charles Darwin University Australia Boehringer Ingelheim Pharma GmbH \& Co. KG Carnegie Mellon University Rhodes University International University of Management Charles Darwin University

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于非洲关系伦理的信任原则,通过医疗和教育案例,探讨如何将AI信任视为动态关系,促进公平和情境敏感的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01017 2026-02-02 cs.AI 57%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22702 2026-02-02 cs.LG 57%

Metric Hub: A metric library and practical selection workflow for use-case-driven data quality assessment in medical AI

Metric Hub: 一个用于医疗AI中以用例为导向的数据质量评估的度量库和实用选择流程

Katinka Becker, Maximilian P. Oppelt, Tobias S. Zech, Martin Seyferth, Sandie Cabon, Vanja Miskovic, Ivan Cimrak, Michal Kozubek, Giuseppe D'Avenio, Ilaria Campioni, Jana Fehr, Kanjar De, Ismail Mahmoudi, Emilio Dolgener Cantu, Laurenz Ottmann, Andreas Klaß, Galaad Altares, Jackie Ma, Alireza Salehi M., Nadine R. Lang-Richter, Tobias Schaeffter, Daniel Schwabe

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 Metric Hub提出一个医疗AI中以用例为导向的数据质量评估度量库和选择流程,通过度量卡片和决策树提升数据质量评估的实用性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22699 2026-02-02 cs.CL 57%

Models Know Models Best: Evaluation via Model-Preferred Formats

模型最擅长模型评估:通过模型偏好的格式进行评估

Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Dept. of Computer Science and Engineering, Seoul National University(计算机科学与工程系,首尔国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种动态格式对齐策略,通过模型生成的信号确定最佳评估格式,提升零样本准确率,揭示模型潜在能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21337 2026-02-02 cs.CL cs.SD eess.AS 57%

Qwen3-ASR Technical Report

Qwen3-ASR 技术报告

Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

机构 * Qwen Team(通义实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Qwen3-ASR 提出两个端到端语音识别模型和非自回归强制对齐模型,实现多语言识别与高效转录,展示最佳准确率与效率平衡。

Comments https://github.com/QwenLM/Qwen3-ASR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22791 2026-02-02 cs.SE 50%

Understanding on the Edge: LLM-generated Boundary Test Explanations

对边界的理解:LLM生成的边界测试解释

Sabinakhon Akbarova, Felix Dobslaw, Robert Feldt

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文研究LLM生成的边界解释在软件测试中的有效性,通过调查和访谈发现,清晰结构、权威来源引用和可操作示例能提升解释质量,提出七项要求的检查表以指导未来工具设计。

Comments This is the author's accepted manuscript of a paper accepted for publication at AST 2026. The final version will appear in the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17292 2026-02-02 cs.SE 50%

Risk-based test framework for LLM features in regulated software

基于风险的受监管软件中LLM功能测试框架

Zhiyin Zhou

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种针对受监管软件中LLM功能的风险测试框架,包含风险分类、分层测试策略及案例研究,以应对LLM在安全关键应用中的风险挑战。

Journal ref David C. Wyld et al. Eds CSML, AISCA, DNLP, SOEA, NET, BDHI, SIPO 2026 pp. 107-124, 2026. CS & IT CSCP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. AI治理与伦理 6 篇

2512.11391 2026-02-02 cs.LG 88%

Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization

通过空域约束策略优化缓解安全对齐税

Yifan Niu, Han Xiao, Dongyi Liu, Nuo Chen, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 通过空域约束策略优化缓解安全对齐税,提出NSPO框架在保留LLM核心能力的同时提升安全性能。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22486 2026-02-02 cs.CY cs.AI 81%

AI Literacy, Safety Awareness, and STEM Career Aspirations of Australian Secondary Students: Evaluating the Impact of Workshop Interventions

澳大利亚中学生AI素养、安全意识与STEM职业抱负:评估工作坊干预的影响

Christian Bergh, Alexandra Vassar, Natasha Banks, Jessica Xu, Jake Renzella

机构 * University of New South Wales, Sydney(新南威尔士大学悉尼分校)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究评估了工作坊干预对澳大利亚中学生AI素养、安全意识和STEM职业兴趣的影响,发现干预提升了学生对AI的认知和兴趣,但需持续干预以影响长期职业抱负。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22621 2026-02-02 cs.CY 70%

Ethical Risks of Large Language Models in Medical Consultation: An Assessment Based on Reproductive Ethics

大语言模型在医疗咨询中的伦理风险:基于生殖伦理的评估

Hanhui Xu, Jiacheng Ji, Haoan Jin, Han Ying, Mengyue Wu

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本研究评估了大语言模型在生殖伦理咨询中的伦理风险,发现其在安全性和同理心方面存在严重缺陷,需加强推理和伦理依据能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25471 2026-02-02 cs.AI cs.CY 62%

An Aristotelian ontology of instrumental goals: Structural features to be managed and not failures to be eliminated

一种亚里士多德式的工具性目标本体论:需管理而非消除的结构特征

Willem Fourie

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一种亚里士多德式的工具性目标本体论,将工具性目标视为高级AI系统需管理的特征,而非需消除的异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22745 2026-02-02 cs.LG 57%

Is Softmax Loss All You Need? A Principled Analysis of Softmax-family Loss

Softmax损失是否足够?对Softmax家族损失的系统分析

Yuanhao Pu, Defu Lian, Enhong Chen

机构 * School of Artificial Intelligence \& Data Science, University of Science \& Technology of China, Hefei, China School of Computer Science \& Technology, University of Science \& Technology of China, Hefei, China State Key Laboratory of Cognitive Intelligence, China

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文系统分析了Softmax家族损失的理论性质和实践效果,揭示了不同替代物在分类和排序中的一致性及收敛行为,提出了偏差-方差分解和复杂度分析,为大规模类别学习中的损失选择提供了理论基础和实践指导。

Comments 34 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12767 2026-02-02 cs.AI 57%

Language Models That Walk the Talk: A Framework for Formal Fairness Certificates

语言模型言出必行:一个形式公平证书的框架

Danqing Chen, Tobias Ladner, Ahmed Rayen Mhadhbi, Matthias Althoff

机构 * Technical University of Munich, Germany(慕尼黑技术大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出一个框架,用于验证大语言模型的鲁棒性和公平性,特别是在性别公平和毒性检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他安全 22 篇

2505.17652 2026-02-02 cs.LG cs.AI 81%

Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective

重新思考强化学习中用于大语言模型推理的采样标准:一种能力-难度对齐视角

Deyang Kong, Qi Guo, Xiangyu Xi, Wei Wang, Jingang Wang, Xunliang Cai, Shikun Zhang, Wei Ye

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CDAS方法,通过能力-难度对齐提升大语言模型推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22948 2026-02-02 cs.AI 79%

Alignment among Language, Vision and Action Representations

语言、视觉和动作表征的一致性

Nicola Milano, Stefano Nolfi

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过训练Transformer智能体执行自然语言指令,发现语言、视觉和动作表征在跨模态中呈现部分共享的语义结构,支持模态无关的语义组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22722 2026-02-02 cs.LG 79%

Local Intrinsic Dimension of Representations Predicts Alignment and Generalization in AI Models and Human Brain

表示的局部内在维度预测AI模型和人脑中的对齐和泛化

Junjie Yu, Wenxiao Ma, Chen Wei, Jianyu Zhang, Haotian Deng, Zihan Deng, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(生物医学工程系,南方科技大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 研究发现,AI模型和人脑的表示局部内在维度与对齐和泛化能力相关,且模型容量和数据规模增加可降低该维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09378 2026-02-02 cs.CL 79%

Can you map it to English? The Role of Cross-Lingual Alignment in Multilingual Performance of LLMs

能否映射到英语?跨语言对齐在大语言模型多语言性能中的作用

Kartik Ravisankar, Hyojung Han, Sarah Wiegreffe, Marine Carpuat

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究探讨了LLM中跨语言对齐对多语言NLU任务性能的影响,通过引入DALI指数验证了表示对齐在正确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02767 2026-02-02 cs.CV 78%

Dynamic Reflections: Probing Video Representations with Text Alignment

动态反射:通过文本对齐探测视频表示

Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。

Comments To appear at ICLR 2026. 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01706 2026-02-02 cs.CL cs.AI cs.LG 67%

Multi-Step Knowledge Interaction Analysis via Rank-2 Subspace Disentanglement

通过秩-2子空间解耦进行多步知识交互分析

Sekh Mainul Islam, Pepa Atanasova, Isabelle Augenstein

机构 * Department of Computer Science, University of Copenhagen, Copenhagen, Denmark(计算机科学系,哥本哈根大学,哥本哈根,丹麦)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种秩-2子空间方法,用于多步分析NLE中的知识交互,揭示PK和CK在不同生成中的对齐特性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22692 2026-02-02 cs.CL cs.AI cs.CR 62%

FNF: Functional Network Fingerprint for Large Language Models

FNF:大型语言模型的功能网络指纹

Yiheng Liu, Junhao Ning, Sichen Xia, Haiyang Sun, Yang Yang, Hanyang Chi, Xiaohui Gao, Ning Qiang, Bao Ge, Junwei Han, Xintao Hu

机构 * School of Automation, Northwestern Polytechnical University, Xi'an, China(自动化学院,西北工业大学,西安,中国) School of Physics and Information Technology, Shaanxi Normal University, Xi'an, China(物理与信息技术学院,陕西师范大学,西安,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 FNF通过功能网络活动一致性检测LLM来源,提供非侵入性的知识产权保护方法。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22657 2026-02-02 cs.CL cs.AI 62%

NAG: A Unified Native Architecture for Encoder-free Text-Graph Modeling in Language Models

NAG:一种用于语言模型中无编码文本图建模的统一原生架构

Haisong Gong, Zhibo Liu, Qiang Liu, Shu Wu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS), Beijing, China School of Advanced Interdisciplinary Sciences, UCAS, Beijing, China

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 NAG提出一种统一的原生架构,将图处理内化于语言模型,通过自注意力机制和位置ID校准实现结构依赖和等价性,提升文本图建模的连贯性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22042 2026-02-02 cs.CL cs.AI 62%

Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models

情感在哪里?:理解并表征大语言模型的情感潜在空间

Benjamin Reichman, Adar Avsian, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了大语言模型中情感的潜在空间结构,通过方向编码和跨语言一致性,展示了对情感的可控表征与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03267 2026-02-02 cs.LG cs.AI 62%

PT$^2$-LLM: Post-Training Ternarization for Large Language Models

PT²-LLM:大语言模型的后训练三元化

Xianglong Yan, Chengzhu Bao, Zhiteng Li, Tianao Zhang, Kaicheng Yang, Haotong Qin, Ruobing Xie, Xingwu Sun, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院) Tencent Hunyuan(腾讯文言)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 PT²-LLM通过后训练三元化技术,在降低内存成本的同时提升大语言模型的推理速度和效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏