arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 87 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 36 篇

2506.02873 2026-02-17 cs.AI 57%

It's the Thought that Counts: Evaluating the Attempts of Frontier LLMs to Persuade on Harmful Topics

想法才是关键:评估前沿大语言模型在有害话题上的说服尝试

Matthew Kowal, Jasper Timm, Jean-Francois Godbout, Thomas Costello, Antonio A. Arechar, Gordon Pennycook, David Rand, Adam Gleave, Kellin Pelrine

机构 * Université de Montréal, MILA(蒙特利尔大学,MILA) Carnegie Mellon University(卡内基梅隆大学) MIT, Center for Research and Teaching in Economics(麻省理工学院,经济研究与教学中心) Cornell University, University of Regina(康奈尔大学, Regina大学) Cornell University, MIT(康奈尔大学,麻省理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出APE基准测试,评估前沿大语言模型在有害话题上的说服意愿,揭示模型在有害情境下尝试说服的倾向及风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13699 2026-02-17 cs.LG 57%

Attention Head Entropy of LLMs Predicts Answer Correctness

LLMs注意力头熵预测答案正确性

Sophie Ostmeier, Brian Axelrod, Maya Varma, Asad Aali, Yabin Zhang, Magdalini Paschali, Sanmi Koyejo, Curtis Langlotz, Akshay Chaudhari

机构 * Stanford University(斯坦福大学) University Hospital Zurich(苏黎世大学医院) Microsoft AI(微软人工智能)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 LLMs注意力头熵预测答案正确性,通过注意力熵模式提升跨领域泛化能力,平均提升AUROC 8.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13320 2026-02-17 cs.AI 57%

Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol

工具使用LLM代理中的信息保真度:模型上下文协议的鞅分析

Flint Xiaofeng Fan, Cheston Tan, Roger Wattenhofer, Yew-Soon Ong

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种分析模型上下文协议中误差累积的理论框架,通过鞅分析证明误差呈现线性增长并受$O(\sqrt{T})$约束,实验验证了语义加权和周期性再定位对误差控制的有效性。

Comments Full working version of an extended abstract accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13291 2026-02-17 cs.MA astro-ph.IM cs.AI 57%

Agent Mars: Multi-Agent Simulation for Multi-Planetary Life Exploration and Settlement

Agent Mars: 多智能体模拟用于多行星生命探索与定居

Ziyang Wang

机构 * IEEE

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Agent Mars通过多智能体模拟框架,研究多行星生命探索中的协调机制与性能评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13751 2026-02-17 cs.CV 50%

T2MBench: A Benchmark for Out-of-Distribution Text-to-Motion Generation

T2MBench:一种用于分布外文本到动作生成的基准测试

Bin Yang, Rong Ou, Weisheng Xu, Jiaqi Xiong, Xintao Li, Taowen Wang, Luyu Zhu, Xu Jiang, Jing Tan, Renjing Xu

机构 * The Hong Kong University of Science(香港科学与技术大学) University of Oxford, Oxford, United Kingdom(牛津大学)

专题命中 安全评测 :alignment(abstract)

AI总结 T2MBench提出了一种用于评估分布外文本到动作生成的基准测试,通过全面分析基础模型和构建专用数据集,揭示现有方法在复杂场景下的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16505 2026-02-17 cs.CV 50%

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

PRISMM-Bench: 一种基于同行评审的多模态不一致基准

Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校) Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 安全评测 :trustworthy(abstract)

AI总结 PRISMM-Bench是首个基于同行评审标记的多模态不一致基准,通过整理384个不一致点,设计三个任务评估模型跨模态检测和推理能力,揭示了多模态科学推理的挑战。

Comments Accepted at ICLR 2026. Project page https://da-luggas.github.io/prismm-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15026 2026-02-17 cs.CE 50%

Deep Generative Models in Condition and Structural Health Monitoring: Opportunities, Limitations and Future Outlook

深度生成模型在条件与结构健康监测中的应用:机遇、局限与未来展望

Xin Yang, Chen Fang, Yunlai Liao, Jian Yang, Konstantinos Gryllias, Dimitrios Chronopoulos

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文探讨深度生成模型在条件与结构健康监测中的应用,分析其优势与局限,并提出未来研究方向。

Comments 70 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02054 2026-02-17 cs.HC 50%

Designing Staged Evaluation Workflows for LLMs: Integrating Domain Experts, Lay Users, and Model-Generated Evaluation Criteria

为大型语言模型设计分阶段评估流程:整合领域专家、普通用户和模型生成的评估标准

Annalisa Szymanski, Simret Araya Gebreegziabher, Oghenemaro Anuyah, Ronald A. Metoyer, Toby Jia-Jun Li

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出了一种分阶段的评估流程设计方法,结合领域专家、普通用户和模型生成的评估标准,以提高LLM评估的效率和准确性。

Comments To be published in CHI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13536 2026-02-17 cs.ET 50%

Robustness Verification of Binary Neural Networks: An Ising and Quantum-Inspired Framework

二进制神经网络的鲁棒性验证:一种Ising和量子启发框架

Rahul Singh, Seyran Saeedi, Zheng Zhang

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种受Ising和量子启发的框架,用于验证二进制神经网络对对抗攻击的鲁棒性,通过转换为QUBO问题并利用量子计算技术实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00787 2026-02-17 cs.CV 50%

Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models

基于CLIP引导的多模态扩散模型的图像到脑信号生成用于视觉假体

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Guoxu Zhou, Boyu wang, Jian Zhu, Jinyi Long

机构 * Jinan University, Guangzhou, China Department of Rehabilitation Medicine, The First Affiliated Hospital of Jinan University, Guangzhou, China Western University, Ontario, Canada Guangdong University of Technology, Guangzhou, China Tsinghua University, Beijing, China

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出基于CLIP引导的多模态扩散模型,实现图像到脑信号的转换,通过交叉注意力机制和空间-时间位置编码生成生物合理的脑信号。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2602.13246 2026-02-17 cs.CY cs.AI 79%

Global AI Bias Audit for Technical Governance

全球人工智能偏见审计用于技术治理

Jason Hung

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过全球人工智能数据集对Llama-3 8B模型进行压力测试,揭示了全球南北在人工智能技术知识和信息获取上的显著差距,呼吁更包容的数据表示以促进全球AI治理。

Comments 16 pages, 5 graphs, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14606 2026-02-17 cs.MA cs.AI cs.CE 70%

Towards Selection as Power: Bounding Decision Authority in Autonomous Agents

迈向选择作为权力:自主代理中决策权威的边界

Jose Manuel de la Chica Rodriguez, Juan Manuel Vera Díaz

机构 * AI Lab, Grupo Santander Madrid, Spain(AI实验室,西班牙 Grupo Santander 马德里)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种治理架构,通过机械机制限制自主代理的选择权,以防止确定性结果并提升可审计性,重新定义治理为受限制的因果权力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14158 2026-02-17 cs.CL cs.AI cs.MA 62%

A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing

面向医疗AI的多智能体框架:利用微调的GPT、LLaMA和DeepSeek R1进行基于证据和偏见意识的临床查询处理

Naeimeh Nourmohammadi, Md Meem Hossain, The Anh Han, Safina Showkat Ara, Zia Ush Shamszaman

机构 * Department of Computing Games, Teesside University, Middlesbrough, United Kingdom Centre for Digital Innovation, Teesside University, Middlesbrough, United Kingdom Faculty of Business \& Technology, University of Sunderland, Sunderland, United Kingdom

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多智能体框架,利用微调的GPT、LLaMA和DeepSeek R1,结合证据检索和偏见检查,提升医疗问答的可靠性与准确性。

Comments 27 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13253 2026-02-17 cs.CY cs.AI 62%

Implicit Bias in LLMs for Transgender Populations

LLMs对跨性别人群的隐性偏见

Micaela Hirsch, Marina Elichiry, Blas Radi, Tamara Quiroga, David Restrepo, Luciana Benotti, Veronica Xhardez, Jocelyn Dunstan, Enzo Ferrante

机构 * Instituto de Ciencias de la Computación (UBA-CONICET)(计算机科学研究所(UBA-CONICET)) Hospital Dr. Lucio Melendez(Lucio Melendez医院) Universidad de Buenos Aires(布宜诺斯艾利斯大学) Universidad Católica de Chile(智利天主大学) MICS, CentraleSupélec - Université Paris-Saclay(MICS,CentraleSupélec-巴黎萨克雷大学) Universidad Nacional de Córdoba(科迪利亚国家大学) Fundación Vía Libre(自由之路基金会) CIECTI

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究揭示了LLMs对跨性别人群的隐性偏见,通过词语关联测试和医疗预约分配任务发现LLMs在多个类别中存在负面关联,并指出需研究以减少LLMs中的刻板印象偏见,确保医疗应用中的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 13 篇

2602.14471 2026-02-17 cs.MA cs.AI cs.GT cs.LG 81%

Socially-Weighted Alignment: A Game-Theoretic Framework for Multi-Agent LLM Systems

社交加权对齐:多智能体大语言模型系统的博弈论框架

Furkan Mumcu, Yasin Yilmaz

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出社交加权对齐框架,通过引入社交权重解决多智能体LLM系统中的个体理性与集体稳定矛盾,通过理论分析和模拟验证了关键阈值的存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13857 2026-02-17 cs.LG eess.SP 79%

sleep2vec: Unified Cross-Modal Alignment for Heterogeneous Nocturnal Biosignals

sleep2vec:用于异构夜间生物信号的统一跨模态对齐

Weixuan Yuan, Zengrui Jin, Yichen Wang, Donglin Xie, Ziyi Ye, Chao Zhang, Xuesong Chen

机构 * Five Seasons Medical(五 Seasons 医疗) Tsinghua University(清华大学) Beijing Key Laboratory for Sleep Breathing Disorder(北京睡眠呼吸障碍重点实验室) Peking University(北京大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 sleep2vec通过统一跨模态对齐和原理化缩放,实现了对异构夜间生物信号的高效、通用建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14777 2026-02-17 cs.CL cs.LG 73%

Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment

涌现性错位语言模型表现出会随后续重新对齐而变化的行为自我意识

Laurène Vaugrante, Anietta Weckauff, Thilo Hagendorff

机构 * Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart, Stuttgart, Germany(智能系统反思交流论坛,斯图加特大学,斯图加特,德国)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究发现,经过特定微调的LLMs能自我评估其行为错位程度,表明模型具备行为自我意识并能反映其实际对齐状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16905 2026-02-17 cs.LG cs.AI 73%

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

GRIP:通过几何路由约束实现混合专家的算法无关机器反学习

Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Tsinghua University(清华大学) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00973 2026-02-17 cs.CR cs.AI eess.SP 70%

Keys in the Weights: Transformer Authentication Using Model-Bound Latent Representations

权重中的钥匙:使用模型绑定的潜在表示进行变换器认证

Ayşe S. Okatan, Mustafa İlhan Akbaş, Laxima Niure Kandel, Berker Peköz

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出MoBLE,一种基于模型绑定的潜在表示变换器认证方法,通过零次解码不可转移性实现身份验证,适用于安全关键领域。

Comments Cite as A. S. Okatan, M. I. Akbas, L. N. Kandel, and B. Pekoz, "Keys in the weights: Transformer authentication using model-bound latent representations," in Proc. 2025 Cyber Awareness and Research Symp. (IEEE CARS 2025), Grand Forks, ND, Oct. 2025, pp. 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09982 2026-02-17 cs.CL cs.AI 62%

Context Volume Drives Performance: Tackling Domain Shift in Extremely Low-Resource Translation via RAG

上下文体积驱动性能:通过RAG解决极低资源翻译中的领域偏移

David Samuel Setiawan, Raphaël Merx, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 通过RAG方法,利用检索增强生成技术,在极低资源翻译中有效缓解领域偏移问题,恢复性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14229 2026-02-17 cs.AI cs.ET cs.LG 62%

CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments

CORPGEN:在多时间尺度任务环境中通过自主数字员工模拟企业环境

Abubakarr Jaye, Nigel Boachie Kumankumah, Chidera Biringa, Anjel Shaileshbhai Patel, Sulaiman Vesal, Dayquan Julienne, Charlotte Siska, Manuel Raúl Meléndez Luján, Anthony Twum-Barimah, Mauricio Velazco, Tianwei Chen

机构 * Microsoft Corporation(微软公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CorpGen通过分层规划、子代理隔离和分层内存等机制,在多时间尺度任务环境中实现自主数字员工的高效模拟,提升企业环境模拟的完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18702 2026-02-17 cs.LG cs.AI cs.AR 62%

From Fuzzy to Exact: The Halo Architecture for Infinite-Depth Reasoning via Rational Arithmetic

从模糊到精确:通过有理算术的Halo架构实现无限深度推理

Hansheng Ren

机构 * Hansheng Ren(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Halo架构通过有理算术实现无限深度推理,结合双环拓扑和精确推断单元,提升模型稳定性和效率,实现从模糊到精确的数学框架转型。

Comments Architecture update: Formalizes the Dual-Ring Topology and the Clean Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13248 2026-02-17 cs.AI cs.CL cs.RO 62%

X-Blocks: Linguistic Building Blocks of Natural Language Explanations for Automated Vehicles

X-Blocks: 自然语言解释的语义构建块用于自动驾驶车辆

Ashkan Y. Zadeh, Xiaomeng Li, Andry Rakotonirainy, Ronald Schroeter, Sebastien Glaser, Zishuo Zhu

机构 * Queensland University of Technology (QUT)(昆士兰科技大学) ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(农村和偏远地区自动化车辆培训中心)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 X-Blocks框架通过分层分析识别自动驾驶车辆自然语言解释的构建块,提供场景感知解释的设计原则,提升透明性和用户信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14428 2026-02-17 cs.CL 57%

LLM-Guided Knowledge Distillation for Temporal Knowledge Graph Reasoning

基于大语言模型的知识蒸馏的时序知识图谱推理

Wang Xing, Wei Song, Siyu Lin, Chen Wu, Man Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的知识蒸馏框架,用于提升时序知识图谱推理性能,通过引入大语言模型作为辅助指导者,实现更高效的模型压缩与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13954 2026-02-17 cs.SD cs.AI 57%

Eureka-Audio: Triggering Audio Intelligence in Compact Language Models

Eureka-Audio: 在紧凑语言模型中触发音频智能

Dan Zhang, Yishu Lei, Jing Hu, Shuwei He, Songhe Deng, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 Eureka-Audio通过紧凑架构和统一端到端设计,在低参数量下实现高性能音频理解,匹配甚至超越大模型表现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13758 2026-02-17 cs.CV cs.AI 57%

OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding

OmniScience: 一个大规模多模态数据集用于科学图像理解

Haoyi Tao, Chaozheng Huang, Nan Wang, Han Lyu, Linfeng Zhang, Guolin Ke, Xi Fang

机构 * DP Technology(DP技术)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 OmniScience是一个大规模多模态数据集,通过动态模型路由生成高信息密度的图像标题,提升多模态模型在科学图像理解上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14648 2026-02-17 cs.CV 50%

SketchingReality: From Freehand Scene Sketches To Photorealistic Images

SketchingReality: 从自由手场景草图到逼真图像

Ahmed Bourouis, Mikhail Bessmeltsev, Yulia Gryaditskaya

机构 * University of Surrey(塞拉利昂大学) Université de Montréal(蒙特利尔大学) Adobe Research(Adobe研究)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出了一种基于调制的方法,通过优先考虑草图的语义解释而非严格遵循边缘位置,实现了从自由手草图到逼真图像的生成,并在语义对齐和图像质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏