arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 13 篇

2602.14471 2026-02-17 cs.MA cs.AI cs.GT cs.LG 81%

Socially-Weighted Alignment: A Game-Theoretic Framework for Multi-Agent LLM Systems

社交加权对齐:多智能体大语言模型系统的博弈论框架

Furkan Mumcu, Yasin Yilmaz

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出社交加权对齐框架,通过引入社交权重解决多智能体LLM系统中的个体理性与集体稳定矛盾,通过理论分析和模拟验证了关键阈值的存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13857 2026-02-17 cs.LG eess.SP 79%

sleep2vec: Unified Cross-Modal Alignment for Heterogeneous Nocturnal Biosignals

sleep2vec:用于异构夜间生物信号的统一跨模态对齐

Weixuan Yuan, Zengrui Jin, Yichen Wang, Donglin Xie, Ziyi Ye, Chao Zhang, Xuesong Chen

机构 * Five Seasons Medical(五 Seasons 医疗) Tsinghua University(清华大学) Beijing Key Laboratory for Sleep Breathing Disorder(北京睡眠呼吸障碍重点实验室) Peking University(北京大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 sleep2vec通过统一跨模态对齐和原理化缩放,实现了对异构夜间生物信号的高效、通用建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14777 2026-02-17 cs.CL cs.LG 73%

Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment

涌现性错位语言模型表现出会随后续重新对齐而变化的行为自我意识

Laurène Vaugrante, Anietta Weckauff, Thilo Hagendorff

机构 * Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart, Stuttgart, Germany(智能系统反思交流论坛,斯图加特大学,斯图加特,德国)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究发现,经过特定微调的LLMs能自我评估其行为错位程度,表明模型具备行为自我意识并能反映其实际对齐状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16905 2026-02-17 cs.LG cs.AI 73%

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

GRIP:通过几何路由约束实现混合专家的算法无关机器反学习

Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Tsinghua University(清华大学) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00973 2026-02-17 cs.CR cs.AI eess.SP 70%

Keys in the Weights: Transformer Authentication Using Model-Bound Latent Representations

权重中的钥匙:使用模型绑定的潜在表示进行变换器认证

Ayşe S. Okatan, Mustafa İlhan Akbaş, Laxima Niure Kandel, Berker Peköz

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出MoBLE,一种基于模型绑定的潜在表示变换器认证方法,通过零次解码不可转移性实现身份验证,适用于安全关键领域。

Comments Cite as A. S. Okatan, M. I. Akbas, L. N. Kandel, and B. Pekoz, "Keys in the weights: Transformer authentication using model-bound latent representations," in Proc. 2025 Cyber Awareness and Research Symp. (IEEE CARS 2025), Grand Forks, ND, Oct. 2025, pp. 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09982 2026-02-17 cs.CL cs.AI 62%

Context Volume Drives Performance: Tackling Domain Shift in Extremely Low-Resource Translation via RAG

上下文体积驱动性能:通过RAG解决极低资源翻译中的领域偏移

David Samuel Setiawan, Raphaël Merx, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 通过RAG方法,利用检索增强生成技术,在极低资源翻译中有效缓解领域偏移问题,恢复性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14229 2026-02-17 cs.AI cs.ET cs.LG 62%

CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments

CORPGEN:在多时间尺度任务环境中通过自主数字员工模拟企业环境

Abubakarr Jaye, Nigel Boachie Kumankumah, Chidera Biringa, Anjel Shaileshbhai Patel, Sulaiman Vesal, Dayquan Julienne, Charlotte Siska, Manuel Raúl Meléndez Luján, Anthony Twum-Barimah, Mauricio Velazco, Tianwei Chen

机构 * Microsoft Corporation(微软公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CorpGen通过分层规划、子代理隔离和分层内存等机制,在多时间尺度任务环境中实现自主数字员工的高效模拟,提升企业环境模拟的完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18702 2026-02-17 cs.LG cs.AI cs.AR 62%

From Fuzzy to Exact: The Halo Architecture for Infinite-Depth Reasoning via Rational Arithmetic

从模糊到精确:通过有理算术的Halo架构实现无限深度推理

Hansheng Ren

机构 * Hansheng Ren(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Halo架构通过有理算术实现无限深度推理,结合双环拓扑和精确推断单元,提升模型稳定性和效率,实现从模糊到精确的数学框架转型。

Comments Architecture update: Formalizes the Dual-Ring Topology and the Clean Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13248 2026-02-17 cs.AI cs.CL cs.RO 62%

X-Blocks: Linguistic Building Blocks of Natural Language Explanations for Automated Vehicles

X-Blocks: 自然语言解释的语义构建块用于自动驾驶车辆

Ashkan Y. Zadeh, Xiaomeng Li, Andry Rakotonirainy, Ronald Schroeter, Sebastien Glaser, Zishuo Zhu

机构 * Queensland University of Technology (QUT)(昆士兰科技大学) ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(农村和偏远地区自动化车辆培训中心)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 X-Blocks框架通过分层分析识别自动驾驶车辆自然语言解释的构建块,提供场景感知解释的设计原则,提升透明性和用户信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14428 2026-02-17 cs.CL 57%

LLM-Guided Knowledge Distillation for Temporal Knowledge Graph Reasoning

基于大语言模型的知识蒸馏的时序知识图谱推理

Wang Xing, Wei Song, Siyu Lin, Chen Wu, Man Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的知识蒸馏框架,用于提升时序知识图谱推理性能,通过引入大语言模型作为辅助指导者,实现更高效的模型压缩与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13954 2026-02-17 cs.SD cs.AI 57%

Eureka-Audio: Triggering Audio Intelligence in Compact Language Models

Eureka-Audio: 在紧凑语言模型中触发音频智能

Dan Zhang, Yishu Lei, Jing Hu, Shuwei He, Songhe Deng, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 Eureka-Audio通过紧凑架构和统一端到端设计,在低参数量下实现高性能音频理解,匹配甚至超越大模型表现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13758 2026-02-17 cs.CV cs.AI 57%

OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding

OmniScience: 一个大规模多模态数据集用于科学图像理解

Haoyi Tao, Chaozheng Huang, Nan Wang, Han Lyu, Linfeng Zhang, Guolin Ke, Xi Fang

机构 * DP Technology(DP技术)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 OmniScience是一个大规模多模态数据集,通过动态模型路由生成高信息密度的图像标题,提升多模态模型在科学图像理解上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14648 2026-02-17 cs.CV 50%

SketchingReality: From Freehand Scene Sketches To Photorealistic Images

SketchingReality: 从自由手场景草图到逼真图像

Ahmed Bourouis, Mikhail Bessmeltsev, Yulia Gryaditskaya

机构 * University of Surrey(塞拉利昂大学) Université de Montréal(蒙特利尔大学) Adobe Research(Adobe研究)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出了一种基于调制的方法,通过优先考虑草图的语义解释而非严格遵循边缘位置,实现了从自由手草图到逼真图像的生成,并在语义对齐和图像质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏