arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-02 至 2026-02-02 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 22 篇

2505.17652 2026-02-02 cs.LG cs.AI 81%

Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective

重新思考强化学习中用于大语言模型推理的采样标准:一种能力-难度对齐视角

Deyang Kong, Qi Guo, Xiangyu Xi, Wei Wang, Jingang Wang, Xunliang Cai, Shikun Zhang, Wei Ye

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CDAS方法,通过能力-难度对齐提升大语言模型推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22948 2026-02-02 cs.AI 79%

Alignment among Language, Vision and Action Representations

语言、视觉和动作表征的一致性

Nicola Milano, Stefano Nolfi

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过训练Transformer智能体执行自然语言指令,发现语言、视觉和动作表征在跨模态中呈现部分共享的语义结构,支持模态无关的语义组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22722 2026-02-02 cs.LG 79%

Local Intrinsic Dimension of Representations Predicts Alignment and Generalization in AI Models and Human Brain

表示的局部内在维度预测AI模型和人脑中的对齐和泛化

Junjie Yu, Wenxiao Ma, Chen Wei, Jianyu Zhang, Haotian Deng, Zihan Deng, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(生物医学工程系,南方科技大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 研究发现,AI模型和人脑的表示局部内在维度与对齐和泛化能力相关,且模型容量和数据规模增加可降低该维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09378 2026-02-02 cs.CL 79%

Can you map it to English? The Role of Cross-Lingual Alignment in Multilingual Performance of LLMs

能否映射到英语?跨语言对齐在大语言模型多语言性能中的作用

Kartik Ravisankar, Hyojung Han, Sarah Wiegreffe, Marine Carpuat

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本研究探讨了LLM中跨语言对齐对多语言NLU任务性能的影响,通过引入DALI指数验证了表示对齐在正确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02767 2026-02-02 cs.CV 78%

Dynamic Reflections: Probing Video Representations with Text Alignment

动态反射:通过文本对齐探测视频表示

Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。

Comments To appear at ICLR 2026. 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01706 2026-02-02 cs.CL cs.AI cs.LG 67%

Multi-Step Knowledge Interaction Analysis via Rank-2 Subspace Disentanglement

通过秩-2子空间解耦进行多步知识交互分析

Sekh Mainul Islam, Pepa Atanasova, Isabelle Augenstein

机构 * Department of Computer Science, University of Copenhagen, Copenhagen, Denmark(计算机科学系,哥本哈根大学,哥本哈根,丹麦)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种秩-2子空间方法,用于多步分析NLE中的知识交互,揭示PK和CK在不同生成中的对齐特性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22692 2026-02-02 cs.CL cs.AI cs.CR 62%

FNF: Functional Network Fingerprint for Large Language Models

FNF:大型语言模型的功能网络指纹

Yiheng Liu, Junhao Ning, Sichen Xia, Haiyang Sun, Yang Yang, Hanyang Chi, Xiaohui Gao, Ning Qiang, Bao Ge, Junwei Han, Xintao Hu

机构 * School of Automation, Northwestern Polytechnical University, Xi'an, China(自动化学院,西北工业大学,西安,中国) School of Physics and Information Technology, Shaanxi Normal University, Xi'an, China(物理与信息技术学院,陕西师范大学,西安,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 FNF通过功能网络活动一致性检测LLM来源,提供非侵入性的知识产权保护方法。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22657 2026-02-02 cs.CL cs.AI 62%

NAG: A Unified Native Architecture for Encoder-free Text-Graph Modeling in Language Models

NAG:一种用于语言模型中无编码文本图建模的统一原生架构

Haisong Gong, Zhibo Liu, Qiang Liu, Shu Wu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS), Beijing, China School of Advanced Interdisciplinary Sciences, UCAS, Beijing, China

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 NAG提出一种统一的原生架构,将图处理内化于语言模型,通过自注意力机制和位置ID校准实现结构依赖和等价性,提升文本图建模的连贯性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22042 2026-02-02 cs.CL cs.AI 62%

Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models

情感在哪里?:理解并表征大语言模型的情感潜在空间

Benjamin Reichman, Adar Avsian, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了大语言模型中情感的潜在空间结构,通过方向编码和跨语言一致性,展示了对情感的可控表征与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03267 2026-02-02 cs.LG cs.AI 62%

PT$^2$-LLM: Post-Training Ternarization for Large Language Models

PT²-LLM:大语言模型的后训练三元化

Xianglong Yan, Chengzhu Bao, Zhiteng Li, Tianao Zhang, Kaicheng Yang, Haotong Qin, Ruobing Xie, Xingwu Sun, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院) Tencent Hunyuan(腾讯文言)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 PT²-LLM通过后训练三元化技术,在降低内存成本的同时提升大语言模型的推理速度和效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02521 2026-02-02 cs.SD cs.AI cs.CL 62%

FLM-Audio: Natural Monologues Improves Native Full-Duplex Chatbots via Dual Training

FLM-Audio: 自然独白提升原生全双工聊天机器人通过双训练

Yiqun Yao, Xiang Li, Xin Jiang, Xuezhi Fang, Naitong Yu, Wenjia Ma, Aixin Sun, Yequan Wang

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 FLM-Audio通过双训练策略和连续独白提升全双工聊天机器人的响应质量和体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22949 2026-02-02 cs.CL cs.CR 57%

Autonomous Chain-of-Thought Distillation for Graph-Based Fraud Detection

基于图的欺诈检测的自主链式思维蒸馏

Yuan Li, Jun Hu, Bryan Hooi, Bingsheng He, Cheng Chen

机构 * National University of Singapore(新加坡国立大学) ByteDance Inc.(字节跳动公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 FraudCoT通过自主链式思维推理和高效联合训练策略,提升基于图的欺诈检测性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22851 2026-02-02 cs.CL 57%

When Meanings Meet: Investigating the Emergence and Quality of Shared Concept Spaces during Multilingual Language Model Training

意义交汇:探究多语言语言模型训练中共享概念空间的产生与质量

Felicia Körner, Max Müller-Eberstein, Anna Korhonen, Barbara Plank

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根IT大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过因果可解释方法探讨多语言语言模型训练中共享概念空间的产生与质量,发现早期出现并随训练细化,但语言依赖性显著,且翻译质量提升可能反映行为变化而非能力提升。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02452 2026-02-02 cs.CR cs.AI 57%

XAI-CF -- Examining the Role of Explainable Artificial Intelligence in Cyber Forensics

XAI-CF -- 探讨可解释人工智能在网络安全取证中的作用

Shahid Alam, Zeynep Altiparmak

机构 * Department of Information Security, College of Computer Science and Engineering, University of Ha’il, Ha’il, Saudi Arabia(信息安全系,计算机科学与工程学院,哈伊尔大学,沙特阿拉伯)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了可解释人工智能(XAI)在网络安全取证(CF)中的作用,强调了建立可信任的AI系统以提高公众接受度和法律合规性的重要性,并提出了XAI-CF的定义、挑战及解决方案。

Journal ref Engineering Applications of Artificial Intelligence, 167(3), 2026, 113892

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22439 2026-02-02 cs.CL 57%

Stop Jostling: Adaptive Negative Sampling Reduces the Marginalization of Low-Resource Language Tokens by Cross-Entropy Loss

停止推搡:自适应负采样减少交叉熵损失对低资源语言标记的边缘化

Galim Turumtaev

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出自适应负采样技术,通过减少交叉熵损失对低资源语言标记的边缘化影响,提升模型对低资源语言的表示能力。

Comments Accepted at LoResLM 2025 (COLING 2025 workshop). Oral presentation

Journal ref In Proceedings of the First Workshop on Language Models for Low-Resource Languages (LoResLM 2025), pages 373-386, Abu Dhabi, United Arab Emirates. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22284 2026-02-02 cs.LG 57%

Riemannian Lyapunov Optimizer: A Unified Framework for Optimization

Riemannian Lyapunov Optimizer:一种优化的统一框架

Yixuan Wang, Omkar Sudhir Patil, Warren E. Dixon

机构 * Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) University of Florida(佛罗里达大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 Riemannian Lyapunov Optimizer通过控制理论框架统一优化算法,提供稳定有效的优化器设计方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12243 2026-02-02 cs.CV cs.AI 57%

Less is More: Label-Guided Summarization of Procedural and Instructional Videos

少即是多:基于标签的程序性和教学视频摘要

Shreya Rajpal, Michal Golovanevsky, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Vellore Institute of Technology(维洛雷理工学院) Brown University(布朗大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06777 2026-02-02 cs.CV cs.AI 57%

MolX: Enhancing Large Language Models for Molecular Understanding With A Multi-Modal Extension

MolX: 通过多模态扩展增强大型语言模型的分子理解能力

Khiem Le, Zhichun Guo, Kaiwen Dong, Xiaobao Huang, Bozhao Nan, Roshni Iyer, Xiangliang Zhang, Olaf Wiest, Wei Wang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, IN, USA(诺丁汉大学) University of California, Los Angeles, CA, USA(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MolX通过多模态扩展提升LLM对分子的理解能力,利用SMILES和分子图提取细粒度特征,并结合分子指纹提升性能,有效提升分子相关任务表现。

Comments MLoG-GenAI@KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22927 2026-02-02 cs.RO cs.ET 50%

Toward Fully Autonomous Driving: AI, Challenges, Opportunities, and Needs

迈向完全自动驾驶:人工智能、挑战、机遇与需求

Lars Ullrich, Michael Buchholz, Klaus Dietmayer, Knut Graichen

机构 * Institute of Measurement, Control and Microtechnology(测量、控制与微技术研究所) Ulm University(乌尔姆大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文探讨了人工智能在完全自动驾驶中的挑战、机遇及需求,分析了AI在提升自动驾驶能力方面的潜力与限制。

Comments Published in IEEE Access, 29 January 2026

Journal ref IEEE Access, 29 January 2026, pp. 1--26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22919 2026-02-02 cs.SE 50%

A Serverless Edge-Native Data Processing Architecture for Autonomous Driving Training

用于自动驾驶训练的无服务器边缘原生数据处理架构

Fabian Bally, Michael Schötz, Thomas Limbrunner

专题命中 其他安全 :safety(abstract)

AI总结 本文提出Lambda框架,通过无服务器架构实现边缘计算中的实时数据处理,提升自动驾驶训练效率。

Comments Source code is available at https://github.com/LASFAS/jblambda

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27647 2026-02-02 cs.CV 50%

NegoCollab: A Common Representation Negotiation Approach for Heterogeneous Collaborative Perception

NegoCollab: 一种用于异构协作感知的共同表示协商方法

Congzhang Shao, Quan Yuan, Guiyang Luo, Yue Hu, Danni Wang, Yilin Liu, Rui Pan, Bo Chen, Jinglin Li

专题命中 其他安全 :alignment(abstract)

AI总结 NegoCollab通过协商共同表示方法解决异构协作感知中的领域差距问题,提升多智能体协作性能。

Comments 23 pages, Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18220 2026-02-02 cs.SD eess.AS 50%

LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech

LLM-ForcedAligner: 一种非自回归且准确的基于大语言模型的强制对齐器,适用于多语言和长文本语音

Bingshen Mu, Xian Shi, Xiong Wang, Hexin Liu, Jin Xu, Lei Xie

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 其他安全 :alignment(abstract)

AI总结 LLM-ForcedAligner通过非自回归方法实现多语言和长文本语音的准确强制对齐,显著减少时间偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏