arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8017 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8017 篇

2506.11402 2025-10-02 cs.LG cs.AI cs.CL 75%

LoRA Users Beware: A Few Spurious Tokens Can Manipulate Your Finetuned Model

Marcel Mateos Salles, Praney Goyal, Pradyut Sekhsaria, Hai Huang, Randall Balestriero

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 46 pages, 17 figures, 26 tables. Submitted for publication. for associated blog post, see https://pradyut3501.github.io/lora-spur-corr/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07448 2025-08-05 cs.LG cs.AI cs.CL 75%

LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation

Juzheng Zhang, Jiacheng You, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00234 2025-07-02 cs.LG cs.AI cs.CL 75%

Interpretable AI for Time-Series: Multi-Model Heatmap Fusion with Global Attention and NLP-Generated Explanations

Jiztom Kavalakkatt Francis, Matthew J Darr

机构 * Department of Electrical and Computer Engineering, Iowa State University, Ames, 50011 IA USA(电气与计算机工程系,爱荷华州立大学) Department of Agricultural Biosystem Engineering, Iowa State University, Ames,IA 50011 USA(农业生物系统工程系,爱荷华州立大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02460 2025-06-12 cs.CL cs.AI cs.LG 75%

Code-Switching Curriculum Learning for Multilingual Transfer in LLMs

Haneul Yoo, Cheonbok Park, Sangdoo Yun, Alice Oh, Hwaran Lee

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear in Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15054 2025-06-10 cs.CL cs.AI cs.LG 75%

Unraveling Token Prediction Refinement and Identifying Essential Layers in Language Models

Jaturong Kongmanee

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08066 2025-04-14 cs.AI cs.CL cs.LG 75%

The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search

Yutaro Yamada, Robert Tjarko Lange, Cong Lu, Shengran Hu, Chris Lu, Jakob Foerster, Jeff Clune, David Ha

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10477 2024-02-20 cs.CL cs.AI cs.LG 75%

Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis

Kai Chen, Chunwei Wang, Kuo Yang, Jianhua Han, Lanqing Hong, Fei Mi, Hang Xu, Zhengying Liu, Wenyong Huang, Zhenguo Li, Dit-Yan Yeung, Lifeng Shang, Xin Jiang, Qun Liu

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11656 2026-08-13 cs.LG 新提交 74%

Continuous-Latent Predictive Modeling with Semantic Alignment for EEG-Language Foundation Models

面向EEG-语言基础模型的语义对齐连续隐式预测建模

Myeong-Ju Cho, Hye-Bin Shin, Seo-Hyun Lee, Seong-Whan Lee

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出BLPM模型,通过CELP编码器与MQSD模块对齐EEG语义,解决EEG基础模型预训练的关键挑战,在多基准任务中实现良好泛化。

Comments 19 pages, 3 figures; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27739 2026-07-31 cs.IR cs.CL cs.HC 新提交 74%

Measuring Alignment With Reader Highlights Net of Position and Length

通过读者标注的位置和长度网络测量对齐度

Kazuki Nakayashiki, Keisuke Watanabe

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 该研究针对上下文压缩评估的混淆问题,提出匹配位置长度的方法,发现语言模型重要性排名对齐度优于人类读者外的基准,且前期某结论无法在当前语料库复现。

Comments 15 pages, 7 tables. Analysis code and de-identified artifacts included as ancillary files; five of six scripts reproduce the paper's numbers from the shipped artifacts alone. Reports claims from our own prior work that this corpus does not reproduce, and lists twelve claims withdrawn during internal adversarial review in Appendix A

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07407 2026-07-28 cs.LG 版本更新 74%

Emergent Symbolic Structure in Health Foundation Models: Extraction, Alignment, and Cross-Modal Transfer

健康基础模型中的涌现符号结构:提取、对齐与跨模态迁移

Gajendra Katuwal, Advait Koparkar, Salar Abbaspourazad, Anshuman Mishra, Sarvesh Kirthivasan

机构 * Apple(苹果公司)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出一种训练后框架,通过分解冻结嵌入以提取可解释的符号,用于对齐嵌入空间。在PPG和加速度计数据上验证,发现符号能选择性关联健康状况和生理属性,并支持跨模态迁移。

Comments 8 pages, Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, 4 main figures

Journal ref Mechanistic Interpretability Workshop at the 43 rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19935 2026-07-23 cs.AI 新提交 74%

MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

MOF-Sleuth:用于可解释细粒度MOF CIF审核的工具基础奖励对齐

Yu Liu, Zhiwei Yang, Diandian Guo, Kun Peng, Fangfang Yuan, Cong Cao, Chaozhuo Li, Zhiyuan Ma, Yanbing Liu, Guobin Zhao

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 研究针对MOF数据库CIF输入错误影响下游结果及人工检查的问题,提出MOF-Sleuth,通过强化引导CIF审核代理的两个模块,利用奖励引导强化学习将工具测量转化为监督,提升检测、归因及解释质量,在多基准测试中性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04081 2026-07-23 cs.CL 版本更新 74%

Abstraction Induces the Brain Alignment of Language and Speech Models

抽象诱导语言和语音模型的脑对齐

Emily Cheng, Aditya R. Vaidya, Richard Antonello

机构 * The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校) Zuckerman Mind Brain Behavior Institute, Columbia University, USA(祖克曼心智-大脑-行为研究所,哥伦比亚大学)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 研究发现语言和语音模型通过共享的意义抽象与大脑对齐,中间层的高内在维度和语义内容增强了大脑预测性。

Comments ICML 2026 camera-ready version

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02668 2026-07-07 cs.CL 新提交 74%

Improving LLMs via Validator-to-Generator Alignment

通过验证器与生成器对齐改进大语言模型

Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk, Greg Durrett

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Departments of Linguistics and Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校语言学与计算机科学系) Department of Computer Science & Center for Data Science, New York University(纽约大学计算机科学系及数据科学中心)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 研究大语言模型不一致问题,提出基于话语频率的生成器-验证器一致性新公式,介绍\FCPA方法,实验表明该方法能提升生成器性能及两者一致性,且保持验证器质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30009 2026-06-30 cs.CL 74%

Node-to-Neighborhood Semantic Consistency: Text-Topology Alignment for TAGs Anomaly Detection

节点到邻域语义一致性:文本属性图异常检测中的文本-拓扑对齐

Bochen Lin, Jianxiang Yu, Jiayi Wu, Lin Qi, Huang Lu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华大学数据科学与工程学院) WeChat, Tencent(微信、腾讯)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 针对文本属性图异常检测中文本语义与拓扑关系不对齐的问题,提出N2NSC框架,通过双融合路径捕获节点与邻域的语义一致性,在八个数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06652 2026-06-12 cs.CV cs.AI 版本更新 74%

PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment

PaLMR: 通过多模态过程对齐实现忠实视觉推理

Yantao Li, Qiang Hui, Chenyang Yan, Kanzhi Cheng, Fang Zhao, Chao Tan, Huanling Gao, Jianbing Zhang, Kai Wang, Xinyu Dai, Shiguo Lian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Data Science & Artificial Intelligence Research Institute, China Unicom(中国unicom数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国unicom数据智能)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 提出PaLMR框架,通过感知对齐数据层和过程对齐优化层,减少推理幻觉并提升视觉推理忠实度,在多个基准上取得最优结果。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06892 2026-06-08 cs.LG 新提交 74%

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP:面向可扩展预训练数据归因的几何感知残差对齐

Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26878 2026-05-27 cs.AI 74%

Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation

多方利益相关者LLM对齐:从聚合中分解估计

Lulu Zheng, Wenjin Yang, Xiangwen Zhang, Rong Yin, Yulan Hu, Zheng Pan, Xin Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) Beihang University(北京航空航天大学)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 针对多方利益相关者任务中用户偏好冲突的问题,提出DecompR方法,通过反事实校准权重固定查询结构,独立估计角色效用,消除候选依赖的权重漂移并降低估计噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26004 2026-05-26 cs.CV cs.CL 74%

MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models

MAGIC: 面向视觉语言模型的多模态对齐与接地感知指令核心集

Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 提出MAGIC方法,利用预训练VLM中的多模态增益、桥接相关性和技能神经元签名三种内在信号,通过无训练、前向传播的核心集选择,构建紧凑且行为保真的子集用于多模态指令微调,在20%预算下达到甚至超越全微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12056 2026-05-13 cs.AI 74%

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率

Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20032 2026-04-30 cs.CV cs.LG cs.RO 74%

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

ViTaPEs: 视觉触觉位置编码用于多模态转换器中的跨模态对齐

Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert

机构 * Chair of Cyber-Physical Systems(感知系统教授席位) Institute of Machine Learning and Neural Computation(机器学习与神经计算研究所) Technical University of Leoben(莱比锡技术大学) Graz University of Technology(格拉茨技术大学)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 ViTaPEs通过两阶段位置注入学习任务无关的视觉触觉表示,提升多模态对齐性能,实验证明其在多种任务和领域中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10599 2026-04-28 cs.AI 74%

Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models

自适应多子空间表示引导用于大语言模型中的属性对齐

Xinyan Jiang, Lin Zhang, Jiayi Zhang, Qingsong Yang, Guimin Hu, Di Wang, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽德人工智能大学) Data Analytics (PRADA) Lab(数据分析(PRADA)实验室) King Abdullah University of Science(卡瓦尔大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences, Shanghai, China(上海先进研究院,中国科学院,上海,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) University of Copenhagen, Copenhagen, Denmark(哥本哈根大学,哥本哈根,丹麦) University of Science(科学大学)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 本文提出MSRS框架,通过子空间表示微调实现多属性引导,减少属性干扰并提升行为控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19716 2026-04-22 cs.CL 74%

Discovering a Shared Logical Subspace: Steering LLM Logical Reasoning via Alignment of Natural-Language and Symbolic Views

发现共享的逻辑子空间:通过自然语言和符号视角的对齐来引导LLM逻辑推理

Feihao Fang, My T. Thai, Yuanyuan Lei

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Computer & Information Science and Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 本文提出通过对齐自然语言和符号视角的逻辑子空间来提升LLM的多步逻辑推理能力,通过实验验证该方法在四个基准测试中提升了准确率并具备良好的泛化能力。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19172 2026-04-22 cs.AI 74%

Reasoning-Aware AIGC Detection via Alignment and Reinforcement

基于对齐与强化的学习的推理感知AIGC检测

Zhao Wang, Max Xiong, Jianxun Lian, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Duke University(杜克大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 本文提出REVEAL框架,通过生成可解释的推理链实现AIGC检测,采用两阶段训练策略提升准确性和逻辑一致性,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13883 2026-04-16 cs.CV cs.LG 74%

Context Sensitivity Improves Human-Machine Visual Alignment

上下文敏感性提升人机视觉对齐

Frieda Born, Tom Neuhäuser, Lukas Muttenthaler, Brett D. Roads, Bernhard Spitzer, Andrew K. Lampinen, Matt Jones, Klaus-Robert Müller, Michael C. Mozer

机构 * Technische Universität Berlin(技术大学柏林) BIFOLD Max Planck Institute for Human Development(人类发展马克斯·普朗克研究所) Aignostics Helmholtz Munich(慕尼黑海德堡研究所) Technical University of Munich(慕尼黑技术大学) University College London(伦敦大学学院) Technische Universität Dresden(德累斯顿技术大学) Google DeepMind(谷歌DeepMind) University of Colorado Boulder(科罗拉多大学博尔德分校) Korea University(韩国大学) Max Planck Institute for Informatics(信息马克斯·普朗克研究所)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出一种基于神经网络嵌入的上下文敏感相似性计算方法,用于解决三元组异类识别任务,通过锚图提供同时上下文,使模型在异类识别准确率上提升15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13561 2026-04-16 cs.CV cs.AI 74%

CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling

CLIP架构用于腹部CT图像-文本对齐和零样本学习:研究批量组成和数据缩放

Shivika, Kartik Bose, Pankaj Gupta

机构 * Department of Radiodiagnosis(放射诊断部门)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 本文研究了CLIP架构在腹部CT图像-文本对齐和零样本学习中的效果,探讨了训练批量组成和数据缩放的影响,发现随机采样和交替批次比人工类平衡更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07837 2026-04-10 cs.AI 74%

SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility

SPARD:通过整合奖励动态和数据效用实现强化学习对齐的自适应课程

Xuyang Zhi, Peilun zhou, Chengqiang Lu, Hang Lv, Yiwei Liang, Rongyang Zhang, Yan Gao, YI WU, Yao Hu, Hongchao Gu, Defu Lian, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 SPARD通过动态调整多目标奖励权重和数据重要性,提升强化学习对齐效果,实验显示在多个基准上显著增强模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03714 2026-03-20 cs.CV cs.LG 74%

Universal Sparse Autoencoders: Interpretable Cross-Model Concept Alignment

通用稀疏自编码器:可解释的跨模型概念对齐

Harrish Thasarathan, Julian Forsyth, Thomas Fel, Matthew Kowal, Konstantinos G. Derpanis

机构 * York University(约克大学) University of Toronto(多伦多大学) Kempner Institute, Harvard University(哈佛大学凯姆纳研究所) Vector Institute(向量研究所) Samsung AI Centre(三星人工智能中心) Trajectory Labs(轨迹实验室)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出通用稀疏自编码器(USAEs),用于揭示并对齐多个预训练深度神经网络中的可解释概念。通过训练一个能重构多个模型内部激活的稀疏自编码器,USAEs发现跨任务、架构和数据集的共同因素概念,为多模型AI系统提供新的可解释分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16894 2026-03-04 cs.CL 74%

Make LoRA Great Again: Boosting LoRA with Adaptive Singular Values and Mixture-of-Experts Optimization Alignment

让LoRA更出色:通过自适应奇异值和专家混合优化对齐提升LoRA

Chenghao Fan, Zhenyi Lu, Sichen Liu, Chengfeng Gu, Xiaoye Qu, Wei Wei, Yu Cheng

机构 * School of Computer Science \& Technology, Huazhong University of Science The Chinese University of Hong Kong Zhejiang University

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 GOAT通过自适应奇异值和专家混合优化对齐提升LoRA性能,实现在多个任务上的最优表现。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22879 2026-02-27 cs.AI 74%

Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic Space

基于大语言模型的知识追踪:通过超几何空间中的LLM-学生层次行为对齐

Xingcheng Fu, Shengpeng Wang, Yisen Gao, Xianxian Li, Chunpei Li, Qingyun Sun, Dongran Yu

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 本文提出L-HAKT框架,通过超几何空间中的层次行为对齐,提升知识追踪对认知状态层次演化和个性化问题难度感知的建模能力。

Comments 9 pages, 6 figures, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18868 2026-02-24 math.OC cs.LG 74%

Limits of Convergence-Rate Control for Open-Weight Safety

开放权重安全性的收敛速率控制极限

Domenic Rosati, Xijie Zeng, Hong Huang, Sebastian Dionicio, Subhabrata Majumdar, Frank Rudzicz, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) Vector Institute(向量研究所) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 其他安全 :safety(title);分类 cs.LG

AI总结 本文提出SpecDef算法,通过谱重参数化在非对抗性设置中减缓优化收敛速度,并揭示了对抗性环境下收敛速率控制方法的理论极限。

Comments Submitted to ICML 2026. 13 figures, 30 tables

详情

展开后加载摘要…

URL PDF HTML 收藏