arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7596 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7596 篇

2605.13930 2026-05-25 cs.LG cs.HC cs.NE 79%

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

基于稀疏自编码器的脑电图基础模型机制可解释性

William Lehn-Schiøler, Magnus Ruud Kjær, Rahul Thapa, Magnus Guldberg Pedersen, Anton Mosquera Storgaard, Nick Williams, Radu Gatej, Tue Lehn-Schiøler, Andreas Brink-Kjær, Sadasivan Puthusserypady, Sándor Beniczky, James Zou, Lars Kai Hansen

机构 * BrainCapture DTU Health Tech(技术大学丹麦健康技术) DTU Compute(技术大学丹麦计算) Department of Biomedical Data Science(生物医学数据科学系) Department of Computer Science(计算机科学系) Seer Medical(Seer医疗) Filadelfia Epilepsy Hospital(菲拉德尔菲亚癫痫医院) University Hospital of Copenhagen(哥本哈根大学医院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 通过TopK稀疏自编码器从三种EEG Transformer中提取稀疏特征字典,结合临床分类法评估单语义性和纠缠性,并引入概念引导分析目标与非目标区域,揭示模型表征失败和临床纠缠问题。

Comments Preprint. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22679 2026-05-22 cs.CV cs.LG 79%

Conceptualizing Embeddings: Sparse Disentanglement for Vision-Language Models

将嵌入概念化:面向视觉-语言模型的稀疏解缠

Piotr Kubaty, Patryk Marszałek, Łukasz Struski, Adam Wróbel, Jacek Tabor, Marek Śmieja

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(雅盖隆大学数学与计算机科学学院) Doctoral School of Exact and Natural Sciences, Jagiellonian University(雅盖隆大学精确与自然科学博士学校) Centre for Credible AI, Warsaw University of Technology(华沙技术大学可信人工智能中心)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出CEDAR方法,通过稀疏解缠技术在不增加维度的情况下揭示预训练嵌入的组成结构,从而提升视觉-语言模型的可解释性和与人类感知的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15151 2026-05-22 cs.SD cs.AI 79%

Exploring How Audio Effects Alter Emotion with Foundation Models

探索音频效果如何通过基础模型改变情感

Stelios Katsis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文研究音频效果如何通过基础模型影响情感,探讨了基础模型在分析音频效果与情绪关系中的作用,揭示了声音设计技术对感知影响的模式。

Comments https://github.com/stelioskt/audioFX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21391 2026-05-21 cs.CL 79%

Post-Hoc Understanding of Metaphor Processing in Decoder-Only Language Models via Conditional Scale Entropy

通过条件尺度熵理解解码器-only语言模型中的隐喻处理

Lawhori Chakrabarti, Jennifer Johnson-Leung, Bert Baumgaertner, Aleksandar Vakanski, Min Xian, Boyu Zhang

机构 * Department of Computer Science, University of Idaho(计算机科学系,爱达荷大学) Department of Mathematics and Statistical Science, University of Idaho(数学与统计科学系,爱达荷大学) Department of Politics and Philosophy, University of Idaho(政治与哲学系,爱达荷大学) Department of Nuclear Engineering and Industrial Management, University of Idaho(核工程与工业管理系,爱达荷大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了解码器-only语言模型中隐喻处理的机制,通过条件尺度熵(CSE)分析不同层位的频率尺度变化,发现隐喻性词 token 在连续层位上产生显著更高的频谱宽度,且该效应不受语义复杂度或命题内容影响,验证了多尺度协调作为隐喻语言处理的特征。

Comments 18 pages, 3 figures, submitted to ICPR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21288 2026-05-21 cs.LG 79%

A Mechanistic Study of Tabular Foundation Models

表格基础模型的机理研究

Marin Biloš, James T. Wilson, Anderson Schneider, Yuriy Nevmyvaka

机构 * Morgan Stanley(摩根大通)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究了不同架构的表格基础模型在分类和回归任务中的准确性收敛问题,揭示了模型内部算法、对称性来源以及扰动鲁棒性的机理,发现先前指出的表示崩溃并非实际问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20105 2026-05-20 cs.LG 79%

Optimal Representation Size: High-Dimensional Analysis of Pretraining and Linear Probing

最优表示尺寸:预训练和线性探测的高维分析

Valentina Njaradi, Clémentine Dominé, Rachel Swanson, Marco Mondelli, Andrew Saxe

机构 * Gatsby Computational Neuroscience Unit(Gatsby计算神经科学单元) University College London(伦敦大学学院) Institute of Science and Technology Austria(奥地利科学与技术研究所) Sainsbury Wellcome Centre(萨金斯-韦尔科姆中心)

专题命中 知识编辑与模型理解 :pretraining(title,abstract);分类 cs.LG

AI总结 本文研究了预训练和线性探测过程中的最优表示尺寸问题,通过高维分析揭示了表示维度、未标记和标记样本数量以及任务对齐性对训练和泛化误差的影响,提出了在不同预训练和下游数据条件下优化表示尺寸的条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22161 2026-05-20 cs.LG 79%

Causal Evidence that Language Models use Confidence to Drive Behavior

语言模型使用置信度驱动行为的因果证据

Dharshan Kumaran, Nathaniel Daw, Simon Osindero, Petar Veličković, Viorica Patraucean

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 研究探讨了语言模型是否利用置信度信号来控制行为,如决定回答或 abstain,通过四个阶段实验发现模型使用多维内部置信表示和阈值策略来实现 abstention,揭示了结构化的元认知控制机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10292 2026-05-20 cs.CV cs.AI 79%

Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models

自适应残差更新引导用于大型视觉语言模型中低开销幻觉抑制

Zhengtao Zou, Ya Gao, Jiarui Guan, Bin Li, Pekka Marttinen

机构 * Aalto University, Espoo, Finland(艾尔沃大学,芬兰 Espoo) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出RUDDER框架,通过创建持久视觉锚点来对抗视觉稀释,利用模型的prefill残差更新提取鲁棒证据方向,并通过自适应门控机制注入解码过程,有效抑制幻觉并保持高吞吐量。

Comments Accepted by ICML 2026; Code available at: https://github.com/Akko000/RUDDER-Residual-Update-Directed-DEcoding-Regulation-

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17765 2026-05-19 cs.LG 79%

AURORA: Contextual Orthogonalization for Geometric Representation Learning in Healthcare Foundation Models

AURORA:用于医疗基础模型中几何表示学习的上下文正交化

Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出AURORA框架,通过上下文潜在几何进行正交化,以解决医疗基础模型中潜在表示的语义模糊和上下文变化不稳定性问题,提升了模型在不同机构分布变化下的鲁棒性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19774 2026-05-12 cs.LG 79%

If Concept Bottlenecks are the Question, are Foundation Models the Answer?

如果概念瓶颈是问题,那么基础模型是答案吗?

Nicola Debole, Pietro Barbiero, Francesco Giannini, Andrea Passerini, Stefano Teso, Emanuele Marconato

机构 * DISI, University of Trento(特伦托大学DISI实验室) IBM Research Zurich(IBM瑞士苏黎世研究实验室) Faculty of Sciences, Scuola Normale Superiore(科学学院,正则大学) CIMeC, University of Trento(特伦托大学CIMeC实验室)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究了基础模型在概念瓶颈模型中的影响,发现其在不同任务中与专家标注存在差异,且概念准确性与质量不强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05045 2026-05-12 cs.CV cs.CL 79%

When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise

关系破裂:在旋转和噪声下的视觉语言模型关系幻觉分析

Philip Wootaek Shin, Ajay Narayanan Sridhar, Sivani Devarapalli, Rui Zhang, Jack Sampson, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了旋转和噪声对视觉语言模型关系推理的影响,发现轻微扰动显著降低模型性能,提示需更鲁棒的几何感知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09224 2026-05-12 cs.LG 79%

SMIXAE: Towards Unsupervised Manifold Discovery in Language Models

SMIXAE:朝向语言模型中无监督流形发现

Collin Francel

机构 * Department of Arts and Sciences, University of Alabama, Tuscaloosa, AL, United States(艺术与科学系,阿拉巴马大学,塔斯基吉,AL,美国)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 SMIXAE通过引入稀疏混合自编码器架构,解决传统自编码器无法直接建模多维特征的问题,实现在Gemma 2模型中有效学习和发现流形结构。

Comments 20 pages, 10 figures, 11 tables. Submitted to Mechanistic Interpretability Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09129 2026-05-12 cs.AI 79%

Data-driven Circuit Discovery for Interpretability of Language Models

数据驱动的电路发现用于语言模型的可解释性

Daking Rai, Mor Geva, Ziyu Yao

机构 * George Mason University(乔治·马歇尔大学) Tel Aviv University(特拉维夫大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出数据驱动电路发现方法,通过数据聚类发现多个电路,而非单一电路,提升模型内部机制的可解释性。

Comments 40 pages, 54 figures, 12 tables, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL 79%

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00607 2026-05-04 cs.CL eess.AS 79%

Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe

超越解码性:使用编码探针重建语言模型表示

Gaofei Shen, Martijn Bentum, Tom Lentz, Afra Alishahi, Grzegorz Chrupała

机构 * Tilburg University(蒂尔堡大学) Radboud University(拉德堡德大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出编码探针方法,用于重建语言模型内部表示,解决传统解码探针无法比较不同特征贡献和特征相关性影响的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25642 2026-04-29 cs.CV cs.AI 79%

Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models

预填充阶段干预用于缓解大视觉-语言模型中的幻觉

Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences(上海先进研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出PTI方法,在预填充阶段干预KV缓存以减少幻觉,通过模态感知方向修正错误表示,提升模型可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07802 2026-04-29 cs.CV cs.AI 79%

Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models

潜在异常知识挖掘:揭示视觉-语言模型中的稀疏敏感神经元

Shaotian Li, Shangze Li, Chuancheng Shi, Wenhua Wu, Yanqiu Wu, Xiaohan Yu, Fei Shen, Tat-Seng Chua

机构 * Macquarie University(麦考瑞大学) Nanjing University of Science and Technology(南京理工大学) The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出LAKE框架,通过挖掘视觉-语言模型中稀疏敏感神经元,实现异常检测的内在可解释性,实验表明其在工业基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14837 2026-04-28 cs.CL 79%

V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models

V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14888 2026-04-28 cs.CV cs.AI 79%

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

超越跨模态对齐:测量和利用模态差距在视觉-语言模型中

Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang

机构 * King’s College London(伦敦国王学院) University of Surrey(萨里大学) University of Oxford(牛津大学) MIT CSAIL(麻省理工学院CSAIL实验室) The Alan Turing Institute(阿兰·图灵研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。

Comments accepted by ACL26-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22166 2026-04-27 cs.CL 79%

Fine-Grained Analysis of Shared Syntactic Mechanisms in Language Models

语言模型中共享句法机制的细粒度分析

Ryoma Kumon, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) RIKEN(日本理化学研究所) Tohoku University(东北大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过细粒度分析探讨语言模型在不同句法结构中是否共享神经机制,发现填词-缺口依赖在早期至中期层有高度局部化的共享机制,而否定极性项目许可则无统一机制。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12430 2026-04-27 cs.CL 79%

System-Mediated Attention Imbalances Make Vision-Language Models Say Yes

系统介导的注意力失衡使视觉-语言模型倾向于说‘是’

Tsan Tsai Chan, Varsha Suresh, Anisha Saha, Michael Hahn, Vera Demberg

机构 * Saarland Informatics Campus, Saarland University, Germany(萨尔兰州信息学校区,萨尔兰州大学,德国) Max Planck Institute for Informatics, Germany(马克斯·普朗克信息研究所,德国)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了视觉-语言模型中系统介导的注意力失衡对‘是’偏见的影响,提出通过重新分配注意力以减少这种偏见,从而提升模型可靠性。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11020 2026-04-27 cs.CL 79%

From Interpretability to Performance: Optimizing Retrieval Heads for Long-Context Language Models

从可解释性到性能:优化长上下文语言模型的检索头

Youmi Ma, Naoaki Okazaki

机构 * Department of Computer Science, Institute of Science Tokyo(东京科学研究所计算机科学系)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 本文研究检索头如何提升长上下文语言模型性能,提出RetMask方法通过对比正常输出与屏蔽检索头的输出生成训练信号,显著提升生成和重排序性能,验证了检索头的功能作用。

Comments Findings of ACL 2026; Source code available at https://github.com/YoumiMa/RetMask

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17375 2026-04-21 cs.CV cs.AI 79%

When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models

当文本劫持视觉:基准测试与减轻文本叠加引起的视觉语言模型幻觉

Cui Yakun, Xingqun Qi, TianTian Geng, Yuyao Zhang, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Birmingham(伯明翰大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VisualTextTrap基准测试,通过大规模人工验证样本和定制评估指标,减轻文本叠加引起的幻觉问题,并提出VTHM-MoE框架以提升视觉-文本解耦能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17105 2026-04-21 cs.CL 79%

How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them

词法化如何限制语言模型中语音知识的表示以及如何改进

Disen Liao, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨词法化对文本模型语音知识表示的影响,提出STAD指标量化词法化偏差,并通过IPA基础微调方法提升语音相关任务性能。

Comments 18 pages, 7 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01302 2026-04-21 cs.CL cs.CE 79%

Aligning Language Models with Real-time Knowledge Editing

对齐语言模型与实时知识编辑

Chenming Tang, Yutong Yang, Kexue Wang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University School of Computer Science, Peking University(国家多媒体信息处理重点实验室,北京大学计算机学院,北京大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出CRAFT动态知识编辑数据集及KEDAS方法,通过多样编辑增强和自适应推理提升知识编辑性能,推动从静态更新向动态演化转变。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05547 2026-04-20 cs.CV cs.AI 79%

VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck

VIB-Probe:通过变分信息瓶颈检测和缓解视觉-语言模型中的幻觉

Feiran Zhang, Yixin Wu, Zhenghua Wang, Xiaohua Wang, Changze Lv, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院,上海,中国) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VIB-Probe框架,通过变分信息瓶颈理论检测和缓解视觉-语言模型中的幻觉,利用注意力头提取判别模式并过滤语义噪声,实验表明其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05722 2026-04-20 cs.LG physics.chem-ph 79%

Teaching Language Models Mechanistic Explainability Through MechSMILES

通过MechSMILES教会语言模型机制性可解释性

Théo A. Neukomm, Zlatko Jončev, Philippe Schwaller

机构 * Laboratory of Artificial Chemical Intelligence (LIAC), Institut des Sciences et Ingénierie Chimiques, Ecole Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland(人工化学智能实验室(LIAC)、化学与工程学院、瑞士联邦理工学院(EPFL)、拉沃斯纳1015号)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出MechSMILES框架,通过箭头推导法教会语言模型预测化学反应机制,实现了反应路径验证、原子映射和催化剂识别等能力,展示了在复杂机制预测任务中的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12260 2026-04-15 cs.AI q-bio.QM 79%

Mantis: A Foundation Model for Mechanistic Disease Forecasting

Mantis:一种用于机制性疾病预测的基础模型

Carson Dudley, Reiden Magdaleno, Christopher Harding, Ananya Sharma, Emily Martin, Marisa Eisenberg

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 Mantis通过机制性模拟训练,实现了在有限数据下对多种疾病、地区和结果的快速预测,展示了其在疾病预测中的广泛适用性和准确性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07886 2026-04-14 cs.CL 79%

Linear Representations of Hierarchical Concepts in Language Models

语言模型中层次概念的线性表示

Masaki Sakata, Benjamin Heinzerling, Takumi Ito, Sho Yokoi, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(理化学研究所) NINJAL(国立国語研究所) Langsmith Inc.(Langsmith公司) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究语言模型内部表示中层次关系的编码方式,通过训练特定层次和语义领域的线性变换,发现层次关系可线性恢复,且在低维子空间中呈现领域特异性。

Comments 27 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10299 2026-04-14 cs.CV cs.CL 79%

Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking

见善不为:通过对抗性注意力劫持使大视觉-语言模型失明以确保安全

Jingru Li, Wei Ren, Tianqing Zhu

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) City University of Macau(澳门城市大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出Attention-Guided Visual Jailbreaking方法,通过操控注意力模式规避安全对齐机制,减少梯度冲突并提高攻击成功率,揭示了安全失明的失败模式。

Comments Accepted to ACL 2026. Code: https://github.com/Landsayy/AttentionJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏