arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-13 至 2026-02-13 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 15 篇

2602.11180 2026-02-13 cs.CL 90%

Mechanistic Interpretability for Large Language Model Alignment: Progress, Challenges, and Future Directions

大语言模型对齐的机制可解释性:进展、挑战与未来方向

Usman Naseem

机构 * Macquarie University(麦考瑞大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

AI总结 本文探讨了大语言模型对齐中机制可解释性的进展与挑战,提出未来研究方向,包括自动化可解释性、跨模型泛化和可解释性驱动的对齐技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20997 2026-02-13 cs.LG cs.AI cs.CL 89%

Binary Autoencoder for Mechanistic Interpretability of Large Language Models

二进制自编码器用于大型语言模型的机制可解释性

Hakaze Cho, Haolin Yang, Yanshu Li, Brian M. Kurkoski, Naoya Inoue

机构 * University of Chicago(芝加哥大学) Brown University(布朗大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出二进制自编码器,通过最小化minibatch熵促进特征稀疏性和独立性,用于大型语言模型的机制可解释性研究。

Comments 36 pages, 43 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11737 2026-02-13 cs.CV cs.CL 88%

Mask What Matters: Mitigating Object Hallucinations in Multimodal Large Language Models with Object-Aligned Visual Contrastive Decoding

关注关键要素:通过对象对齐的视觉对比解码缓解多模态大语言模型中的对象幻觉

Boqi Chen, Xudong Liu, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) Amazon(亚马逊) MBZUAI(穆罕默德·本·拉什德智能科学技术研究院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出了一种通过对象对齐的视觉对比解码缓解多模态大语言模型中对象幻觉的方法,具有计算开销低且兼容性强的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11167 2026-02-13 cs.CL cs.AI 86%

Visualizing and Benchmarking LLM Factual Hallucination Tendencies via Internal State Analysis and Clustering

通过内部状态分析和聚类可视化和评估大语言模型事实性幻觉倾向

Nathan Mao, Varun Kaushik, Shreya Shivkumar, Parham Sharafoleslami, Kevin Zhu, Sunishchal Dev

机构 * The Harker School(哈克尔学校) Monta Vista High School(蒙塔维斯高中) University of California Berkeley(加州大学伯克利分校) Algoverse AI Research(Algoverse AI研究)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过FalseCite数据集评估大语言模型在误导性引用下的事实性幻觉倾向,并利用内部状态分析和聚类揭示隐藏状态的特征。

Journal ref Proceedings of IJCNLP-AACL SRW 2025, pp. 289-298

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11246 2026-02-13 cs.LG cs.AI cs.CL cs.IT math.CO math.IT 82%

How Many Features Can a Language Model Store Under the Linear Representation Hypothesis?

在线性表示假设下,语言模型能存储多少特征?

Nikhil Garg, Jon Kleinberg, Kenny Peng

机构 * Cornell University(康奈尔大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究在线性表示假设下,探讨了语言模型存储特征的理论上限和下限,证明了神经元可存储指数级特征数量,并揭示了线性可访问性比线性表示更强的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09378 2026-02-13 cs.SD cs.AI cs.MM eess.AS 79%

Prevailing Research Areas for Music AI in the Era of Foundation Models

基础模型时代音乐AI的主流研究领域

Megan Wei, Mateusz Modrzejewski, Aswin Sivaraman, Dorien Herremans

机构 * Brown University(布朗大学) Warsaw University of Technology(华沙技术大学) Indiana University(印第安纳大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文探讨了基础模型时代音乐AI的研究领域,涵盖基础模型、多模态系统、数据集、效率、生成模型应用及版权问题,旨在揭示未来研究方向。

Journal ref Proceedings of Machine Learning Research, PMLR 303:1-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11166 2026-02-13 cs.CL cs.AI 79%

Small Updates, Big Doubts: Does Parameter-Efficient Fine-tuning Enhance Hallucination Detection ?

小更新,大怀疑:参数高效微调是否增强幻觉检测?

Xu Hu, Yifan Zhang, Songtao Wei, Chen Zhao, Qiannan Li, Bingzhe Li, Feng Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Baylor University(贝勒大学) The University of California, Davis(加州大学戴维斯分校)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究参数高效微调对幻觉检测的影响,通过实证分析发现PEFT增强了检测能力,且主要通过重塑不确定性编码而非注入新知识。

Comments 18 pages, 13 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11881 2026-02-13 cs.AI 77%

From Atoms to Trees: Building a Structured Feature Forest with Hierarchical Sparse Autoencoders

从原子到树:构建具有层次稀疏自编码器的结构化特征森林

Yifan Luo, Yang Zhan, Jiedong Jiang, Tianyang Liu, Mingrui Wu, Zhennan Zhou, Bin Dong

机构 * School of Mathematical Science, Peking University, Beijing, China(北京大学数学科学学院) Beijing International Center for Mathematical Research(北京国际数学研究中心) the New Cornerstone Science Laboratory, Peking University, Beijing, China(北京大学新基石科学实验室) Center for Machine Learning Research, Peking University, Beijing, China(北京大学机器学习研究中心) School of Information and Electronics, Beijing Institute of Technology, Beijing, China(北京理工大学信息与电子学院) Institute for Theoretical Sciences, Westlake University, Hangzhou, China(西湖大学理论科学研究院) School of Science, Westlake University, Hangzhou, China(西湖大学理学院) School of Informatics, University of Edinburgh, Edinburgh, UK(爱丁堡大学信息学院)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出层次稀疏自编码器HSAE,通过结构约束和随机扰动机制,联合学习LLM中的层次化特征结构,实现语义有意义的多尺度概念分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12058 2026-02-13 cs.SE cs.AI cs.FL 70%

ModelWisdom: An Integrated Toolkit for TLA+ Model Visualization, Digest and Repair

ModelWisdom: 一个集成工具包用于TLA+模型可视化、摘要与修复

Zhiyong Chen, Jialun Cao, Chang Xu, Shing-Chi Cheung

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ModelWisdom通过可视化、图优化、摘要和修复功能,提升TLA+模型检查的可解释性和可操作性。

Comments Accepted by FM 2026 Research Track (Tool)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09843 2026-02-13 cs.CV 67%

Kelix Technical Report

Kelix技术报告

Boyang Ding, Chenglong Chu, Dunju Zang, Han Li, Jiangxia Cao, Kun Gai, Muhao Wei, Ruiming Tang, Shiyao Wang, Siyang Mao, Xinchen Luo, Yahui Liu, Zhixin Ling, Zhuoran Yang, Ziming Li, Chengru Song, Guorui Zhou, Guowang Zhang, Hao Peng, Hao Wang, Jiaxin Deng, Jin Ouyang, Jinghao Zhang, Lejian Ren, Qianqian Wang, Qigen Hu, Tao Wang, Xingmei Wang, Yiping Yang, Zixing Zhang, Ziqi Wang

机构 * Kuaishou Technology(快手科技)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 Kelix是一种完全离散的自回归统一模型,旨在缩小离散和连续视觉表示之间的理解差距。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11169 2026-02-13 cs.CL cs.AI cs.LG 67%

Disentangling Direction and Magnitude in Transformer Representations: A Double Dissociation Through L2-Matched Perturbation Analysis

解构Transformer表示中的方向与幅度:通过L2匹配扰动分析的双重解离

Mangadoddi Srikar Vardhan, Lekkala Sai Teja

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示Transformer表示中方向与幅度在语言建模和语法处理中的不同作用,通过L2匹配扰动分析发现方向扰动影响注意力路径,幅度扰动影响语法判断,且解离依赖于架构选择。

Comments 15 pages, 7 figures. will Submit to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10437 2026-02-13 cs.LG cs.AI cs.CL 67%

Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features

控制强化学习:通过稀疏自编码器特征实现LLM的可解释性令牌级操控

Seonglae Cho, Zekun Wu, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CRL通过稀疏自编码器特征实现LLM的可解释性令牌级操控,提供动态干预探针与静态特征分析互补的机制可解释性工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11841 2026-02-13 cs.IR cs.AI cs.LG 62%

Improving Neural Retrieval with Attribution-Guided Query Rewriting

通过归因引导的查询重写改进神经检索

Moncef Garouani, Josiane Mothe

机构 * IRIT, UMR5505 CNRS Université Toulouse Capitole(IRIT,CNRS 5505 机构,图卢兹大学) IRIT, UMR5505 CNRS UT2J, Université de Toulouse(IRIT,CNRS 5505 机构,图卢兹大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出归因引导的查询重写方法,通过标记级解释指导LLM澄清模糊查询,提升神经检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07229 2026-02-13 cs.CL cs.LG cs.SD eess.AS 62%

How Does a Deep Neural Network Look at Lexical Stress in English Words?

深度神经网络如何感知英语单词的重音?

Itai Allouche, Itay Asael, Rotem Rousso, Vered Dassa, Ann Bradlow, Seung-Eun Kim, Matthew Goldrick, Joseph Keshet

机构 * Faculty of Electrical and Computer Engineering, Technion -- Israel Institute of Technology, Haifa, 3200003, Israel(电气与计算机工程学院,技术Ion -- 以色列理工学院,海法,3200003,以色列) Department of Linguistics, Northwestern University, Evanston, Illinois 60208, USA(语言学系,西北大学,埃文斯顿,伊利诺伊州60208,美国)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文研究深度神经网络如何通过频谱特性识别英语双音节词的重音,通过实验揭示模型对重音元音的共振峰特征的依赖。

Comments 11 pages, 5 figures, accepted to the Journal of the Acoustical Society of America (JASA)

Journal ref The Journal of the Acoustical Society of America. 159(2), 1348-1358 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12132 2026-02-13 cs.CL 57%

A Rule-based Computational Model for Gaidhlig Morphology

一种基于规则的盖尔语形态学计算模型

Peter J Barclay

机构 * 1 School of Computing, Engineering, \& the Built Environment Edinburgh Napier University, Scotland

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于规则的盖尔语形态学模型,利用维基词典数据构建规则库,以提升低资源语言处理的可解释性和应用价值。

Comments A revised version of this article will be published at ICAART 2026 (https://icaart.scitevents.org/?y=2026)

详情

展开后加载摘要…

URL PDF HTML 收藏