arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-12 至 2026-02-12 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 10 篇

2505.11924 2026-02-12 cs.CL cs.AI cs.LG 87%

Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 知识编辑与模型理解 :prompting(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

Journal ref 4th Deployable AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08892 2026-02-12 cs.CL cs.AI 79%

Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders

迈向基于稀疏自编码器的忠实检索增强生成

Guangzhi Xiong, Zhenghao He, Bohan Liu, Sanchit Sinha, Aidong Zhang

机构 * Department of Computer Science University of Virginia(计算机科学系弗吉尼亚大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出RAGLens,通过稀疏自编码器解构LLM内部激活,有效检测RAG生成中的不忠实输出,并提供可解释的决策理由。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10622 2026-02-12 cs.CL 77%

How Do Decoder-Only LLMs Perceive Users? Rethinking Attention Masking for User Representation Learning

解码器-only LLMs如何感知用户?重新思考注意力掩码在用户表示学习中的应用

Jiahao Yuan, Yike Xu, Jinyong Wen, Baokun Wang, Yang Chen, Xiaotong Lin, Wuliang Huang, Ziyi Gao, Xing Fu, Yu Cheng, Weiqiang Wang

机构 * East China Normal University(华东师范大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究提出梯度引导的软掩码方法,用于改进解码器-only LLMs在用户表示学习中的训练动态和双向表示质量。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10502 2026-02-12 cs.LG 77%

Enhancing Ride-Hailing Forecasting at DiDi with Multi-View Geospatial Representation Learning from the Web

通过网络多视角地理空间表示学习提升滴滴出行预测

Xixuan Hao, Guicheng Li, Daiqiang Wu, Xusen Guo, Yumeng Zhu, Zhichao Zou, Peng Zhen, Yao Yao, Yuxuan Liang

机构 * The Hong Kong University of Science China University of Geoscience (Wuhan) Wuhan China Didichuxing Co.\ Ltd Beijing China China University of Geoscience (Wuhan) Didichuxing Co.\ Ltd

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出MVGR-Net框架,通过多视角地理空间表示学习和提示赋能的框架,提升滴滴出行预测的准确性与鲁棒性。

Comments Accepted by The Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16415 2026-02-12 cs.CL cs.AI cs.LG 75%

Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation

基于Jensen-Shannon散度的响应归因研究:一种驱动上下文归因的机理研究

Ruizhe Li, Chen Chen, Yuchen Hu, Yanjun Gao, Xi Wang, Emine Yilmaz

机构 * University of Aberdeen(阿伯丁大学) Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安舒兹医学校区) University of Sheffield(谢菲尔德大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于Jensen-Shannon散度的ARC-JSD方法,实现高效准确的上下文归因,提升RAG模型的性能和效率。

Comments Accepted at ICLR 2026; Best Paper Award at COLM 2025 XLLM-Reason-Plan Workshop; Accepted at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10504 2026-02-12 cs.CL 70%

On the Robustness of Knowledge Editing for Detoxification

关于知识编辑在去毒化中的鲁棒性

Ming Dong, Shiyi Tang, Ziyan Peng, Guanyi Chen, Tingting He

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence(人工智能与智能学习湖北省重点实验室) Research Center for Network Media, School of Computer Science, Central China Normal University, Wuhan, China(网络媒体研究中心,计算机科学学院,中央民族大学,武汉,中国)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种评估基于知识编辑的去毒化方法鲁棒性的框架,发现其效果受模型、目标和语言的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21767 2026-02-12 cs.CL 70%

Evaluating ChatGPT on Medical Information Extraction Tasks: Performance, Explainability and Beyond

评估ChatGPT在医学信息抽取任务中的表现:性能、可解释性及更进一步

Liz Li, Wei Zhu

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 评估ChatGPT在医学信息抽取任务中的性能、可解释性及应用挑战

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23050 2026-02-12 cs.LG cs.AI 62%

Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding

通过对比嵌入链理解LVLMs的语言先验

Lin Long, Changdae Oh, Seongheon Park, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 通过对比嵌入链分析,揭示LVLMs中视觉信息整合的关键层及影响响应生成的强度量化方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18970 2026-02-12 cs.AI cs.LG 62%

Bridging Explainability and Embeddings: BEE Aware of Spuriousness

弥合可解释性与嵌入:BEE 意识到虚假相关性

Cristian Daniel Păduraru, Antonio Bărbălau, Radu Filipescu, Andrei Liviu Nicolicioiu, Elena Burceanu

机构 * Bitdefender University of Bucharest(布加勒斯特大学) Mila University of Montreal(蒙特利尔大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 BEE通过分析权重空间和嵌入几何揭示隐藏的虚假相关性,适用于多种数据集和模型,提升基础模型的可信度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 50%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏