arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 21 篇

2601.19700 2026-02-02 cs.LG cs.AI 91%

Generalizable Multimodal Large Language Model Editing via Invariant Trajectory Learning

通过不变轨迹学习实现通用的多模态大语言模型编辑

Jiajie Su, Haoyuan Wang, Xiaohua Feng, Yunshan Ma, Xiaobo Xia, Yuyuan Li, Xiaolin Zheng, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University, China(浙江大学) Singapore Management University, Singapore(新加坡管理学院) National University of Singapore, Singapore(新加坡国立大学) Hangzhou Dianzi University, China(杭州电子科技大学) Jiangxi Normal University, China(江西师范大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出ODEit框架,通过不变轨迹学习提升多模态大语言模型的编辑可靠性、局部性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23081 2026-02-02 cs.CL cs.AI cs.CR 88%

Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures

字符作为大语言模型中的潜在变量:对涌现偏差和条件安全失败的机制解释

Yanghao Su, Wenbo Zhou, Tianwei Zhang, Qiu Han, Weiming Zhang, Nenghai Yu, Jie Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了大语言模型中字符层面倾向对齐风险的核心机制,指出行为倾向的稳定转变是导致涌现偏差和安全失败的关键因素,而非单纯的能力退化或提示防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10543 2026-02-02 cs.AI cs.CL 88%

Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing

通过解码过程中的安全意识探测防御大型语言模型的劫持攻击

Yinzhi Zhao, Ming Wang, Shi Feng, Xiaocui Yang, Daling Wang, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 通过在解码过程中激活内在安全意识,提升大型语言模型对劫持攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22364 2026-02-02 cs.CL cs.AI 86%

Context Structure Reshapes the Representational Geometry of Language Models

上下文结构重塑语言模型的表征几何

Eghbal A. Hosseini, Yuxuan Li, Yasaman Bahri, Declan Campbell, Andrew Kyle Lampinen

机构 * Google DeepMind(谷歌DeepMind) Princeton Neuroscience Institute, Princeton University(普林斯顿神经科学研究所,普林斯顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现语言模型在不同任务中根据上下文结构动态调整表征方式,部分任务中上下文增加会提升预测性能,而其他任务中则不一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22851 2026-02-02 cs.CL 85%

When Meanings Meet: Investigating the Emergence and Quality of Shared Concept Spaces during Multilingual Language Model Training

意义交汇:探究多语言语言模型训练中共享概念空间的产生与质量

Felicia Körner, Max Müller-Eberstein, Anna Korhonen, Barbara Plank

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根IT大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 研究通过因果可解释方法探讨多语言语言模型训练中共享概念空间的产生与质量,发现早期出现并随训练细化,但语言依赖性显著,且翻译质量提升可能反映行为变化而非能力提升。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22757 2026-02-02 cs.LG q-bio.BM 83%

Unveiling Scaling Behaviors in Molecular Language Models: Effects of Model Size, Data, and Representation

揭示分子语言模型中的缩放行为:模型大小、数据和表示的影响

Dong Xu, Qihua Pan, Sisi Yuan, Jianqiang Li, Zexuan Zhu, Junkai Ji

机构 * School of Artificial Intelligence, Shenzhen University, Shenzhen 518060, China(人工智能学院,深圳大学,深圳518060,中国)

专题命中 知识编辑与模型理解 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究通过训练300个分子语言模型,系统探讨了模型大小、数据量和表示对分子生成模型缩放行为的影响,并公开了最大分子语言模型库。

Comments 34 pages, 51 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21969 2026-02-02 cs.CL cs.AI 82%

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

Token-Guard: 通过自检解码实现token级幻觉控制

Yifan Zhu, Huiqiang Rong, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 Token-Guard通过自检解码技术,实现对大型语言模型中token级幻觉的有效控制,提升生成准确性与输出可靠性。

Comments Accepted by ICLR 2026 main conference

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17229 2026-02-02 cs.LG cs.AI cs.CL 80%

FactSelfCheck: Fact-Level Black-Box Hallucination Detection for LLMs

FactSelfCheck: LLMs中的事实级黑盒幻觉检测

Albert Sawczyn, Jakub Binkowski, Denis Janiak, Bogdan Gabrys, Tomasz Kajdanowicz

机构 * wrocław University of Science and Technology(沃拉布罗德技术大学) University of Technology Sydney(悉尼技术大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FactSelfCheck通过事实级黑盒采样方法提升LLM幻觉检测精度,实现更详细的事实性分析与纠正。

Comments Accepted for EACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22203 2026-02-02 q-bio.GN cs.AI 79%

Beyond Conditional Computation: Retrieval-Augmented Genomic Foundation Models with Gengram

超越条件计算:具有Gengram的检索增强基因组基础模型

Huinan Xu, Xuyang Feng, Junhong Chen, Junchen Liu, Kaiwen Deng, Kai Ding, Shengning Long, Jiaxue Shuai, Zhaorong Li, Shiping Liu, Guirong Xue, Zhan Xiao

机构 * Genos Team(基因组团队)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 Gengram通过基因组特定哈希方案引入高效查找原语,提升基因组基础模型在功能基因组任务中的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22928 2026-02-02 cs.CL cs.LG 79%

LLMs Explain't: A Post-Mortem on Semantic Interpretability in Transformer Models

LLMs Explain't: 对Transformer模型语义可解释性的事后分析

Alhassan Abdelhalim, Janick Edinger, Sören Laue, Michaela Regneri

机构 * Distributed Operating Systems Group, Department of Informatics, Universität Hamburg, Germany(信息学院分布式操作系统组,乌尔姆大学) Machine Learning Group, Department of Informatics, Universität Hamburg, Germany(信息学院机器学习组,乌尔姆大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文分析了Transformer模型中语义可解释性的局限性,发现现有方法在解释LLM性能机制时存在方法论缺陷,影响了在分布式计算中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22485 2026-02-02 cs.CR cs.AI cs.CL 79%

FraudShield: Knowledge Graph Empowered Defense for LLMs against Fraud Attacks

FraudShield: 基于知识图谱的LLM对抗欺诈攻击防御方案

Naen Xu, Jinghuai Zhang, Ping He, Chunyi Zhou, Jun Wang, Zhihui Fu, Tianyu Du, Zhaoxiang Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FraudShield通过构建欺诈战术-关键词知识图谱,提升LLM对抗欺诈攻击的能力,实验显示其在多个LLM和欺诈类型上表现优异,且提供可解释的防御线索。

Comments WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09378 2026-02-02 cs.CL 77%

Can you map it to English? The Role of Cross-Lingual Alignment in Multilingual Performance of LLMs

能否映射到英语?跨语言对齐在大语言模型多语言性能中的作用

Kartik Ravisankar, Hyojung Han, Sarah Wiegreffe, Marine Carpuat

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了LLM中跨语言对齐对多语言NLU任务性能的影响,通过引入DALI指数验证了表示对齐在正确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22684 2026-02-02 q-bio.MN 75%

BioModelsRAG: A Biological Modeling Assistant Using RAG (Retrieval Augmented Generation)

BioModelsRAG: 一种使用检索增强生成技术的生物建模助手

Bhavyahshree Navaneetha Krishnan, Adel Heydarabadipour, Herbert Sauro

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 BioModelsRAG通过检索增强生成技术,帮助用户快速提取生物模型的关键信息,提高分析效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04753 2026-02-02 cs.CL 70%

EtCon: Edit-then-Consolidate for Reliable Knowledge Editing

EtCon:编辑后整合以实现可靠的知识编辑

Ruilin Li, Yibin Wang, Wenhong Zhu, Chenglin Li, Jinghao Zhang, Chenliang Li, Junchi Yan, Jiaqi Wang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EtCon通过编辑后整合范式提升LLMs的知识编辑可靠性与现实应用能力,保留预训练能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07775 2026-02-02 cs.CL 70%

The Unintended Trade-off of AI Alignment:Balancing Hallucination Mitigation and Safety in LLMs

AI对齐中的意外权衡:在LLMs中平衡幻觉缓解与安全

Omar Mahmoud, Ali Khalil, Buddhika Laknath Semage, Thommen George Karimpanal, Santu Rana

机构 * Applied Artificial Intelligence Initiative(应用人工智能倡议) Deakin University(德肯大学) School of Information Technology(信息科技学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种方法,通过解耦幻觉和拒绝特征,平衡LLMs中的真实性与安全性,减少因提高真实性而削弱安全对齐的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22595 2026-02-02 cs.AI 70%

Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR

学得更多,用得更少:不确定性一致性引导的查询选择用于RLVR

Hao Yi, Yulan Hu, Xin Li, Sheng Ouyang, Lizhong Ding, Yong Liu

机构 * Renmin University of China(中国人民大学) Gaoling School of Artificial Intelligence(北京人工智能学院) Amap, Alibaba Group(阿里集团阿里的地图部门) School of Computer Science & Technology(计算机科学与技术学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于不确定性一致性的查询选择方法,通过改进RLVR的样本选择策略,减少查询预算,提升推理任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05219 2026-02-02 stat.ML cs.AI cs.LG 62%

CAOS: Conformal Aggregation of One-Shot Predictors

CAOS:一次性预测预测器的符合性聚合

Maja Waldron

机构 * Department of Statistics, University of Wisconsin-Madison, USA(统计学系,威斯康星大学麦迪逊分校)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 CAOS通过自适应聚合多个一次性预测器,利用留一校准方案实现有效覆盖,比传统方法在预测集大小上更小且保持可靠覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15105 2026-02-02 cs.CL cs.AI 62%

Mechanistic evaluation of Transformers and state space models

Transformer 与状态空间模型的机制性评估

Aryaman Arora, Neil Rathi, Nikil Roashan Selvam, Róbert Csordás, Dan Jurafsky, Christopher Potts

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过实验发现Transformer和基于SSM的模型在联想回忆任务中表现优异,而其他SSM模型表现不佳,揭示了不同架构在归纳学习机制上的差异。

Comments 9 page main text, 22 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22447 2026-02-02 cs.LG 57%

Beyond Activation Patterns: A Weight-Based Out-of-Context Explanation of Sparse Autoencoder Features

超越激活模式:基于权重的稀疏自编码器特征非情境解释

Yiting Liu, Zhi-Hong Deng

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究提出基于权重的解释框架,揭示稀疏自编码器特征在非情境下的功能效应,发现部分特征直接预测输出并参与注意力机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23041 2026-02-02 cs.CV 50%

One-shot Optimized Steering Vector for Hallucination Mitigation for VLMs

单次优化的转向向量用于VLMs的幻觉缓解

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science(科学大学) Nanjing University(南京大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出OSGA框架,通过单次优化生成通用转向向量,有效缓解VLMs的幻觉问题并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02767 2026-02-02 cs.CV 50%

Dynamic Reflections: Probing Video Representations with Text Alignment

动态反射:通过文本对齐探测视频表示

Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本研究通过视频-文本表示对齐探索现代视频和语言编码器的能力,揭示了跨模态对齐与数据丰富性、语义对齐与性能相关性以及时间推理与对齐的关系。

Comments To appear at ICLR 2026. 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏