arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 289 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 289 篇

2508.05618 2026-07-27 cs.CL 版本更新 77%

Learning to Reason for Factuality

学习进行事实性推理

Xilun Chen, Ilia Kulikov, Vincent-Pierre Berges, Barlas Oğuz, Rulin Shao, Gargi Ghosh, Jason Weston, Wen-tau Yih

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究推理大型语言模型在事实性推理方面的问题,提出同时考虑事实精度、响应细节和答案相关性的新型奖励函数,应用在线强化学习,使模型在长篇事实性基准测试中幻觉率降低、答案细节提升且响应帮助性无降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20817 2026-07-23 cs.CL 版本更新 77%

EssayCBM: Rubric-Aligned Concept Bottleneck Models for Transparent Essay Grading

EssayCBM: 基于评分标准的概念瓶颈模型用于透明的作文评分

Kumar Satvik Chaudhary, Chengshuai Zhao, Fan Zhang, Garima Agrawal, Yuli Deng, Huan Liu

机构 * Arizona State University(亚利桑那州立大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 EssayCBM通过分解为八种可解释的写作概念,提供透明的作文评分方法,使教师能够检查和调整评分标准级别的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02911 2026-07-16 cs.CL 版本更新 77%

The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction

幽灵标注者:通过共形预测探索内容审核中人类标签变异的框架

Mirko Lai, Alessandra Urbinati, Simona Frenda, Fabiana Vernero, Marco Antonio Stranisci

机构 * Laboratory for the Modeling of Biological and Socio-technical Systems, Northeastern University(生物与社会技术系统建模实验室,东北大学) Heriot-Watt University(赫瑞-沃顿大学) aequa-tech Università del Piemonte Orientale(皮埃蒙特东方大学) Università degli Studi di Torino(托斯卡纳大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 提出结合共形预测与协同过滤式标注者表征的框架,通过幽灵预测度量和幽灵标注者表征量化模型预测与所有人类标注的分歧,并发现模型在标注者分歧时不确定性增加,但大型模型对无人类对齐文本更自信,且存在结构性人口统计偏差。

Comments The publishing of this preprint is contextual with the ACL ARR cycle system. After an encouraging review in January we revised and submit the paper on Arxiv. However, a new batch of reviewers raised additional issues that will lead to significant revisions of the experimental setting. Therefore, we decide to withdraw the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29693 2026-07-09 cs.AI 版本更新 77%

Measuring the metacognition of AI

测量人工智能的元认知

Richard Servajean, Philippe Servajean

机构 * Center for Brain Science, RIKEN(日本立命馆大学脑科学研究中心)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出使用meta-d'框架和信号检测理论评估AI的元认知能力,通过实验验证其在不同任务和风险下的决策调节能力。

Comments 19 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10371 2026-06-25 eess.AS cs.CL 版本更新 77%

Speech Codec Probing from Semantic and Phonetic Perspectives

从语义和语音角度探测语音编解码器

Xuan Shi, Chang Zeng, Tiantian Feng, Shih-Heng Wang, Jianbo Ma, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Dolby Laboratories(杜比实验室)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过三项任务系统分析多种语音分词器编码的信息,发现当前分词器主要捕获语音结构而非词汇语义,为下一代语音分词方法设计提供指导。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20045 2026-06-18 cs.CL 版本更新 77%

Efficient Hallucination Detection for LLMs Using Uncertainty-Aware Attention Heads

基于不确定性感知注意力头的高效大语言模型幻觉检测

Artem Vazhentsev, Lyudmila Rvanova, Gleb Kuzmin, Ekaterina Fadeeva, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Mrinmaya Sachan, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德人工智能大学) ETH Zurich(苏黎世联邦理工学院) Independent Researcher(独立研究者) Applied AI Institute(应用人工智能研究所)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RAUQ框架,利用不确定性感知注意力头与令牌级置信度,通过单次前向传递实现无监督、高效的序列级幻觉检测,在12个数据集上优于现有方法且额外计算少于1%。

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16823 2026-06-09 cs.LG 版本更新 77%

VQ-Atom: Semantic Discretization of Local Atomic Environments for Molecular Representation Learning

原子作为语言:VQ-Atom:用于分子表示学习的语义离散化

Takayuki Kimura

机构 * Atoms as Language, LLC(Atoms as Language公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出VQ-Atom,一种用于分子表示学习的语义离散化框架,通过将连续的原子级图表示转换为对应局部化学环境的离散标记,从而提升分子表示的学习效果。

Comments 7 pages, 6 figures. Submitted to ICML 2026 Workshop on Foundation Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24730 2026-08-06 cs.HC 版本更新 75%

Diamonds in the rough: Transforming SPARCs of imagination into a game concept by leveraging medium sized LLMs

粗糙中的钻石:通过利用中型大语言模型将想象力的SPARCs转化为游戏概念

Julian Geheeb, Farhan Abid Ivan, Daniel Dyrda, Miriam Anschütz, Georg Groh

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了中型大语言模型在早期游戏设计中的应用,通过生成和评估游戏创意,展示了这些模型在提供有用反馈方面的潜力,并指出需要进一步优化提示方法以提高一致性。

Comments 13 pages, 4 figures, 2 tables

Journal ref Proceedings of AI4HGI '25, the First Workshop on Artificial Intelligence for Human-Game Interaction at the 28th European Conference on Artificial Intelligence (ECAI '25), Bologna, October 25-30, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21022 2026-08-04 cs.SE 版本更新 75%

Don't Use a Cannon to Kill a Fly: Lightweight Model Editing for LLMs to Correct Deprecated API Recommendations

轻量级模型编辑用于LLMs纠正过时的API推荐

Guancheng Lin, Xiao Yu, Jacky Keung, Xing Hu, Xin Xia, Alex X. Liu

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AdaLoRA-L方法,通过区分通用API层和特定API层,提升LLMs生成最新API的能力。

Comments Accepted to ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24884 2026-07-30 cs.SE cs.AI cs.CL cs.LG 版本更新 75%

Beyond "What to Retrieve": Uncertainty in Retrieval-Augmented Code Generation

超越“检索什么”:检索增强代码生成中的不确定性

Chandan Kumar Sah, Li Zhang, Xiaoli Lian

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究存储库级代码生成中异构证据不确定性问题,提出不确定性感知框架OpenCoder,通过估计特定源不确定性来过滤和排序证据以指导相关操作,实验表明其能提高输出正确性,支持将不确定性作为可操作控制信号。

Comments 9 pages, 4 figures. Source code and supporting materials are available at https://github.com/Rocky5502/OpenCoder_V1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14300 2026-07-13 cs.AI cs.CL cs.LG 版本更新 75%

Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors

超越黑盒混淆:白盒监测器的机制分析与防御

Maheep Chaudhary, Fazl Barez

机构 * University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29466 2026-07-03 cs.LG cs.AI cs.CL 版本更新 75%

An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms

基于梯度范数的高效不确定性量化方法

Nils Grünefeld, Jes Frellsen, Christian Hardmeier

机构 * IT University of Copenhagen(哥本哈根信息技术大学) Pioneer Centre for Artificial Intelligence(人工智能先锋中心) Technical University of Denmark(丹麦技术大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种轻量级方法,通过梯度范数和参数协方差的近似,实现对神经网络预测不确定性的高效量化,验证了其在不同基准测试中的有效性。

Comments ProbML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21577 2026-06-16 cs.CL cs.AI cs.LG stat.ML 版本更新 75%

A Unified Definition of Hallucination: It's The World Model, Stupid!

幻觉的统一定义:是世界模型的问题,笨蛋!

Emmy Liu, Varun Gangal, Chelsea Zou, Michael Yu, Xiaoqi Huang, Alex Chang, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出幻觉的统一定义,即用户可观察到的错误内部世界建模,并连接至HalluWorld基准测试,以区分真实幻觉与规划或奖励错误。

Comments ICML 2026. HalluWorld benchmark at https://github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07003 2026-08-17 cs.LG cs.CL 版本更新 73%

Dissociating the Internal Representations of Sycophancy in LLMs

区分大语言模型中谄媚行为的内部表征

Anthony Baez, Sheer Karny, Pat Pataranutaporn

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型谄媚行为,将其表征分为事实和观点子类型,通过训练线性探针等方法评估不同模型对两子类型表征差异,为研究复杂模型行为表征结构提供了新框架。

Comments Accepted to Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06417 2026-08-14 cs.LG cs.CL 版本更新 73%

Latent Fact-Checking: Detecting Misinformation through Activation Engineering

潜在事实核查:通过激活工程检测虚假信息

Pedro T. Barcelos, Otávio Parraga, Marcelo M. Mussi, Lucas M. Fraga, Lucas S. Kupssinskü, Rodrigo C. Barros

机构 * PUCRS(巴西天主教大学(里约格兰德 do 苏里)) Kunumi Institute(库纳米研究所)

专题命中 知识编辑与模型理解 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出基于激活工程的虚假信息检测框架,通过对比激活引出潜在空间的虚假信息方向,在多类模型和基准上实现了优于部分基线的检测性能,为可解释性驱动的虚假信息检测提供了新方向。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05103 2026-08-13 cs.CL cs.AI cs.CY 版本更新 73%

Text Corpora as Concept Fields: Black-Box Hallucination and Novelty Measurement

文本语料作为概念场:黑箱幻觉与新颖性度量

Nicholas S. Kersting, Vittorio Castelli, Chieh Ting Yeh, Xinzhu Wang, Saad Taame, Khaoula Allak

机构 * Oracle Corporation(Oracle公司)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出文本语料的概念场,通过句子嵌入空间中连续句子的delta差异估计局部漂移场。引入向量序列数据库存储嵌入与序列位置及下一delta元数据,用于评估候选句子转换的同意分数。在联邦法规和古腾堡计划上验证了该方法在幻觉检测和新颖性检测中的有效性。

Comments 30 pages, 10 figures, 17 tables; additional analysis in appendix added

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00837 2026-08-13 cs.CL cs.AI 版本更新 73%

Explainability in Practice: A Survey of Explainable NLP Across Various Domains

实践中的可解释性:跨领域可解释自然语言处理综述

Hadi Mohammadi, Robert A. Bagheri, Anastasia Giachanou, Daniel L. Oberski

机构 * Department of Methodology and Statistics, Utrecht University, The Netherlands(方法论与统计学系,乌得勒支大学,荷兰)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本综述针对实际部署的可解释NLP,覆盖7个应用领域,提出两级评估协议,探讨研究缺口并给出未来方向,为跨领域XNLP实践提供参考。

Comments 32 pages, 5 figures, 15 tables, 257 references. Under review at the Journal of Information Science. Supplementary materials and structured data: https://github.com/mohammadi-hadi/xnlp-survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00130 2026-08-10 cs.PL cs.AI cs.CL cs.MS cs.SE 版本更新 73%

A Fortran General-Purpose Transpiler: Proof of Concept

Fortran通用转译器:概念验证

Shivamshan Sivanesan, Kazem Ardaneh

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Fortran专业知识断层问题,提出基于Python的FGPT编译器框架,可将Fortran转译为适配GPU或自动微分的代码,经气候建模内核验证,能自动生成正确的Python实现,为遗留Fortran代码现代化提供可靠路径。

Comments 19 pages, 14 figures, proof of concept

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04586 2026-08-07 cs.CL cs.AI 版本更新 73%

Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders

通过资源感知型语音编码器混合模型打破多对多语音到文本翻译中的多语言性诅咒

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Chengpeng Fu, Yu Wang, Ming Liu

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多对多语音到文本翻译中的多语言性诅咒问题,提出资源感知型MoSE框架与五阶段课程学习策略,其4B参数模型在45种语言的全方向翻译任务上实现最优性能,显著提升低资源语言表现且不损害高资源性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20381 2026-08-05 cs.CL cs.AI cs.HC 版本更新 73%

The production of meaning in the processing of natural language

自然语言处理中意义产生的机制

Christopher J. Agostino, Quan Le Thien, Nayan D'Souza, Louis van der Elst

机构 * Department of Physics, Indiana University(印第安纳大学物理系) Department of Linguistics, Indiana University(印第安纳大学语言学系) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。

Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01893 2026-08-04 cs.AI cs.LG 版本更新 73%

Geometric Analysis of Token Selection in Multi-Head Attention

多头注意机制中令牌选择的几何分析

Timur Mudarisov, Mikhal Burtsev, Tatiana Petrova, Radu State

机构 * University of Luxembourg(卢森堡大学) London Institute for Mathematical Sciences(伦敦数学科学研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过几何分析揭示了多头注意力机制中令牌选择的结构特性,提出了精度、召回率和F分数等指标,并展示了头部在不同制度下的几何特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12384 2026-08-03 cs.LG cs.AI 版本更新 73%

APPO: Agentic Procedural Policy Optimization

APPO: 智能体程序策略优化

Xucong Wang, Ziyu Ma, Yong Wang, Yuxiang Ji, Shidong Yang, Guanhua Chen, Pengkun Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图) Southern University of Science and Technology(南方科技大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出APPO方法,通过细粒度分支和程序级优势缩放改进智能体强化学习的信用分配,在13个基准上平均提升近4个点。

Comments 25 pages, including 14 pages of main text and 11 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12449 2026-07-31 cs.CV cs.AI cs.IR cs.LG 版本更新 73%

MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

MOON2.0:动态模态平衡多模态表示学习用于电商产品理解

Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19806 2026-07-24 cs.LG cs.AI 版本更新 73%

OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization

OPIUM:通过双目标潜在优化减轻引导外部性和过度拒绝

Kavin Aravindan, Arihant Rastogi, Krishak Aneja, Aadi Prasad, Saiyam Jain, Vaishnavi Shivkumar, Ponnurangam Kumaraguru

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究激活引导向量存在的外部性问题,提出无训练方法OPIUM,通过表示匹配净化引导向量,在给定参考行为下优化新向量,改善安全与效用权衡,减轻激活引导的有害副作用。

Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11836 2026-07-22 cs.LG cs.CL 版本更新 73%

More Edits, More Stable: Understanding the Lifelong Normalization in Sequential Model Editing

更多编辑,更稳定:理解连续模型编辑中的终身规范化

Xin Ma, Wei Chen, Qi Liu, Derong Xu, Zhi Zheng, Tong Xu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了连续模型编辑中的终身规范化,提出理论分析揭示其自增强稳定性循环,并通过StableEdit提升长期稳定性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12273 2026-07-20 cs.SE cs.AI cs.CL 版本更新 73%

Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction Graphs

Code-MUE:通过基于执行的语义交互图测量代码语言模型的不确定性

Xiaoning Ren, Yinxing Xue, Lei Ma, Yuheng Huang

机构 * Xi’an Jiaotong University(西安交通大学) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院) The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对代码语言模型内在随机性带来的风险,引入纯黑盒框架Code-MUE,通过基于执行的语义交互图测量不确定性,经大规模实证研究验证其与功能正确性强负相关,优于基线,可实现风险检测和选择性预测。

Comments To appear at The ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12229 2026-07-20 cs.CL cs.AI 版本更新 73%

Analysing Moral Bias in Finetuned LLMs through Mechanistic Interpretability

通过机制可解释性分析微调语言模型中的道德偏见

Bianca Raimondi, Daniela Dalbagno, Maurizio Gabbrielli

机构 * Department of Computer Science and Engineering, University of Bologna, Bologna, Italy(计算机科学与工程系,博洛尼亚大学,意大利博洛尼亚) Center for Studies and Research in Cognitive Neuroscience, Department of Psychology, University of Bologna, Cesena, Italy(认知神经科学研究中心,心理学系,博洛尼亚大学,意大利塞森纳)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究微调后大语言模型中的道德偏见,通过层修补分析发现诺布效应不仅在微调时习得且定位在特定层,将预训练模型激活修补到关键层可消除该效应,为通过干预解释、定位和缓解模型社会偏见提供新证据。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11327 2026-07-15 cs.LG cs.AI 版本更新 73%

PRISM Edit: One Vector for All Temporal Answers

PRISM Edit:适用于所有时间答案的单一向量

Chen Huang, Qi Zheng, Ruiqin Zheng, Long Zeng, Yuantong Xu

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型时间事实更新问题,基于因果追踪发现其内部计算支持新旧答案区分,进而引入PRISM Edit,通过优化单一多义词表示及利用固有调制路径,在新基准上评估,相比基线提升了时间一致性等指标且速度更快。

Comments Chen Huang and Qi Zheng contributed equally. Corresponding authors: Long Zeng, Yuantong Xu

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06722 2026-06-29 cs.CL cs.LG 版本更新 73%

On the Effect of Uncertainty on Layer-wise Inference Dynamics

不确定性对逐层推理动态的影响

Sunwoo Kim, Haneul Yoo, Alice Oh

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过Tuned Lens分析11个数据集和5个模型,发现确定与不确定预测的逐层概率轨迹高度一致,表明不确定性不影响推理动态,但更强大的模型可能以不同方式处理不确定性。

Comments Accepted to Actionable Interpretability Workshop - ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20179 2026-06-23 hep-ex cs.AI cs.LG 版本更新 73%

AI Agents Can Already Autonomously Perform Experimental High Energy Physics

AI智能体已能自主执行实验高能物理研究

Eric A. Moreno, Samuel Bright-Thonney, Andrzej Novak, Dolores Garcia, Philip Harris

机构 * Massachusetts Institute of Technology(麻省理工学院) NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基本相互作用研究所) CERN(欧洲核子研究中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 基于大语言模型的AI智能体自主执行高能物理分析全流程,提出JFC框架整合文献检索与多智能体审查,在ALEPH、DELPHI和CMS开放数据上验证,首次由AI自主产生新颖物理结果,旨在减轻技术负担而非取代物理学家。

详情

展开后加载摘要…

URL PDF HTML 收藏