arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 289 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 289 篇

2605.07984 2026-06-15 cs.LG cs.AI 版本更新 81%

Where's the Plan? Locating Latent Planning in Language Models with Lightweight Mechanistic Interventions

计划在哪里?通过轻量级机制干预定位语言模型中的潜在规划

Nicole Ma, Nick Rui

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过押韵对句补全任务,使用线性探针和激活修补方法,研究语言模型在生成过程中是否形成并因果依赖未来约束的潜在规划,发现仅Gemma-3-27B模型存在因果依赖,并定位到五个注意力头。

Comments 13 pages, 20 figures, 3 tables. Accepted to Workshop on Mechanistic Interpretability @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10882 2026-08-20 cs.SE 版本更新 80%

From Quality Properties to Practice: A Guideline and Workflow for Explainability Requirements

从质量属性到实践:可解释性需求的指南与工作流

Martin Obaidi, Jakob Droste, Hannah Deters, Marc Herrmann, Michel Krahl, Kurt Schneider

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一个基于指南的迭代工作流,通过结构化文献综述、开发者访谈和从业者调查提炼出十个核心质量属性,并开发工具支持,实验表明工具辅助可减少23.5%的制定时间且需求质量与手动编写相当。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08044 2026-08-05 cs.LG cs.AI cs.CL 版本更新 80%

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

当行为安全评估失败时:表征层面的视角

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technical University of Denmark(丹麦技术大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29341 2026-07-03 cs.IR 版本更新 80%

Monosemanticity in Recommender Systems

推荐系统中的单语义性

Yagel Alfasi, Eden Rzezak, Eadan Schechter

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract)

AI总结 研究矩阵分解嵌入的层次稀疏表示,用Matryoshka稀疏自编码器提取可解释特征,通过元数据对齐和LLM标注验证语义一致性,并干预性别相关神经元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03982 2026-08-18 cs.CL 版本更新 79%

Language Models Compare Quantities Using Number-specific and Unit-specific Heuristics

语言模型使用数字特定和单位特定启发式比较数量

Mutsumi Sasaki, Go kamoda, Ryosuke Takahashi, Kosuke Sato, Kentaro Inui, Keisuke Sakaguchi, Benjamin Heinzerling

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过控制实验发现,语言模型在比较带单位的数量时,并非进行精确的尺度转换,而是依赖数字差异和单位尺度差异的启发式策略,导致在比较边界附近系统性错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10010 2026-08-13 cs.LG 版本更新 79%

CurveFP: Co-Designing Numerical Representation and Product Arithmetic for Language Models

CurveFP:用于语言模型的带闭包乘积的有理基数对数数据类型

Ye Qiao

机构 * University of California, Irvine(加州大学欧文分校)

专题命中 知识编辑与模型理解 :language model(title);pretraining(abstract);分类 cs.LG

AI总结 本文提出CurveFP数据类型,通过闭包乘积算术协同设计,在少1位元素位数下提升语言模型性能,降低运算误差,优于FP8且更适合紧凑部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03115 2026-08-11 cs.CL eess.AS 版本更新 79%

Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models

在大型音频-语言模型中发现并因果验证情绪敏感神经元

Xiutian Zhao, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP)(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学) Group on Language, Audio & Music (GLAM)(语言、音频与音乐小组) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过神经元层面的干预验证了大型音频-语言模型中情绪敏感神经元的存在,并揭示了情绪识别的因果机制。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06054 2026-08-10 cs.CV cs.AI 版本更新 79%

Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving

探测轻量视觉语言模型中视觉概念以用于自动驾驶

Nikos Theodoridis, Reenu Mohandas, Ganesh Sistu, Anthony Scanlan, Ciarán Eising, Tim Brophy

机构 * University of Limerick(利默里克大学) Valeo Vision Systems, Ireland(爱尔兰瓦莱欧视觉系统) Department of Electronic and Computer Engineering(电子与计算机工程系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本研究探讨了轻量视觉语言模型在自动驾驶中的视觉概念编码问题,发现某些概念显式编码而其他隐式编码,并识别出感知和认知两种失败模式。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新 79%

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22712 2026-07-29 cs.CV cs.AI physics.optics 版本更新 79%

scMIR: a vision-language foundation model for single-cell light microscopy image representation

scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型

Yifan Shang, Jiahui Tan, Xiangxiang Zeng, Renjie Zhou

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07407 2026-07-28 cs.LG 版本更新 79%

Emergent Symbolic Structure in Health Foundation Models: Extraction, Alignment, and Cross-Modal Transfer

健康基础模型中的涌现符号结构:提取、对齐与跨模态迁移

Gajendra Katuwal, Advait Koparkar, Salar Abbaspourazad, Anshuman Mishra, Sarvesh Kirthivasan

机构 * Apple(苹果公司)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种训练后框架,通过分解冻结嵌入以提取可解释的符号,用于对齐嵌入空间。在PPG和加速度计数据上验证,发现符号能选择性关联健康状况和生理属性,并支持跨模态迁移。

Comments 8 pages, Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, 4 main figures

Journal ref Mechanistic Interpretability Workshop at the 43 rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22864 2026-07-23 cs.LG 版本更新 79%

Reading Calibrated Uncertainty from Language Model Trajectories

从语言模型轨迹中读取校准的不确定性

Aliai Eusebi, Alexander Herzog, Xiaoyu Liang, Marie Vasek, Enrico Mariconti, Lorenzo Cavallaro

机构 * University College London, London, United Kingdom(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文通过提取层间MLP更新的尺度不变几何特征,使用稀疏线性探针从语言模型内部激活轨迹中校准不确定性,在选择性弃权任务中优于最大softmax概率,最高提升21 AURC点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22042 2026-07-14 cs.CV cs.AI 版本更新 79%

Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

基于部分-整体语义代表性与不确定性引导的组合对齐超几何视觉语言模型

Hayeon Kim, Ji Ha Jang, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电子与计算机工程系) INMC & IPAI(INMC与IPAI) Seoul National University(首尔国立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出UNCHA方法,通过超几何不确定性建模部分-整体语义代表性,提升超几何VLM对多物体场景的组合结构理解能力,实现零样本分类等任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20433 2026-06-23 cs.CL 版本更新 79%

Disentangling Geometry, Performance, and Training in Language Models

解耦语言模型中的几何、性能与训练

Atharva Kulkarni, Jacob Mitchell Springer, Arjun Subramonian, Swabha Swayamdipta

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 系统研究Transformer权重几何(尤其是解嵌入矩阵有效秩)与下游性能的关系,发现有效秩主要反映训练超参数而非性能,不能可靠预测模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00918 2026-06-23 cs.AI 版本更新 79%

Sparse Neuron Ablation Triggers Catastrophic Collapse of the Language Core in Large Vision-Language Models

稀疏神经元消融引发大型视觉-语言模型中语言核心的灾难性崩溃

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士洛桑联邦理工学院) Idiap Research Institute(日内瓦研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出渐进式神经元消融方法CAN,发现消融极少量(如LLaVA-1.5-7b中仅4个)位于语言模型下投影层的神经元即可导致LVLM灾难性崩溃,揭示功能依赖语言骨干中的稀疏神经元子集。

Comments Accepted to ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07025 2026-06-08 cs.CV cs.AI 版本更新 79%

The Geometry of Representational Failures in Vision Language Models

视觉语言模型中表征失败的几何结构

Daniele Savietto, Declan Campbell, André Panisson, Marco Nurisso, Giovanni Petri, Jonathan D. Cohen, Alan Perotti

机构 * Dipartimento di Fisica, Università di Torino(都灵大学物理系) Princeton Neuroscience Institute and AI Lab, Princeton University(普林斯顿大学神经科学研究所和AI实验室) Intesa Sanpaolo AI Research(Intesa Sanpaolo AI研究中心) Dipartimento di Scienze Matematiche, Politecnico di Torino(都灵理工学院数学科学系) Network Science Institute, Northeastern University London, UK(伦敦大学东北方大学网络科学研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 通过分析开源视觉语言模型的概念向量几何重叠,揭示多目标视觉任务中幻觉等错误与认知约束的关联,并提出基于干预的验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07531 2026-08-19 cs.CL cs.AI 版本更新 79%

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

Search-G1:基于表征内在奖励的接地搜索智能体

Ruoxi Cheng, Haoxuan Ma, Hongyi Zhang, Junming Zhang, Ranjie Duan, Qiaolin Xia, Hao Wang, Yu Lu, Haibo Shi, Xingjun Ma

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Search-G1框架,通过两个经干预校准的读数构成的表征内在奖励,改善了搜索增强语言智能体的接地性与搜索成本的权衡,在多基准和模型规模上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31087 2026-08-12 cs.CL cs.AI 版本更新 79%

When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking

当重排序有害时:基于不确定性的门控机制用于少样本重排序

Orian Dabod, Amir DN Cohen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) OriginAI

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对少样本选择中重排序可能降低性能的问题,提出无训练门控重排序方法,基于模型不确定性决定是否重排序,在8个LLM上降低15%-80%计算成本并提升平均性能达2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07998 2026-08-11 cs.LG cs.AI 版本更新 79%

Enhancing AI Interpretability with Localised Architectures

通过局部化架构增强AI可解释性与安全性

Ian Seet, Jonas Bozenhard, Simon Ostermann

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大型生成式AI模型可解释性差、计算成本高的问题,提出局部化机器学习架构,通过降低带宽、提高节点表达能力来提升可解释性和效率,并评估了多种硬件实现方案的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17229 2026-07-20 cs.AI cs.CL 版本更新 79%

Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy

通过线性探针利用布洛姆分类法探讨大语言模型中认知复杂性的机制可解释性

Bianca Raimondi, Maurizio Gabbrielli

机构 * University of Bologna(博洛尼亚大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过线性探针利用布洛姆分类法,证明大语言模型中认知复杂性可通过线性可访问子空间表示,揭示模型在处理提示时早期解决认知难度的机制。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03730 2026-08-12 cs.CV 版本更新 78%

Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

超越虚假稳定性:面向视觉语言模型测试时对抗防御的高噪声漂移门控

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡布斯大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 针对视觉语言模型在测试时易受对抗攻击的问题,提出一种无训练、即插即用的高噪声漂移门控机制,通过检测高噪声下的特征不稳定性触发防御,改善了干净-鲁棒性权衡。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04641 2026-07-30 cs.CV 版本更新 78%

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新 78%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13420 2026-07-21 cs.CV 版本更新 78%

VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task

VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象

Xingming Long, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 研究聚焦视觉语言模型在自愿想象任务中的幻觉问题,引入VOPE评估基准,通过构建数据集应用于主流模型和缓解方法,发现多数模型幻觉严重,现有缓解方法效果有限,为该领域未来研究指明重要方向。

Comments Accepted at ACM MM 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18931 2026-07-21 cs.CV 版本更新 78%

Enhancing Vision Foundation Models via Multimodal Continual Pre-Training

通过多模态持续预训练增强视觉基础模型

Yitong Chen, Lingchen Meng, Wujian Peng, Jun Tao, Chenjie Xu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Baosight Software Co., Ltd.(上海博视软件有限公司)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 研究通过多模态持续预训练增强视觉基础模型,提出M-CPT框架,用持续位置嵌入处理不同分辨率视觉输入,通过特征对齐目标提升视觉与文本表示一致性,实验证明该框架能提升多模态理解性能并保持标准视觉任务表现。

Comments Code is available in https://github.com/ShareLab-SII/CoMP-MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28543 2026-07-07 cs.AI cs.CL cs.LG 版本更新 78%

Cultural Binding Heads in Language Models

语言模型中的文化绑定头

Avrile Floro, Luca Benedetto

机构 * Mistral-7B Mistral-Nemo-12B Llama-3.1-8B Gemma-2-9B

专题命中 知识编辑与模型理解 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过机制可解释性和析因设计,识别出8个语言模型中2-3个中间层注意力头对文化绑定有因果贡献,且绑定主要在预训练阶段形成,知识探测表明模型知道的知识远多于其行为表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23115 2026-07-07 cs.CV 版本更新 78%

AgentFoX: LLM Agent-Guided Fusion with eXplainability for AI-Generated Image Detection

AgentFoX: 基于可解释性的大语言模型引导融合的AI生成图像检测

Yangxin Yu, Yue Zhou, Bin Li, Kaiqing Lin, Haodong Li, Jiangqun Ni, Bo Cao

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-AFS人工智能技术联合创新中心) Shenzhen University(深圳大学) School of Cyber Science and Technology(网络安全科学与技术学院) The Smart City Research Institute of China Electronics Technology Group Corporation(中国电子科技集团有限公司智慧城市研究院)

专题命中 知识编辑与模型理解 :LLM(title,abstract)

AI总结 AgentFoX通过多阶段分析流程提升AI生成图像检测的可靠性,结合专家和上下文聚类资料,生成可读性强的报告以增强可解释性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04552 2026-08-06 cs.CL q-bio.GN 版本更新 77%

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

LDARNet: 用于基因组建模的DNA自适应表示网络与可学习分词

Daria Ledneva, Denis Kuznetsov

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 提出LDARNet,一种结合动态分块和双向路由的120M参数层次基因组基础模型,在27个任务中优于更大模型,并发现学习到的边界与生物学基序对齐。

Comments Fix parameter count typo; update results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01557 2026-07-31 cs.CL 版本更新 77%

Language Diversity: Evaluating Language Usage and AI Performance on African Languages in Digital Spaces

语言多样性:评估非洲语言在数字空间中的使用情况和人工智能性能

Edward Ajayi, Eudoxie Umwari, Mawuli Deku, Prosper Singadi, Jules Udahemuka, Bekalu Tadele, Chukuemeka Edeh

机构 * Carnegie Mellon University(卡内基梅隆大学) Africa Kigali Rwanda(非洲基加利卢旺达) Bahir Dar Institute of Technology(巴希尔达尔技术学院) Federal University Otuoke Bayelsa Nigeria(贝莱萨州联邦大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本研究发现本地新闻数据比对话平台数据更有效用于训练非洲语言的AI模型,强调了处理干净和语言切换文本的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01457 2026-07-28 cs.CL 版本更新 77%

Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs

为自信所束缚:对大语言模型中过度自信的机械视角分析

Tianyi Zhao, Yinhan He, Wendy Zheng, Yujie Zhang, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型中过度自信的机制,发现中间层的MLP块和注意力头会生成自信信号,并通过干预提升校准性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏