Believe It or Not: How Deeply do LLMs Believe Implanted Facts?
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
机构 * Brown University(布朗大学) ; Drexel University(德雷塞尔大学)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments To be appeared in EMNLP 2025 (main)
机构 * University of Florida(佛罗里达大学)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments 14 pages, 15 figures, pre-print of paper accepted to IJCAI 2025
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments Accepted at Proceedings of the Thirty-Ninth AAAI Conference on Artificial Intelligence (AAAI 2025)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
Comments Accepted as a workshop paper to ICLR 2024
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments 11 pages, 5 figures, 4 tables
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)
专题命中 知识编辑与模型理解 :foundation model(abstract,comments);LLM(abstract);large language model(abstract);language model(abstract)
Comments Updated affiliations. This paper has been accepted to be published in the 2024 IEEE/ACM First International Conference on AI Foundation Models and Software Engineering (Forge)
专题命中 知识编辑与模型理解 :LLM(abstract,comments);large language model(abstract);language model(abstract);prompting(abstract)
Comments The paper is accepted by ICLR 2024. The code is publicly available at https://github.com/MiaoXiong2320/llm-uncertainty
重新思考大语言模型验证:证据结构、不确定性与选择性优化
机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) ; Microsoft Research(微软研究院) ; SCB Dental College and Hospital(SCB牙科学院与医院)
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract)
AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。
Comments Withdrawn by the authors due to premature submission before final review
Channel2World:一种用于射频环境表征的无线基础模型
专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract)
AI总结 该研究提出无线基础模型Channel2World,用Transformer编码器聚合多环境MIMO信道数据,预训练后作为环境条件模块,在UE定位等任务中能有效适配未见环境,性能优于或媲美特定站点微调。
Comments 13 pages, 10 figures
释放视觉-语言模型在通用人工智能生成图像检测中的潜力
专题命中 知识编辑与模型理解 :language model(title,abstract);foundation model(abstract)
AI总结 该研究针对AI生成图像检测,发现视觉-语言模型PE比DINOv3更具潜力,提出语义原型校准(SPC)方法得到PE-SPC,在多基准测试中达到新的最先进性能。
Radio-FM:用于无线电信号表示学习的基础模型及其应用
专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract)
AI总结 本文提出Radio-FM基础模型,采用双通道处理等技术,预训练于15个数据集,在15个下游基准中13个达最优,少样本迁移能力强,可作为无线电信号理解通用骨干。
冻结但并非始终可及:基因组语言模型的表征分析
专题命中 知识编辑与模型理解 :language model(title,abstract);foundation model(abstract)
AI总结 本研究分析了DNABERT-2等基因组语言模型作为冻结特征提取器时,在不同基因组任务中的表征可及性,发现其性能随任务变化,局部生物信号存在但并非总能通过池化嵌入获取。
点火指数:测量语言模型中的全局工作空间动力学
机构 * Dialpad, Inc.(戴尔德公司)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出点火指数I作为量化指标,用于测量Transformer语言模型的全局工作空间动力学,揭示了不同架构模型的点火特性及相关规律,为GWT与机制可解释性搭建了定量桥梁。
Comments 26 pages, 10 figures. Code: https://github.com/saman-rahbar/ignition-index
MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能
机构 * University of British Columbia(英属哥伦比亚大学) ; Weathon Software(威盛软件)
专题命中 知识编辑与模型理解 :language model(title,abstract);prompting(abstract)
AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。
Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures
用于超广域视网膜成像的基础模型表示迁移
机构 * Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) ; Wake Forest University School of Medicine(维克森林大学医学院) ; Virginia Tech-Wake Forest University School of Biomedical Engineering and Sciences(弗吉尼亚理工大学-维克森林大学生物医学工程与科学学院) ; University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算机学院) ; NIHR Biomedical Research Centre, Moorfields Eye Hospital NHS Foundation Trust(NIHR生物医学研究中心,摩尔菲尔兹眼科医院NHS基金会信托)
专题命中 知识编辑与模型理解 :foundation model(title,abstract);pretraining(abstract)
AI总结 该研究探讨基础模型预训练策略对超广域视网膜成像表示迁移的影响,发现DINOv3模型在五类糖尿病视网膜病变分级中性能最优,监督和自蒸馏预训练的ViT优于MAE,部分微调可缩小MAE的性能差距。
Comments 15 pages, 7 figures
自信流形:语言模型中正确性表示的几何结构
机构 * University College London(伦敦大学学院)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。
可靠性呈反比:更大的模型通过隐藏的自回归风险机制更快地加剧错误
机构 * Obviously Wrong, LLC(明显错误有限责任公司)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现随着语言模型规模扩大,答案虽更接近真实但退化更快。通过逐位置分歧追踪自回归风险残余,揭示了知识差距下降、知识退化增长等四个发现,指出更大模型会通过特定风险机制更快加剧错误,该机制因果且模型自身难以察觉。
双向归纳:掩码扩散语言模型中上下文学习的机制分析
机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特理工大学国家科技大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究扩散语言模型(DLM)中归纳机制,对比仅注意力AR模型和吸收掩码DLM。发现DLM学习双向归纳电路,方向对称,掩码两侧可见时归纳更强,还证明其能计算掩码令牌比例作隐式时间步长。
用于概念设计的经过验证的大语言模型驱动的合成
专题命中 知识编辑与模型理解 :LLM(title,abstract);prompting(abstract)
AI总结 研究用于概念设计的大语言模型驱动合成,给出概念和反应的形式语义及验证方法,提出基于大语言模型的合成过程,探讨引导合成的方式及技术,通过评估表明不同方法各有优劣,大语言模型驱动的场景引出多数情况下可恢复预期设计。
Comments 27 pages, 3 figures
剖析不公平的评判者:基于大语言模型作为评判者的偏差的机械可解释性分析
机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP实验室) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University of Southern California(南加州大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型作为评判者的偏差,提出偏差在隐藏状态有表示层面解释。通过七位评判者等实验发现,偏差输入沿特定子空间移动,操纵隐藏状态可控制评分,线性投影能预测评判失败,统一多方面内容。
Comments 58 pages, 13 figures, 30 tables; project page: https://xzx34.github.io/unfair-judge/
U-Lens:支持长格式大语言模型响应中的用户不确定性管理
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型长响应中用户管理不确定性的难题,通过形成性研究得出设计准则,构建U-Lens系统,经实验评估,该系统能提高验证效率、降低工作量、加强各阶段感知支持,重塑了生成式AI的不确定性支持方式。
哪些神经元能检测恶意代码?对大语言模型安全知识的探索性研究
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究探索大语言模型中检测恶意代码的神经元,应用机械可解释性方法定位相关神经元,通过对恶意和良性PyPI包实验发现放大促进神经元、抑制抑制神经元可提升准确率,有助于了解模型编码恶意概念方式,为可靠防御机制提供思路。
Comments The paper has been peer reviewed and accepted for publication in the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)
使用确定性真实数据评估长文本生成中语言模型的不确定性
机构 * Technion(技术学院) ; Nvidia(英伟达)
专题命中 知识编辑与模型理解 :LLM(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对长文本生成中语言模型不确定性评估难题,引入含单一确定性长文本真值的SALT基准,通过对50多个模型分析揭示关键见解,如置信函数作用、错误驱动因素及推理影响等,为风险关键应用提供参考。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Code available at https://github.com/IdoAmit198/SALT
对齐路由:在语言模型中本地化、扩展和控制策略电路
机构 * Independent Researcher(独立研究者)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过本地化策略路由机制,探讨在语言模型中扩展和控制策略电路的方法,发现路由机制在安全性和性能上的关键作用。
Comments Code and data: https://github.com/gregfrank/how-alignment-routes. Accepted at the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML), 2026
Transcoders 追踪视觉语言模型中的视觉基础与幻觉
机构 * Institute of Language and Speech Processing(语言与语音处理研究所) ; Athena Research Center(雅典研究中心)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 采用基于Transcoders的功能中心框架分解视觉语言模型的计算路径,揭示视觉输入如何影响文本生成,并通过反事实分析和图结构特征预测幻觉。
SG-CADVLM: 一种基于上下文感知解码的视觉语言模型,用于安全关键场景生成
机构 * School of Transportation, Southeast University(东南大学交通学院)
专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract)
AI总结 本文提出SG-CADVLM,一种结合上下文感知解码的多模态输入处理框架,用于从事故报告中生成高保真的安全关键场景,通过减少视觉语言模型的幻觉并同时生成道路几何和车辆轨迹,提升了生成场景的准确性和实用性。
一个马尔可夫范畴框架用于语言建模
机构 * Princeton University(普林斯顿大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一个马尔可夫范畴框架,从信息处理阶段分析语言模型的生成过程,解释训练如何塑造表示,并揭示表示如何支持复杂行为。