Multilingual Emotion Neurons in Large Audio-Language Models
大型音频语言模型中的多语言情感神经元
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL
AI总结 本研究通过首个神经元层面可解释性研究,提出多语言情感神经元(MLENs)定义及一致性正则化融合(CR-Fusion)方法,证实其在零样本和低资源场景下情感控制更精准,为LALMs跨语言情感编码提供因果解释。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
大型音频语言模型中的多语言情感神经元
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL
AI总结 本研究通过首个神经元层面可解释性研究,提出多语言情感神经元(MLENs)定义及一致性正则化融合(CR-Fusion)方法,证实其在零样本和低资源场景下情感控制更精准,为LALMs跨语言情感编码提供因果解释。
将CT基础模型蒸馏为可编辑概念瓶颈用于肺结节恶性程度预测
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI
AI总结 该研究将CT基础模型蒸馏为可编辑概念瓶颈模型,在肺结节恶性程度预测任务中,其判别力与仅用结节大小相当,且支持概念干预以实现透明可解释的预测。
Comments Submitted to SPIE Medical Imaging 2027 conference
面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG
AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。
Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026
在大型音频-语言模型中发现并因果验证情绪敏感神经元
机构 * Center for Language and Speech Processing (CLSP)(语言与语音处理中心) ; Johns Hopkins University(约翰霍普金斯大学) ; Group on Language, Audio & Music (GLAM)(语言、音频与音乐小组) ; Imperial College London(伦敦帝国学院)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL
AI总结 本研究通过神经元层面的干预验证了大型音频-语言模型中情绪敏感神经元的存在,并揭示了情绪识别的因果机制。
Comments Accepted to ACL 2026
探测轻量视觉语言模型中视觉概念以用于自动驾驶
机构 * University of Limerick(利默里克大学) ; Valeo Vision Systems, Ireland(爱尔兰瓦莱欧视觉系统) ; Department of Electronic and Computer Engineering(电子与计算机工程系)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 本研究探讨了轻量视觉语言模型在自动驾驶中的视觉概念编码问题,发现某些概念显式编码而其他隐式编码,并识别出感知和认知两种失败模式。
Journal ref Transactions on Machine Learning Research, 2026
RxnCLF:用于改进反应性预测的感知变换的反应基础模型
机构 * Discovery Chemistry, Merck & Co., Inc.(默克公司发现化学部门)
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG
AI总结 本研究提出RxnCLF,一种基于凝聚反应图的自监督对比反应基础模型,经170万Pistachio反应预训练后,在多类产率预测基准上均优于基线模型,展现出良好泛化潜力。
Comments 8 pages, 6 figures
LAEF:面向即时诊断的导联无关心电图基础模型
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG
AI总结 该研究提出LAEF,一种7M参数的导联无关心电图基础模型,预训练于9.2M份12导联心电图,在18个下游数据集的1-2导联即时诊断场景下,性能优于零填充替代方案,与更大规模的12导联基线相当。
AURORA-LM:用于连续潜在扩散语言建模的统一表示自动编码
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL
AI总结 AURORA-LM是一种分离文本表示构建与分布建模的连续潜在扩散语言模型,通过特定技术优化后,在OpenWebText自由生成和XSum摘要任务中性能优于同类模型。
Comments 40 pages, 17tables, project page: https://aurora-lm-project.github.io/
SIRIN:用于检测检索增强与记忆基大型语言模型系统中上下文幻觉的统一工具包
机构 * Sber AI Lab(Sber AI实验室)
专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI
AI总结 本研究提出SIRIN工具包,整合三类检测器范式与查询可回答性任务,支持多设置下的幻觉检测,可作为长期记忆系统的忠实性门控,源代码公开可用。
语言模型中的天球表示
机构 * Fields Institute(菲尔兹研究所) ; Principles of Intelligence(智能原理机构) ; University of Toronto(多伦多大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG
AI总结 研究约1000亿参数的语言模型是否存在可从残差流解码的夜空图表示,发现多数开源模型具备该表示,其性能指标优异且为首个弯曲高维不可约特征流形实例,相关代码已公开。
BioPro: 关于差分意识的性别公平性在视觉-语言模型中
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。
Comments ACM Multimedia 2026
基于大语言模型符号化决策过程实现的可解释列注释
机构 * Data61, CSIRO(数据61,联邦科学与工业研究组织)
专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.CL
AI总结 研究针对列注释方法存在的问题,提出SymCA框架,通过大语言模型赋能,将其实现为全局到局部的符号决策过程,含全局骨架归纳和局部基质演化两组件,实验证明该框架准确、稳健且可解释,性能优于基线。
Comments 13 pages, 7 figures
OrganLens:用于CT基础模型的器官特异性表征学习
机构 * Rice University(莱斯大学) ; University of Washington(华盛顿大学)
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI
AI总结 研究针对CT检查中特定器官表征需求,提出OrganLens通过自监督学习,用器官标识调节共享编码器,经器官特异性蒸馏等方法获取器官特异性表征,在多数据集评估中提升指标,提供了可扩展方法和 reusable 框架。
Comments 16 pages, 7 figures, 5 tables
scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI
AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。
用于语言模型机制审计的参考特征图谱
机构 * Rutgers University(罗格斯大学) ; NVIDIA Research(英伟达研究院)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 该研究提出参考特征图谱用于语言模型审计,通过拟合线性解码器实现,有图谱和残差两个互补通道。在多模型上训练并审计米斯特拉尔和文心一言目标,残差通道能控制植入机制,还揭示文心一言相关集群,为模型审计提供新方法。
健康基础模型中的涌现符号结构:提取、对齐与跨模态迁移
机构 * Apple(苹果公司)
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG
AI总结 本文提出一种训练后框架,通过分解冻结嵌入以提取可解释的符号,用于对齐嵌入空间。在PPG和加速度计数据上验证,发现符号能选择性关联健康状况和生理属性,并支持跨模态迁移。
Comments 8 pages, Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, 4 main figures
Journal ref Mechanistic Interpretability Workshop at the 43 rd International Conference on Machine Learning, Seoul, South Korea, 2026
从语言模型轨迹中读取校准的不确定性
机构 * University College London, London, United Kingdom(伦敦大学学院)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG
AI总结 本文通过提取层间MLP更新的尺度不变几何特征,使用稀疏线性探针从语言模型内部激活轨迹中校准不确定性,在选择性弃权任务中优于最大softmax概率,最高提升21 AURC点。
神经语言模型中语法性的线性表示
机构 * Johns Hopkins University(约翰·霍普金斯大学) ; Boston University(波士顿大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL
AI总结 探讨神经语言模型能否基于语法性区分字符串,通过质量均值探测研究语法性是否编码在其内部表示中,结果表明语法性在多种预训练模型中有力编码,为相关争论提供新证据及评估框架。
用于研究语言模型中欺骗行为的转码器
机构 * Home Team Science & Technology Agency (HTX)(新加坡内政部科技局)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 研究用转码器分析语言模型欺骗行为,通过预训练转码器的Qwen3 - 4B模型构建归因图,经特征引导和电路分析识别相关特征字典,发现欺骗源于模型内部机制,凸显转码器在监测及检测语言模型安全漏洞方面的潜力。
对主观预期效用最大化的敏感性:一项方法学研究,并应用于大语言模型决策
专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI
AI总结 研究在标记结果稀缺等情况下评估不确定性决策的难题,通过含敏感性参数α的softmax选择模型得出相关可识别性结果,应用于大语言模型决策,检测到结构化比较α效应。
Comments 64 pages, 5 figures. Code and data archived at Zenodo: https://doi.org/10.5281/zenodo.21250951
GigaChat音频:时间感知大型音频语言模型
机构 * SaluteDevices, Russia(SaluteDevices)
专题命中 知识编辑与模型理解 :language model(title);LLM(abstract);分类 cs.CL
AI总结 研究音频条件语言模型长录音时间定位难题,提出时间感知音频语言模型,利用合成监督交织时间标记与音频令牌,在多基准测试中实现高精度,支持相关描述与总结,通过消融实验明确多因素影响,并发布模型权重和数据集。
Comments Accepted to Interspeech 2026. Model and dataset: https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B
Vilya-1:用于大环结构预测与设计的全原子基础模型
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG
AI总结 研究针对现有大环肽结构和性质建模方法的局限,提出全原子深度学习模型Vilya-1,可跨化学结构采样及预测属性,在异构数据集训练,提高几何精度且覆盖小分子,支持生成应用,为大环治疗药物开发加速。
Comments 21 pages, 14 figures
基于部分-整体语义代表性与不确定性引导的组合对齐超几何视觉语言模型
机构 * Dept. of Electrical and Computer Engineering(电子与计算机工程系) ; INMC & IPAI(INMC与IPAI) ; Seoul National University(首尔国立大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 本文提出UNCHA方法,通过超几何不确定性建模部分-整体语义代表性,提升超几何VLM对多物体场景的组合结构理解能力,实现零样本分类等任务的最先进性能。
Comments Accepted to CVPR 2026
HIVE:理解视觉语言模型中的幻觉后推理
机构 * Purdue University(普渡大学) ; Rutgers University(罗格斯大学) ; Meta AI ; Kent State University(肯特州立大学) ; Imperial College London(伦敦帝国学院)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。
Comments Accepted by ECCV 2026
Canopy:用于代谢工程的异构图基础模型
机构 * an in-house laboratory information management system (LIMS)(一个内部实验室信息管理系统(LIMS))
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG
AI总结 代谢工程中设计高产微生物菌株有挑战,Canopy异构图基础模型集成多数据源成知识图谱,用特定模型编码特征,经自监督目标预训练,在发酵滴度预测任务中表现优于基线。
Comments Accepted at ICML GenBio Workshop 2026 https://openreview.net/forum?id=H8bvgKoT7j
TORINO:通过视觉语言模型中可解释的概念重叠进行令牌减少
机构 * University of Turin, Italy(意大利都灵大学) ; Eindhoven University of Technology, The Netherlands(荷兰埃因霍温理工大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 研究视觉语言模型计算成本高问题,提出TORINO框架,利用稀疏自动编码器将视觉令牌投影到可解释潜在空间,通过概念重叠分组并减少令牌,兼顾效率与准确性。
SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; De Artificial Intelligence Lab(德人工智能实验室)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。
Comments 12 pages, 4 figures, 6 tables
探讨在微调语言模型中回话用语和填充词的表示
机构 * Bielefeld University(比勒菲尔德大学) ; Southern University of Science and Technology(南方科技大学) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL
AI总结 本文通过三种微调策略研究回话用语和填充词在语言模型中的表示,发现微调能提升模型区分语义差异的能力,使生成的对话更接近人类语言。
Comments Accepted at ACL 2026 main
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers, ACL 2026), pp. 5319-5348
TreeAgent: 一种基于编译专家规则和视觉语言模型的通用多智能体框架,用于林业自动化偏差标注
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI
AI总结 提出TreeAgent多智能体框架,结合专家决策树与视觉语言模型,通过解耦声明式决策实现零修改泛化,在树木偏差分类中超越监督学习基线并降低标注成本。
Comments 9 pages, 2 figures
基于视觉语言模型的图像分类局部化共形预测
机构 * CÉCI ; F.R.S.-FNRS(比利时国家科学研究基金会) ; Walloon Region(瓦隆大区)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG
AI总结 针对图像分类中局部化共形预测未充分探索的问题,提出一种简单的余弦相似度非线性变换,在保持边际覆盖保证的同时显著降低平均集大小。
Comments 7 pages, 2 figures, 3 tables, code availables, accepted to EUVIP 2025
Journal ref 2025 13th European Workshop on Visual Information Processing (EUVIP)