4M: Massively Multimodal Masked Modeling
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2023 Spotlight. Project page at https://4m.epfl.ch/
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2023 Spotlight. Project page at https://4m.epfl.ch/
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Comments preprint version
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2023 (main conference)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG
Comments Preprint of conference paper accepted at ACL 2022
机构 * AIML GSK
专题命中 知识编辑与模型理解 :foundation model(title,comments);分类 cs.LG;large language model(comments);language model(comments)
Comments Accepted by NeurIPS 2025 workshop: 2nd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 知识编辑与模型理解 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.LG
Comments Website at https://llm-liar.github.io/
专题命中 知识编辑与模型理解 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.CL
Comments Accepted at Socially Responsible Language Modelling Research (SoLaR) Workshop at NeurIPS 2024
提升、关联与融合:面向2D到3D基础模型迁移的以决策为中心的框架
机构 * School of Geospatial Engineering and Science, Sun Yat-sen University(中山大学地理空间工程与科学学院) ; University of Waterloo(滑铁卢大学)
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 该研究提出以决策为中心的LAF框架,将2D到3D基础模型迁移系统拆分为五个算子,通过对161个系统的审计,为3D感知系统的比较、故障诊断与规范提供了表示无关的方法。
Comments A framework to realize 3D segmentation
基于视觉语言模型的不确定性感知艺术史年代测定
机构 * Marburg University(马尔堡大学)
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 该研究针对艺术品年代测定中的时间纠缠问题,将其转化为不确定性感知回归任务,通过在Wikidata艺术品语料库上实验发现视觉语言模型(VLMs)在该任务上优于纯视觉自监督基线,但存在偏差。
大型视觉语言模型的测试时幻觉控制
机构 * Australian National University(澳大利亚国立大学) ; The University of New South Wales(新南威尔士大学) ; University of Technology Sydney(悉尼科技大学) ; York University(约克大学) ; Lancaster University(兰卡斯特大学)
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。
Comments Accepted at ECCV 2026 MUCG
当视觉信号产生误导:视觉语言模型中属性幻觉的机制研究
机构 * Zhejiang University(浙江大学)
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 针对视觉语言模型的属性幻觉问题,提出VISOR框架,通过VSNR诊断区分失败模式并路由适配操作,在三类模型上减少属性假阳性且不依赖先验主导假设。
超越虚假稳定性:面向视觉语言模型测试时对抗防御的高噪声漂移门控
机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) ; Khalifa University, UAE(卡布斯大学,阿联酋) ; Australian National University, Australia(澳大利亚国立大学,澳大利亚)
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 针对视觉语言模型在测试时易受对抗攻击的问题,提出一种无训练、即插即用的高噪声漂移门控机制,通过检测高噪声下的特征不稳定性触发防御,改善了干净-鲁棒性权衡。
Journal ref The 37th British Machine Vision Conference (BMVC) 2026
基础模型是隐式深度伪造检测器
机构 * AAAI Press(AAAI出版社)
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 该研究发现基础模型的特征幅度可区分真实与伪造媒体,将深度伪造检测建模为异常检测,简单统计指标即可达到竞争性能,且模型规模越大判别信号越强。
重视零样本不确定性:面向测试时自适应视觉-语言模型的保守校准
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 针对测试时自适应(TTA)视觉-语言模型校准度下降的问题,提出零样本锚定熵校准(ZAEC)方法,通过最小温度缩放恢复锐化预测的零样本熵,在多模型多数据集上实现了更低的期望校准误差(ECE)。
通过激活分析检测语言模型中的安全训练修改
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 本研究提出AMS工具,通过激活空间几何结构检测语言模型的安全训练修改,在14种模型配置上验证了其有效性,可区分四类安全训练修改中的前三者。
Journal ref IEEE Access, vol. 14, pp. 91723-91737, 2026
VFAD:变分语义提示与频率自适应表示学习结合的零样本异常检测
专题命中 知识编辑与模型理解 :prompting(title,abstract)
AI总结 该研究提出VFAD框架,结合变分语义提示与频率自适应表示学习,在13个工业和医学基准上,其零样本异常检测性能优于现有最先进方法。
UltraSAM3:一种用于通用超声图像分割的概念驱动基础模型
机构 * Dalian University of Technology Affiliated Center Hospital(大连大学附属中心医院)
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 针对现有超声分割方法的任务局限或需专家视觉提示问题,提出概念驱动的UltraSAM3模型及指令引导智能体,在多基准测试中性能优于同类模型,提升了临床交互的实用性。
CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。
Bifrost:利用基于日志的故障诊断的可错性表示赋能预训练语言模型
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 研究基于日志的故障诊断问题,提出Bifrost方法,借鉴站点可靠性工程师经验,基于自监督对比学习设计策略学习日志可错性表示,在多个系统中其生成的日志表示在故障诊断相关指标上优于现有PLMs。
Comments Accepted by ASE 2026 (Research Track)
穿越瓶颈:多头潜在注意力如何在语言模型中分离内容与位置
机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) ; P P Savani University(P P萨瓦尼大学)
专题命中 知识编辑与模型理解 :language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 研究多头潜在注意力(MLA)在语言模型中如何分离内容与位置。通过训练特定Transformer并运用多种分析方法,发现其瓶颈能保留内容丢弃位置信息,归纳头集中在单层,有“语义中心”层,且瓶颈容量供应过剩,重塑了模型相关结构。
JEPA-CFM:一种基于联合嵌入预测架构的稳健流体天线系统信道基础模型
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 针对流体天线系统获取信道信息及定位的障碍,提出基于联合嵌入预测架构的信道基础模型,通过提取潜在嵌入学习通用表示,结合互补损失项训练,经仿真验证其在信道外推和无线定位上优于传统基线。
Rem3Di:从原子基础模型学习平滑、手性3D分子描述符
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 Rem3Di是一种表征学习框架,利用原子基础模型潜在特征生成可转移分子描述符,用于性质预测和虚拟筛选。它能捕捉分子手性,在药物性质基准测试中表现出色,还能区分过渡金属配合物,为化学机器学习提供新途径。
Comments An earlier version of this work appeared at the NeurIPS 2025 Workshop on Symmetry and Geometry in Neural Representations (NeurReps). Workshop version: https://openreview.net/forum?id=jOmZsvXoK5
用于几何基础3D基础模型的潜在黎曼流匹配
机构 * TU Wien(维也纳工业大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ; Imperial College London(伦敦帝国理工学院)
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 研究如何弥合几何基础模型与3D场景生成模型的范式差异,通过在VGGT潜在空间进行黎曼流匹配,利用其3D先验,不依赖明确下游表示,在多个数据集上取得良好性能,确立该方法为3D生成的可行范式。
BrainFIBRE:基于信息分解的脑微结构基础模型
机构 * National University of Singapore(新加坡国立大学)
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。
Comments ECCV 2026. Author name corrected in V2
VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象
机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村学院)
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI总结 研究聚焦视觉语言模型在自愿想象任务中的幻觉问题,引入VOPE评估基准,通过构建数据集应用于主流模型和缓解方法,发现多数模型幻觉严重,现有缓解方法效果有限,为该领域未来研究指明重要方向。
Comments Accepted at ACM MM 2026 Dataset Track
通过多模态持续预训练增强视觉基础模型
机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Baosight Software Co., Ltd.(上海博视软件有限公司)
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 研究通过多模态持续预训练增强视觉基础模型,提出M-CPT框架,用持续位置嵌入处理不同分辨率视觉输入,通过特征对齐目标提升视觉与文本表示一致性,实验证明该框架能提升多模态理解性能并保持标准视觉任务表现。
Comments Code is available in https://github.com/ShareLab-SII/CoMP-MM
VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Huazhong University of Science and Technology(华中科技大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 知识编辑与模型理解 :foundation model(title,abstract)
AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。
Comments Home page: https://zhxie0117.github.io/VideoRAE