arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-15 至 2026-01-15 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2510.21518 2026-01-15 cs.CV cs.CL cs.LG 81%

Head Pursuit: Probing Attention Specialization in Multimodal Transformers

头部追踪:探究多模态转换器中的注意力专业化

Lorenzo Basile, Valentino Maiorca, Diego Doimo, Francesco Locatello, Alberto Cazzaniga

机构 * Area Science Park(面积科学公园) Sapienza University of Rome(罗马萨皮恩扎大学) Institute of Science and Technology(科学与技术研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究通过分析多模态转换器中注意力头的专业化,揭示了模型内部可控的结构,并展示了通过编辑少量头部以增强或抑制特定概念的可行性。

Comments Accepted at NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09116 2026-01-15 cs.CV cs.AI 81%

LP-LLM: End-to-End Real-World Degraded License Plate Text Recognition via Large Multimodal Models

LP-LLM:基于大多模态模型的端到端真实世界退化车牌文本识别

Haoyan Gong, Hongbin Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 LP-LLM通过端到端结构感知多模态推理框架,结合字符感知模块和LoRA微调策略,提升真实世界退化车牌文本识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06475 2026-01-15 cs.CL 79%

HapticLLaMA: A Multimodal Sensory Language Model for Haptic Captioning

HapticLLaMA:一种多模态感官语言模型用于触觉描述

Guimin Hu, Daniel Hershcovich, Hasti Seifi

机构 * University of Copenhagen(哥本哈根大学) Arizona State University(亚利桑那州立大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 HapticLLaMA是一种多模态感官语言模型,通过触觉信号生成描述,利用两种分词器和强化学习提升触觉感知描述能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08959 2026-01-15 cs.CR cs.SE 78%

Integrating APK Image and Text Data for Enhanced Threat Detection: A Multimodal Deep Learning Approach to Android Malware

整合APK图像和文本数据以增强威胁检测:一种多模态深度学习方法用于Android恶意软件

Md Mashrur Arifin, Maqsudur Rahman, Nasir U. Eisty

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本文提出一种多模态深度学习方法,通过整合APK图像和文本数据提升Android恶意软件检测效果,系统评估不同图像类型和分辨率,并利用CLIP模型增强分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04184 2026-01-15 cs.CV 70%

MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives

MedicalNarratives: 通过局部化叙述连接医学视觉与语言

Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) Amazon(亚马逊)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 MedicalNarratives通过局部化鼠标轨迹连接医学视觉与语言,训练出的GenMedClip在12个医学领域均优于现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23311 2026-01-15 cs.CV cs.AI cs.CL 67%

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00040 2026-01-15 cs.CV cs.AI 62%

Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models

揭示内在能力:一种用于视觉-语言模型数据整理的范式

Junjie Li, Ziao Wang, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist大学) City University of Hong Kong, China(香港城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CADC通过揭示视觉-语言模型的内在能力,提供了一种基于能力分析的数据整理范式,以提升指令微调的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08871 2026-01-15 cs.SD cs.AI eess.AS 62%

Semantic visually-guided acoustic highlighting with large vision-language models

语义视觉引导的音频突出与大型视觉-语言模型

Junhua Huang, Chao Huang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出利用大型视觉-语言模型提取视觉-语义特征,以提升音频混音质量,发现摄像机焦点、语气和场景背景对感知混音质量提升最显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08860 2026-01-15 cs.CV cs.AI 62%

Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models

视觉-语言模型和生成图像模型中的偏见检测与旋转鲁棒性缓解

Tarannum Mithila

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出旋转鲁棒缓解策略,通过数据增强、表征对齐和模型正则化,提升视觉-语言和生成图像模型在旋转和分布偏移下的鲁棒性和公平性。

Comments Preprint. This work is derived from the author's Master's research. Code and supplementary materials will be released separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09575 2026-01-15 cs.CV 57%

OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding

OpenVoxel: 一种无需训练的稀疏体素分组与标注算法用于开放词汇3D场景理解

Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang, Cheng Sun

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 OpenVoxel通过无需训练的多模态大语言模型实现稀疏体素的分组与标注,提升开放词汇3D场景理解的性能。

Comments project page: https://peterjohnsonhuang.github.io/openvoxel-pages/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23903 2026-01-15 cs.CV 57%

Scaling Remote Sensing Foundation Models: Data Domain Tradeoffs at the Peta-Scale

在百亿级数据规模下扩展遥感基础模型:在百亿级数据规模下的领域权衡

Charith Wickrema, Eliza Mace, Hunter Brown, Heidys Cabrera, Nick Krall, Matthew O'Neill, Shivangi Sarkar, Lowell Weissman, Eric Hughes, Guido Zarrella

机构 * The MITRE Corporation(MITRE公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究探讨了在百亿级数据规模下扩展遥感基础模型的挑战与权衡,通过训练更大规模的视觉Transformer主干,揭示了数据受限与模型参数受限之间的关系,并提出了优化数据收集和计算资源的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏