arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-08 至 2026-01-08 共收录 44 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2508.09818 2026-01-08 cs.CV 79%

ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video

ViMoNet: 一种多模态视觉-语言框架,用于从运动和视频中理解人类行为

Rajan Das Gupta, Lei Wei, Md Yeasin Rahat, Nafiz Fahad, Abir Ahmed, Liew Tze Hui

机构 * Department of Computer Science, American International University–Bangladesh (AIUB)(美国国际大学-孟加拉国计算机科学系) Faculty of Psychology, Shinawatra University(信武大学心理学系) Faculty of Information Science and Technology, Multimedia University(多媒体大学信息科学与技术系) Department of Information Technology, Washington University of Science & Technology(华盛顿科学与技术大学信息科技系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 ViMoNet通过整合运动和视频数据,提出多模态视觉-语言框架,有效提升人类行为理解与医疗保健应用潜力。

Comments This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16925 2026-01-08 cs.CV cs.AI cs.IR cs.MA 73%

V-Agent: An Interactive Video Search System Using Vision-Language Models

V-Agent:一种利用视觉-语言模型的交互式视频搜索系统

SunYoung Park, Jong-Hyeon Lee, Youngjune Kim, Daegyu Sung, Younghyun Yu, Young-rok Cha, Jeongho Ju

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 V-Agent通过多智能体协作和视觉-语言模型提升视频搜索性能,实现多模态交互与零样本性能。

Comments CIKM 2025 MMGENSR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03329 2026-01-08 cs.LG cs.AI 70%

Attention mechanisms in neural networks

神经网络中的注意机制

Hasi Hays

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文系统阐述了神经网络中注意机制的理论基础、计算特性及应用,涵盖自然语言处理、计算机视觉和多模态学习等多个领域,分析了其可解释性及当前存在的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 67%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03500 2026-01-08 cs.CV cs.AI 62%

SDCD: Structure-Disrupted Contrastive Decoding for Mitigating Hallucinations in Large Vision-Language Models

SDCD: 结构破坏对比解码用于缓解大视觉-语言模型中的幻觉

Yuxuan Xia, Siheng Wang, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SDCD通过结构破坏对比解码缓解大视觉-语言模型中的幻觉问题,有效抑制纹理驱动偏见,提升多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17306 2026-01-08 cs.CV 57%

Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images

深度但可靠:提升图像思考的多轮推理

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuanyu Wan, Lijun Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 DRIM通过多阶段流程提升图像思考的多轮推理能力,通过冗余惩罚策略优化实现自我反思的推理模式,从而在视觉理解任务中取得优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18795 2026-01-08 cs.CV 57%

ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder

通过基于大语言模型的嵌入器实现渐进式视觉-语言对齐的ProCLIP

Xiaoxing Hu, Kaicheng Yang, Ziyang Gong, Qi Ming, Zonghao Guo, Yu Tian, Xiang An, Ziyong Feng, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) DeepGlint(深图科技) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 ProCLIP通过课程学习逐步对齐CLIP图像编码器与基于大语言模型的嵌入器,提升长文本处理和多语言理解能力。

Comments 17 pages, 5 fiugres

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27240 2026-01-08 cs.LG 50%

FedSM: Robust Semantics-Guided Feature Mixup for Bias Reduction in Federated Learning with Long-Tail Data

FedSM: 用于在长尾数据联邦学习中减少偏见的语义引导特征混合

Jingrui Zhang, Yimeng Xu, Shujie Li, Feng Liang, Haihan Duan, Yanjie Dong, Victor C. M. Leung, Xiping Hu

专题命中 图文多模态 :image-text(abstract)

AI总结 FedSM通过语义引导的特征混合和轻量级分类器重训练,有效减少联邦学习中长尾数据的偏见问题。

Journal ref IEEE Internet of Things Journal, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2507.20137 2026-01-08 cs.HC 71%

Dynamite: Real-Time Debriefing Slide Authoring through AI-Enhanced Multimodal Interaction

Dynamite:通过AI增强的多模态交互实现实时复盘幻灯片创作

Panayu Keelawat, David Barron, Kaushik Narasimhan, Daniel Manesh, Xiaohang Tang, Xi Chen, Sang Won Lee, Yan Chen

专题命中 音频语音多模态 :multimodal(title)

AI总结 Dynamite通过AI增强的多模态交互实现实时复盘幻灯片创作,提升课堂讨论后复盘的准确性和效率。

Comments Accepted to VL/HCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2601.04073 2026-01-08 cs.CV cs.AI cs.CL 88%

Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts

在跨模态冲突下分析大型多模态模型的推理一致性

Zhihao Zhu, Jiafeng Liang, Shixin Jiang, Jinlan Fu, Ming Liu, Guanglu Sun, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出逻辑图扰动协议,通过主动视觉上下文细化方法,解决大型多模态模型在跨模态冲突下的推理一致性问题,提升推理鲁棒性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12460 2026-01-08 gr-qc astro-ph.HE 50%

GW200105: A detailed study of eccentricity in the neutron star-black hole binary

GW200105:关于中子星-黑洞双星系统偏心率的详细研究

Aasim Jan, Bing-Jyun Tsao, Richard O'Shaughnessy, Deirdre Shoemaker, Pablo Laguna

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究利用先进波形模型对GW200105事件进行详细分析,发现信号中存在偏心率,且与之前研究结果存在差异。

Comments 5 Figures, 3 Tables, update to match the accepted PRD version

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 6 篇

2601.04127 2026-01-08 cs.CV cs.AI 81%

Pixel-Wise Multimodal Contrastive Learning for Remote Sensing Images

像素级多模态对比学习用于遥感图像

Leandro Stival, Ricardo da Silva Torres, Helio Pedrini

机构 * Wageningen University & Research(瓦赫宁根大学与研究学院) Institute of Computing, University of Campinas (UNICAMP)(计算学院,坎皮纳斯大学(UNICAMP))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出像素级多模态对比学习方法,通过二维表示和对比学习提升遥感图像中特征提取效果,优于现有方法。

Comments 21 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01513 2026-01-08 cs.CV cs.AI 62%

FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation

FastV-RAG: 向快速且细粒度的视频问答迈进:基于检索增强生成的框架

Gen Li, Peiyu Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of International Business and Economics(国际商务经济大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FastV-RAG通过引入推测解码和基于相似性的过滤策略,提升视频问答任务的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03270 2026-01-08 cs.CL cs.AI math.OC 62%

Advances and Challenges in Semantic Textual Similarity: A Comprehensive Survey

语义文本相似性的发展与挑战:全面综述

Lokendra Kumar, Neelesh S. Upadhye, Kannan Piedy

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了语义文本相似性在变压器模型、对比学习、领域适应等六个方面的最新进展,探讨了多模态、图方法和知识增强技术,并指出现有挑战与未来发展方向。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07344 2026-01-08 cs.DC cs.AI 57%

Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding

Venus: 一种高效的边缘内存与检索系统用于基于VLM的在线视频理解

Shengyuan Ye, Bei Ouyang, Tianyi Qian, Liekang Zeng, Mu Yuan, Xiaowen Chu, Weijie Hong, Xu Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(计算机科学与工程学院,中山大学,广州,中国) Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(信息工程系,香港中文大学,香港特别行政区,中国) Shenzhen Smart City Communications Co., Ltd., China(深圳智慧城市通信有限公司,中国)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 Venus提出了一种高效的边缘内存与检索系统,通过边缘-云解耦架构实现快速的在线视频理解,显著降低系统开销并提升响应速度。

Comments Accepted by IEEE International Conference on Computer Communications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07227 2026-01-08 cs.CV cs.IR 57%

Which Country Is This? Automatic Country Ranking of Street View Photos

这是哪个国家?街景照片的自动国家排名

Tim Menzner, Jochen L. Leidner, Florian Mittag

机构 * Coburg University of Applied Sciences and Arts(科堡应用科学与艺术大学) University of Sheffield(谢菲尔德大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Country Guesser系统,通过结合计算机视觉、机器学习和文本检索方法,对街景照片中的地点进行国家排名预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03262 2026-01-08 cs.IR cs.CL 57%

Roles of MLLMs in Visually Rich Document Retrieval for RAG: A Survey

多模态大语言模型在视觉丰富文档检索中的作用:一项综述

Xiantao Zhang

机构 * Beihang University(北航大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文综述了多模态大语言模型在视觉丰富文档检索中的应用,探讨了三种关键角色及其在RAG中的作用与权衡。

Comments 18 pages; accepted at AACL-IJCNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2601.04056 2026-01-08 cs.CL 79%

Bridging the Discrete-Continuous Gap: Unified Multimodal Generation via Coupled Manifold Discrete Absorbing Diffusion

弥合离散-连续鸿沟:通过耦合流形离散吸收扩散实现统一多模态生成

Yuanfeng Xu, Yuhao Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 CoM-DAD通过耦合流形离散吸收扩散框架,实现离散与连续数据的统一多模态生成,解决多模态对齐与训练稳定性问题。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12631 2026-01-08 cs.CV cs.AI 73%

Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation

多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成

Yushe Cao, Dianxi Shi, Xing Fu, Xuechao Zou, Haikuo Peng, Xueqi Li, Chun Yu, Junliang Xing

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03993 2026-01-08 cs.CV 57%

PosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable Typography

PosterVerse: 一个用于商业级海报生成的全流程框架,基于HTML的可扩展字体

Junle Liu, Peirong Zhang, Yuyi Zhang, Pengyu Yan, Hui Zhou, Xinyue Zhou, Fengjun Guo, Lianwen Jin

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 PosterVerse通过全流程框架和HTML驱动技术,实现商业级海报的高密度文本渲染与灵活设计。

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03482 2026-01-08 cs.AI cs.LG stat.AP 57%

Personalization of Large Foundation Models for Health Interventions

为健康干预个性化设计大型基础模型

Stefan Konigorski, Johannes E. Vedder, Babajide Alamu Owoyele, İbrahim Özkan

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出混合框架,结合LFMs和N-of-1试验,以实现个性化医疗中的因果推断与责任AI整合。

Comments Accepted to the AAAI 2026 Workshop on Personalization in the Era of Large Foundation Models (PerFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03903 2026-01-08 cs.IR 50%

Unleashing the Potential of Neighbors: Diffusion-based Latent Neighbor Generation for Session-based Recommendation

释放邻居的潜力:基于扩散的潜在邻居生成用于基于会话的推荐

Yuhan Yang, Jie Zou, Guojia An, Jiwei Wei, Yang Yang, Heng Tao Shen

专题命中 多模态生成 :multi-modal(abstract)

AI总结 DiffSBR通过基于扩散的潜在邻居生成方法,提升基于会话的推荐性能。

Comments This paper has been accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2601.03515 2026-01-08 cs.CL cs.AI 88%

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CL、cs.AI

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-01-08 cs.CV cs.CL 84%

PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Songyang Zhang, Weijia Li, Bin Wang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Equal contribution: Junyuan Gao, Jiahe Song, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03434 2026-01-08 cs.LG 78%

VNU-Bench: A Benchmarking Dataset for Multi-Source Multimodal News Video Understanding

VNU-Bench:多源多模态新闻视频理解的基准数据集

Zibo Liu, Muyang Li, Zhe Jiang, Shigang Chen

机构 * University of Florida(佛罗里达大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03587 2026-01-08 cs.CR cs.AI cs.DB 74%

Deontic Knowledge Graphs for Privacy Compliance in Multimodal Disaster Data Sharing

德性知识图谱用于多模态灾难数据共享中的隐私合规

Kelvin Uzoma Echenim, Karuna Pande Joshi

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本文提出基于德性知识图谱的框架,用于多模态灾难数据共享中的隐私合规,通过整合灾难管理知识图谱和政策知识图谱,实现更灵活的访问控制和合规验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03733 2026-01-08 cs.CV cs.AI cs.CL cs.CY cs.LG 67%

RadDiff: Describing Differences in Radiology Image Sets with Natural Language

RadDiff:用自然语言描述放射学图像集的差异

Xiaoxian Shen, Yuhui Zhang, Sahithi Ankireddy, Xiaohan Wang, Maya Varma, Henry Guo, Curtis Langlotz, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 RadDiff通过多模态代理系统实现放射学图像集差异的自然语言描述,结合医学知识和多模态推理,在放射学研究配对中取得高准确率,推动临床影像分析的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03594 2026-01-08 cs.CR 67%

Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense

突破大语言模型与视觉语言模型:机制、评估与统一防御

Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang, Litian Zhang, Yiming He

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17394 2026-01-08 cs.CL cs.CV cs.CY 62%

Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?

视觉语言模型是否是跨文化理论思维推理者?

Zabir Al Nazi, GM Shahariar, Md. Abrar Hossain, Wei Peng

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文提出CulturalToM-VQA基准测试集,评估视觉语言模型在跨文化理论思维推理中的表现,发现前沿模型在准确性上显著提升,但存在假信念推理和区域差异等局限,揭示模型的社会可取性偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00947 2026-01-08 cs.CL cs.AI 62%

Table as a Modality for Large Language Models

表格作为大语言模型的一种模态

Liyao Li, Chao Ye, Wentao Ye, Yifei Sun, Zhe Jiang, Haobo Wang, Jiaming Tian, Yiming Zhang, Ningtao Wang, Xing Fu, Gang Chen, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) University of Michigan(密歇根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 TAMO通过将表格视为独立模态,结合文本令牌,提升大语言模型对表格数据的推理能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏