arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2608.28008 2026-08-31 cs.CV 新提交 83%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28383 2026-08-31 cs.CV cs.CL 新提交 81%

Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs

语义头专业化指导多模态大语言模型的混合视觉Transformer注意力机制

Chenhong He, Lei Li, Shicheng Li, Hanglong Lv, Lingpeng Kong, Qi Liu, Tong Yang, Shuhuai Ren

机构 * Peking University(北京大学) Xiaomi Corporation(小米公司) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 该研究针对多模态LLM中混合ViT注意力设计不足的问题,提出语义头专业化(SHS)概念,据此设计Ariadne注意力机制,在22项图像视频任务上性能与全注意力相当,计算量降低6.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28279 2026-08-31 cs.RO 新提交 78%

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

STEGNav:面向多模态终身目标导航的时空事件图推理

Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 针对现有多模态终身导航方法的局限,本文提出无训练框架STEGNav,通过时空事件图的双轴设计优化导航性能,在多个基准数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05917 2026-08-31 cs.CV cs.CL 版本更新 76%

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

MemoryCard: 面向长视频问答的主题感知多模态线索压缩

Qing Yang, Pengcheng Huang, Xinze Li, Zhenghao Liu, Yukun Yan, Yu Gu, Ge Yu, Gang Li, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Digital China Group(数字中国集团)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.CL

AI总结 提出MemoryCard框架,通过将长视频分割为主题事件单元并生成事件级摘要和代表性视觉时刻,以记忆卡形式增强VLMs的长视频问答能力,在相同视觉令牌预算下准确率提升高达21.8%。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28192 2026-08-31 cs.CV 新提交 57%

Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

在视频中定位任意目标:重新思考高效的生成式时空视频定位

Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of California, Merced(加州大学默塞德分校) Apertix(阿珀蒂克斯公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对时空视频定位的自回归解码存在延迟高、误差易传播的问题,提出并行轨迹解码,在VidSTG等数据集上实现显著的延迟降低与吞吐量提升,且可零样本泛化到多项相关任务

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28144 2026-08-31 cs.AI 新提交 57%

The Shape of Power: A Multilingual Framework for Social Power Reasoning in Dialogues

权力的形态:面向对话中社会权力推理的多语言框架

Farah Atif, Sougata Saha, Monojit Choudhury

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究针对现有社会权力计算研究的语言文化局限,提出基于社会科学理论的多语言对话社会权力推理框架,构建含15836个实例的双语语料库,评估6类大模型并发现其与人类推理的差距,为跨文化社会推理提供评估设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27871 2026-08-31 cs.CV 新提交 57%

Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding

时序思维树:面向长视频理解的推理引导型视觉线索搜索

Ziling Huang, Shin'ichi Satoh

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对MLLMs长视频理解的时序组织缺失问题,提出无训练的T³框架,通过分层时序树与“回答-检索-探索”循环实现粗到细的线索搜索,在三个基准数据集上提升了Qwen2.5-VL-7B的性能。

Comments Accept by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28273 2026-08-31 cs.LG 新提交 50%

Learning to Transfer Across Modes: Towards Unified Urban Mobility Forecasting

学习跨模式迁移:面向统一的城市交通预测

Yixuan Zhao, Man Luo

机构 * University of Exeter(埃克塞特大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 针对城市多模式交通需求联合预测的挑战,提出统一框架TransMod,通过共享空间表示对齐不同粒度交通系统,实现跨模式知识迁移,在真实数据集上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏