arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-12 至 2026-01-12 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 3 篇

2501.01042 2026-01-12 cs.CV cs.CR cs.LG 83%

Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach

视频基于多模态大语言模型中的对抗攻击可迁移性:一种跨模态图像到视频的方法

Linhao Huang, Xue Jiang, Zhiqiang Wang, Wentao Mo, Xi Xiao, Yong-Jie Yin, Bo Han, Feng Zheng

专题命中 视频多模态 :cross-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种跨模态图像到视频的对抗攻击方法,用于研究视频多模态大语言模型的可迁移性,实验表明该方法在多个视频-文本多模态任务中表现出强对抗转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05495 2026-01-12 cs.CV cs.CL 81%

MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding

MMViR:一种多模态和多粒度表示用于长视频理解

Zizhong Li, Haopeng Zhang, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校信息融合实验室) ALOHA Lab, University of Hawaii at Mānoa(夏威夷大学马诺阿分校ALOHA实验室)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 MMViR通过多模态和多粒度表示提升长视频理解,实现更高效的检索和更优的性能表现。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05688 2026-01-12 cs.CV 70%

SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More

SketchVL:通过细粒度信用分配进行政策优化以实现图表理解和更多

Muye Huang, Lingling Zhang, Yifei Li, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University, China(计算机科学与技术学院,西安交通大学) MOE KLINNS Lab, Xi’an Jiaotong University, China(教育部KLINNS实验室,西安交通大学) Zhongguancun Academy, Beijing, China(中关村学院,北京)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SketchVL通过细粒度信用分配优化,提升多模态大语言模型在图表理解和多领域推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏