arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4757 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4757 篇

2603.12382 2026-03-16 cs.CV cs.AI 73%

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00288 2026-02-26 cs.CV cs.AI 73%

TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

TimeBlind: 一种用于视频大语言模型的时空组合性基准

Baiqi Li, Kangyi Zhao, Ce Zhang, Chancharik Mitra, Jean de Dieu Nyandwi, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 TimeBlind通过细粒度时空理解基准揭示视频大语言模型对时间动态理解的不足,展示其在实例准确率上的显著劣势,强调对静态视觉捷径的依赖。

Comments For code and data, see https://baiqi-li.github.io/timeblind_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19040 2026-02-24 cs.IR cs.AI cs.MM 73%

Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval

自适应多智能体推理用于文本到视频检索

Jiaxin Wu, Xiao-Yong Wei, Qing Li

机构 * Shenzhen University(深圳大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出自适应多智能体框架,通过动态协调检索、推理和查询重述智能体,提升文本到视频检索的零样本跨模态对齐与复杂查询处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15549 2026-01-23 cs.CV cs.AI 73%

VIOLA: Towards Video In-Context Learning with Minimal Annotations

VIOLA:迈向最小标注的视频情境学习

Ryo Fujii, Hideo Saito, Ryo Hachiuma

机构 * Keio University(Keio大学) Keio AI Research Center(Keio人工智能研究中心) NVIDIA(NVIDIA公司)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 VIOLA通过结合最小专家监督和大量未标注数据,实现高效视频情境学习,显著提升低资源环境下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20898 2025-12-25 cs.CV cs.AI 73%

DGSAN: Dual-Graph Spatiotemporal Attention Network for Pulmonary Nodule Malignancy Prediction

DGSAN:双图时空注意力网络用于肺结节恶性预测

Xiao Yu, Zhaojie Fang, Guanyu Zhou, Yin Shen, Huoling Luo, Ye Li, Ahmed Elazab, Xiang Wan, Ruiquan Ge, Changmiao Wang

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 DGSAN通过双图时空注意力网络融合多模态数据,提升肺结节恶性预测的准确性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16842 2025-12-19 cs.CV cs.AI cs.RO 73%

OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction

OPENTOUCH:将全手触觉带入现实世界交互

Yuxin Ray Song, Jinzhou Li, Rao Fu, Devin Murphy, Kaichen Zhou, Rishi Shiv, Yaqi Li, Haoyu Xiong, Crystal Elaine Owens, Yilun Du, Yiyue Luo, Xianyi Cheng, Antonio Torralba, Wojciech Matusik, Paul Pu Liang

机构 * MIT(麻省理工学院) Duke University(杜克大学) Brown University(布朗大学) University of Washington(华盛顿大学) Harvard University(哈佛大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 OpenTouch是首个现实场景的第一人称全手触觉数据集,通过同步视频-触觉-姿态数据和详细注释,推动多模态感知和机器人操作研究。

Comments https://opentouch-tactile.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10510 2025-11-25 cs.NI cs.AI cs.HC cs.MM 73%

Chat with AI: The Surprising Turn of Real-time Video Communication from Human to AI

与AI聊天:从人类到AI的实时视频通信惊人转变

Jiangkai Wu, Zhiyuan Ren, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.AI、cs.MM

AI总结 本文提出了一种面向AI的实时视频通信方法,通过上下文感知视频流技术降低延迟并提升AI理解视频的准确性。

Comments 9 pages, 10 figures, Proceedings of the 24th ACM Workshop on Hot Topics in Networks (HotNets 2025), College Park, Maryland, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12027 2025-11-18 cs.CV cs.AI 73%

GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory

Jeong Hun Yeo, Sangyun Chung, Sungjune Park, Dae Hoe Kim, Jinyoung Moon, Yong Man Ro

机构 * Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST)) Visual Intelligence Research Section, Superintelligence Creative Research Laboratory, Electronics and Telecommunications Research Institute (ETRI)(视觉智能研究部,超智能创意研究实验室,电子电信研究院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11908 2025-11-18 cs.CV cs.AI 73%

PI-NAIM: Path-Integrated Neural Adaptive Imputation Model

Afifa Khaled, Ebrahim Hamid Sumiea

机构 * University of Science and Technology of China(中国科学技术大学) Universiti Teknologi PETRONAS(Petronas科技大学)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24838 2025-11-11 cs.CV cs.AI 73%

VideoCAD: A Dataset and Model for Learning Long-Horizon 3D CAD UI Interactions from Video

Brandon Man, Ghadi Nehme, Md Ferdous Alam, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24625 2025-10-23 cs.CV cs.AI 73%

Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16972 2025-10-21 cs.CV cs.AI 73%

The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA

Quanzhu Niu, Dengxian Gong, Shihao Chen, Tao Zhang, Yikang Zhou, Haobo Yuan, Lu Qi, Xiangtai Li, Shunping Ji

机构 * Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments The 1st place report of 7th LSVOS challenge RVOS track in ICCV 2025. The code is released in Sa2VA repository: https://github.com/bytedance/Sa2VA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14992 2025-10-20 cs.CV cs.AI 73%

GAZE:Governance-Aware pre-annotation for Zero-shot World Model Environments

Leela Krishna, Mengyang Zhao, Saicharithreddy Pasula, Harshit Rajgarhia, Abhishek Mukherji

机构 * Centific Global Solutions Inc.(Centific全球解决方案公司)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20201 2025-09-24 cs.CV cs.AI 73%

Injecting Explainability and Lightweight Design into Weakly Supervised Video Anomaly Detection Systems

Wen-Dong Jiang, Chih-Yung Chang, Hsiang-Chuan Chang, Ji-Yuan Chen, Diptendu Sinha Roy

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19153 2025-09-09 cs.RO cs.AI cs.CV cs.SY eess.IV eess.SY 73%

QuadKAN: KAN-Enhanced Quadruped Motion Control via End-to-End Reinforcement Learning

Yinuo Wang, Gavin Tao

机构 * Allen Wang Gavin Tao

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments 14pages, 9 figures, Journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05395 2025-09-03 cs.CV cs.IR cs.MM eess.IV 73%

TriPSS: A Tri-Modal Keyframe Extraction Framework Using Perceptual, Structural, and Semantic Representations

Mert Can Cakmak, Nitin Agarwal, Diwash Poudel

机构 * Computer and Information Science, University of Arkansas - Little Rock(计算机与信息科学,亚拉荷马州立大学) ICSI, University of California, Berkeley(ICSI,加州大学伯克利分校) COSMOS Research Center, University of Arkansas - Little Rock(COSMOS研究中心,亚拉荷马州立大学)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04061 2025-09-01 cs.CV cs.MM 73%

Consistent and Invariant Generalization Learning for Short-video Misinformation Detection

Hanghui Guo, Weijie Shi, Mengze Li, Juncheng Li, Hao Chen, Yue Cui, Jiajie Xu, Jia Zhu, Jiawei Shen, Zhangze Chen, Sirui Han

机构 * Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) Tencent(腾讯) Soochow University(苏州大学)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12687 2025-08-26 cs.AI cs.CV 73%

EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding

Ashish Seth, Utkarsh Tyagi, Ramaneswaran Selvakumar, Nishit Anand, Sonal Kumar, Sreyan Ghosh, Ramani Duraiswami, Chirag Agarwal, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14784 2025-08-19 cs.CV cs.AI 73%

LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering

Xinxin Dong, Baoyun Peng, Haokai Ma, Yufei Wang, Zixuan Dong, Fei Hu, Xiaodong Wang

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20177 2025-07-30 cs.CV cs.MM 73%

Towards Universal Modal Tracking with Online Dense Temporal Token Learning

Yaozong Zheng, Bineng Zhong, Qihua Liang, Shengping Zhang, Guorong Li, Xianxian Li, Rongrong Ji

机构 * Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education(教育区块链与智能技术重点实验室,教育部) Guangxi Key Laboratory of Multi-Source Information Mining and Security, Guangxi Normal University(广西多源信息挖掘与安全重点实验室,广西师范大学) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) University of Chinese Academy of Sciences(中国科学院大学) Media Analytics and Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen University(媒体分析与计算实验室,人工智能系,厦门大学)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments arXiv admin note: text overlap with arXiv:2401.01686

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12561 2025-07-28 cs.CV cs.AI 73%

Tell Me What to Track: Infusing Robust Language Guidance for Enhanced Referring Multi-Object Tracking

Wenjun Huang, Yang Ni, Hanning Chen, Yirui He, Ian Bryant, Yezi Liu, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10406 2025-07-22 cs.CV cs.AI 73%

RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models

Yijing Lin, Mengqi Huang, Shuhan Zhuang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02946 2025-07-08 cs.CV cs.AI 73%

Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding

Chenglin Li, Qianglong Chen, fengtao, Yin Zhang

机构 * Zhejiang University(浙江大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00817 2025-07-02 cs.CV cs.AI 73%

CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs

Jiaming Zhang, Rui Hu, Qing Guo, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Beijing Jiaotong University(北京交通大学) A*STAR Project Page(A*STAR项目页面)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23783 2025-07-01 cs.CV cs.AI cs.LG 73%

Mamba-FETrack V2: Revisiting State Space Model for Frame-Event based Visual Object Tracking

Shiao Wang, Ju Huang, Qingchuan Ma, Jinfeng Gao, Chunyi Xu, Xiao Wang, Lan Chen, Bo Jiang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Journal extension of Mamba-FETrack which was published on Pattern Recognition and Computer Vision (PRCV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21184 2025-06-27 cs.CV cs.AI 73%

Task-Aware KV Compression For Cost-Effective Long Video Understanding

Minghao Qin, Yan Shu, Peitian Zhang, Kun Lun, Huaying Yuan, Juenjie Zhou, Shitao Xiao, Bo Zhao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Shanghai Jiao Tong University(上海交通大学) University of Trento(特伦特大学) Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Polytechnic University(香港理工大学) Institute of Automation CAS Beijing China(中国科学院自动化研究所)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19225 2025-06-25 cs.CV cs.AI 73%

Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification

Minghao Qin, Xiangrui Liu, Zhengyang Liang, Yan Shu, Huaying Yuan, Juenjie Zhou, Shitao Xiao, Bo Zhao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Shanghai Jiao Tong University(上海交通大学) University of Trento(特伦特大学) Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 5 Figure, 3 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23922 2025-06-02 cs.CV cs.CL 73%

ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding

David Ma, Huaqing Yuan, Xingjian Wang, Qianbo Zang, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Ni Jiahui, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang, Shiwen Ni, Xiaojie Jin

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22566 2025-05-29 cs.CV cs.AI 73%

Universal Visuo-Tactile Video Understanding for Embodied Interaction

Yifan Xie, Mingyang Li, Shoujie Li, Xingting Li, Guangyu Chen, Fei Ma, Fei Richard Yu, Wenbo Ding

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(SZ))

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21068 2025-05-28 cs.CL cs.CV 73%

Predicting Implicit Arguments in Procedural Video Instructions

Anil Batra, Laura Sevilla-Lara, Marcus Rohrbach, Frank Keller

机构 * University of Edinburgh(爱丁堡大学) TU Darmstadt(德累斯顿理工大学)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏