arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4757 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4757 篇

1803.10384 2018-03-29 cs.CL cs.IR cs.LG cs.SD eess.AS 76%

Topic Modeling Based Multi-modal Depression Detection

Yuan Gong, Christian Poellabauer

专题命中 视频多模态 :multi-modal(title);分类 cs.CL、eess.AS

Comments Proceedings of the 7th Audio/Visual Emotion Challenge and Workshop (AVEC). (Official Depression Challenge Winner)

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.03946 2017-09-13 cs.AI cs.LG cs.MM cs.NE 76%

Multimodal Content Analysis for Effective Advertisements on YouTube

Nikhita Vedula, Wei Sun, Hyunhwan Lee, Harsh Gupta, Mitsunori Ogihara, Joseph Johnson, Gang Ren, Srinivasan Parthasarathy

专题命中 视频多模态 :multimodal(title);分类 cs.AI、cs.MM

Comments 11 pages, 5 figures, ICDM 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.07075 2017-07-25 cs.CV cs.MM 76%

Automatic Curation of Golf Highlights using Multimodal Excitement Features

Michele Merler, Dhiraj Joshi, Quoc-Bao Nguyen, Stephen Hammer, John Kent, John R. Smith, Rogerio S. Feris

专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交 75%

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05774 2026-06-05 cs.CV cs.AI cs.CL 75%

Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding

主动视频感知:用于代理长视频理解的迭代证据寻求

Ziyang Wang, Honglu Zhou, Shijie Wang, Junnan Li, Caiming Xiong, Silvio Savarese, Mohit Bansal, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种主动视频感知框架AVP,通过迭代计划-观察-反思过程,主动决定视频内容的观察目标和时间,以提高长视频理解的准确性和效率。

Comments Website: https://activevideoperception.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05115 2026-06-04 cs.CV cs.AI cs.CL 75%

Continual Visual and Verbal Learning Through a Child's Egocentric Input

通过儿童自我中心输入进行持续的视觉与语言学习

Xiaoyang Jiang, Yanlai Yang, Kenneth A. Norman, Brenden Lake, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学) Department of Psychology, Princeton University(心理学系,普林斯顿大学)

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出BabyCL持续多模态学习框架,在单一时间顺序处理SAYCam数据集,通过流式视觉表示学习和图像-文本对比目标,在SAYCam Labeled-S 4AFC基准上优于流式学习基线,缩小了与离线训练上限的差距。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02443 2026-06-02 cs.CL cs.AI cs.CV 75%

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

PaSBench-Video: 面向主动安全预警的流式视频基准

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14882 2026-05-26 cs.MM cs.CL cs.CV cs.IR 75%

Hierarchical Local-Global Transformer for Temporal Sentence Grounding

层次化局部-全局Transformer用于时间语句定位

Xiang Fang, Daizong Liu, Pan Zhou, Zichuan Xu, Ruixuan Li

机构 * Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(大数据安全湖北工程研究中心,华中科技大学网络安全科学与工程学院) Wangxuan Institute of Computer fTechnology, Peking University(王宣计算机技术研究院,北京大学) School of software, Dalian University of Technology(软件学院,大连理工大学) School of Computer Science, and Technology, Huazhong University of Science, and Technology(计算机科学与技术学院,华中科技大学)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 提出层次化局部-全局Transformer(HLGT),通过建模视频和查询的不同粒度层次及跨模态交互,实现更细粒度的多模态表示,并在三个数据集上取得最先进性能。

Comments Publish in IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20646 2026-05-21 cs.SI 75%

DisImpact: Quantifying the Physi-Social Impact of Natural Disasters Through Social Media

DisImpact:通过社交媒体量化自然灾害的生理-社会影响

Ruichen Yao, Tejna Dasari, Xuanyu Meng, Elliot Cao, Zelin Li, Yifan Liu, Yaokun Liu, Lanyu Shang, Dong Wang

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 本文提出DisImpact框架,利用多模态大语言模型系统量化自然灾害的生理和社会影响,通过社交媒体内容分类和构建灾害影响指数,实现对灾害影响的统一表示和分析。

Comments Accepted by ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07823 2026-04-16 cs.CV cs.AI cs.MM 75%

LPM 1.0: Video-based Character Performance Model

LPM 1.0:基于视频的角色表现模型

Ailing Zeng, Casper Yang, Chauncey Ge, Eddie Zhang, Garvey Xu, Gavin Lin, Gilbert Gu, Jeremy Pi, Leo Li, Mingyi Shi, Shawn Wang, Sheng Bi, Steven Tang, Thorn Hang, Tobey Guo, Vincent Li, Xin Tong, Yikang Li, Yuchen Sun, Yue Zhao, Yuhan Lu, Yuwei Li, Zane Zhang, Zeshi Yang, Zi Ye

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出LPM 1.0模型,通过构建多模态数据集和训练扩散变换器,实现高可控性和身份一致性的角色表现生成,支持实时交互和无限长度生成。

Comments 43 pages, 15 figures, 2 tables. Project page: https://large-performance-model.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08120 2026-04-10 cs.CV cs.AI cs.CL cs.LG 75%

Small Vision-Language Models are Smart Compressors for Long Video Understanding

小视觉-语言模型是长视频理解的智能压缩器

Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。

Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22918 2026-03-30 cs.CV cs.AI cs.CL 75%

EVA: Efficient Reinforcement Learning for End-to-End Video Agent

EVA: 为端到端视频代理的高效强化学习

Yaolun Zhang, Ruohui Wang, Jiahao Wang, Yepeng Tang, Xuanyu Zheng, Haonan Duan, Hao Lu, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 EVA通过迭代总结-计划-行动-反思推理实现先规划后感知,提升长视频理解效率,采用三阶段学习流程和高质量数据集,在六个视频理解基准上取得显著提升。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 75%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03319 2025-09-23 cs.CV cs.AI cs.MM 75%

SD-VSum: A Method and Dataset for Script-Driven Video Summarization

Manolis Mylonas, Evlampios Apostolidis, Vasileios Mezaris

机构 * ITI, CERTH(ITI、CERTH)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments In ACM Multimedia 2025, DOI:10.1145/3746027.3755821

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03970 2025-04-11 cs.CV cs.AI cs.CL cs.IR 75%

VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models

Dahun Kim, AJ Piergiovanni, Ganesh Mallya, Anelia Angelova

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2025, project page at https://github.com/google-deepmind/video_comp

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09612 2025-04-03 cs.CV cs.AI cs.CL 75%

Olympus: A Universal Task Router for Computer Vision Tasks

Yuanze Lin, Yunsheng Li, Dongdong Chen, Weijian Xu, Ronald Clark, Philip H. S. Torr

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to CVPR 2025, Project webpage: http://yuanze-lin.me/Olympus_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19702 2025-02-13 cs.CV cs.AI cs.MM 75%

TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning

Xiangyu Zeng, Kunchang Li, Chenting Wang, Xinhao Li, Tianxiang Jiang, Ziang Yan, Songze Li, Yansong Shi, Zhengrong Yue, Yi Wang, Yali Wang, Yu Qiao, Limin Wang

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12380 2025-01-22 cs.CV cs.AI cs.CL 75%

MMVU: Measuring Expert-Level Multi-Discipline Video Understanding

Yilun Zhao, Lujing Xie, Haowei Zhang, Guo Gan, Yitao Long, Zhiyuan Hu, Tongyan Hu, Weiyuan Chen, Chuhan Li, Junyang Song, Zhijian Xu, Chengye Wang, Weifeng Pan, Ziyao Shangguan, Xiangru Tang, Zhenwen Liang, Yixin Liu, Chen Zhao, Arman Cohan

专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05854 2024-11-12 cs.MM cs.AI cs.CV cs.CY 75%

Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators

Claire Wonjeong Jo, Miki Wesołowska, Magdalena Wojcieszak

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16533 2024-06-12 cs.CV cs.AI cs.CL 75%

ICSVR: Investigating Compositional and Syntactic Understanding in Video Retrieval Models

Avinash Madasu, Vasudev Lal

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01232 2024-03-22 cs.LG 75%

Modality-aware Transformer for Financial Time series Forecasting

Hajar Emami, Xuan-Hong Dang, Yousaf Shah, Petros Zerfos

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13537 2023-07-26 cs.CV cs.AI cs.MM 75%

Spectrum-guided Multi-granularity Referring Video Object Segmentation

Bo Miao, Mohammed Bennamoun, Yongsheng Gao, Ajmal Mian

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ICCV 2023, code is at https://github.com/bo-miao/SgMg

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14546 2023-01-02 cs.CV cs.CL cs.MM 75%

HiTeA: Hierarchical Temporal-Aware Video-Language Pre-training

Qinghao Ye, Guohai Xu, Ming Yan, Haiyang Xu, Qi Qian, Ji Zhang, Fei Huang

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11446 2022-12-01 cs.CV cs.AI cs.CL 75%

SMAUG: Sparse Masked Autoencoder for Efficient Video-Language Pre-training

Yuanze Lin, Chen Wei, Huiyu Wang, Alan Yuille, Cihang Xie

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16860 2022-11-14 cs.CV cs.MM cs.SD eess.AS eess.IV 75%

Investigating Modality Bias in Audio Visual Video Parsing

Piyush Singh Pasi, Shubham Nemani, Preethi Jyothi, Ganesh Ramakrishnan

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Work under review for ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02681 2021-10-20 cs.CL cs.AI cs.CV cs.LG 75%

VidLanKD: Improving Language Understanding via Video-Distilled Knowledge Transfer

Zineng Tang, Jaemin Cho, Hao Tan, Mohit Bansal

专题命中 视频多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NeurIPS 2021 (19 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22331 2025-09-29 cs.CV cs.AI 74%

Pedestrian Attribute Recognition via Hierarchical Cross-Modality HyperGraph Learning

Xiao Wang, Shujuan Wu, Xiaoxia Cheng, Changwei Bi, Jin Tang, Bin Luo

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学)

专题命中 视频多模态 :multi-modal(abstract,comments);cross-modal(abstract);分类 cs.CV、cs.AI

Comments The First Work that Exploits Multi-modal Knowledge Graph for Pedestrian Attribute Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19951 2025-07-23 cs.CV cs.CL cs.LG 74%

Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation

Shukang Yin, Chaoyou Fu, Sirui Zhao, Chunjiang Ge, Yan Yang, Yuhan Dai, Yongdong Luo, Tong Xu, Caifeng Shan, Enhong Chen

机构 * USTC(中国科学技术大学) NJU(南京大学) THU(清华大学) XMU(厦门大学)

专题命中 视频多模态 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CV、cs.CL

Comments Project page: https://github.com/VITA-MLLM/Sparrow

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14952 2026-08-18 cs.RO cs.CV eess.SP 新提交 74%

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

不存在的证据:当视觉失效时维持世界模型的跨模态溯因风险感知

Cong Xu, Ravi Sankar

机构 * University of South Florida(南佛罗里达大学)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 该研究提出跨模态溯因风险感知方法,在视觉失效时通过声学线索维持世界模型,可提前1.7秒预警,虚警减少42%,校准良好,能在视觉退化下保持高危险感知度。

Comments 7 pages, 3 figures. Working draft prepared for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03142 2026-08-05 stat.ML cs.AI cs.LG 新提交 74%

Minimax-Optimal Semiparametric Contextual Dynamic Pricing with Multimodal Revenue

带多模态收益的极小极大最优半参数情境动态定价

Xueping Gong, Zhuoluo Zhang, Zhaowei Miao, Jiheng Zhang

专题命中 视频多模态 :multimodal(title);分类 cs.AI

AI总结 该研究针对带多模态收益的情境动态定价问题,提出经试点校正的分层决策划分策略,达到依赖极小极大平滑性的时域速率,填补了半参数情境动态定价的相关理论空白。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏