arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4757 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4757 篇

2112.14748 2023-02-01 econ.GN q-fin.EC 71%

Adaptive Transit Design: Optimizing Fixed and Demand Responsive Multi-Modal Transportation via Continuous Approximation

Giovanni Calabro', Andrea Araldo, Simon Oh, Ravi Seshadri, Giuseppe Inturri, Moshe Ben-Akiva

专题命中 视频多模态 :multi-modal(title)

Comments 57 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00888 2023-01-13 cs.LG eess.SP 71%

Smart-Badge: A wearable badge with multi-modal sensors for kitchen activity recognition

Mengxi Liu, Sungho Suh, Bo Zhou, Agnes Gruenerbl, Paul Lukowicz

专题命中 视频多模态 :multi-modal(title)

Comments Presented at HASCA workshop of Ubicomp2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10600 2022-12-28 physics.optics nlin.PS 71%

Robust mode-locking in a hybrid ultrafast laser based on nonlinear multimodal interference

Xuanyi Liu, Maolin Dai, Denghui Pan, Kaibin Lin, Boris A. Malomed, Qian Li, H. Y. Fu

专题命中 视频多模态 :multimodal(title)

Comments to be published in Optics and Laser Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04224 2022-09-12 cs.LG 71%

Modelling Patient Trajectories Using Multimodal Information

João Figueira Silva, Sérgio Matos

专题命中 视频多模态 :multimodal(title)

Comments To be published in Journal of Biomedical Informatics (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06142 2022-05-13 cs.LG 71%

Multimodal Indoor Localisation for Measuring Mobility in Parkinson's Disease using Transformers

Ferdian Jovan, Ryan McConville, Catherine Morgan, Emma Tonkin, Alan Whone, Ian Craddock

专题命中 视频多模态 :multimodal(title)

Comments 17 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.10331 2022-04-28 cs.RO cs.CY cs.HC cs.LG 71%

Exoskeleton-Based Multimodal Action and Movement Recognition: Identifying and Developing the Optimal Boosted Learning Approach

Nirmalya Thakur, Chia Y. Han

专题命中 视频多模态 :multimodal(title)

Journal ref Journal of Advances in Artificial Intelligence and Machine Learning. 2021; Volume 1, Issue 1, Article 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07998 2021-12-16 cs.SI cs.LG physics.soc-ph stat.AP 71%

Multi-modal Networks Reveal Patterns of Operational Similarity of Terrorist Organizations

Gian Maria Campedelli, Iain J. Cruickshank, Kathleen M. Carley

专题命中 视频多模态 :multi-modal(title)

Comments 42 pages, 19 figures

Journal ref Terrorism and Political Violence, 0(0), 1-20 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.06396 2021-08-03 physics.flu-dyn cs.CE cs.LG 71%

Forecasting Thermoacoustic Instabilities in Liquid Propellant Rocket Engines Using Multimodal Bayesian Deep Learning

Ushnish Sengupta, Günther Waxenegger-Wilfing, Jan Martin, Justin Hardi, Matthew P. Juniper

专题命中 视频多模态 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.07716 2021-07-19 eess.SP 71%

Cooperative Multi-Modal Localization in Connected and Autonomous Vehicles

Nikos Piperigkos, Aris S. Lalos, Kostas Berberidis, Christos Anagnostopoulos

专题命中 视频多模态 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.15952 2021-03-31 cs.RO cs.SY eess.SY 71%

Rough-Terrain Locomotion and Unilateral Contact Force Regulations With a Multi-Modal Legged Robot

Kaier Liang, Eric Sihite, Pravin Dangol, Andrew Lessieur, Alireza Ramezani

专题命中 视频多模态 :multi-modal(title)

Comments 8 pages, 5 figure, submitted to accepted in American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.08457 2020-10-19 cs.HC 71%

Multi-Modal Data Collection for Measuring Health, Behavior, and Living Environment of Large-Scale Participant Cohorts: Conceptual Framework and Findings from Deployments

Congyu Wu, Hagen Fritz, Zoltan Nagy, Juan P. Maestre, Edison Thomaz, Christine Julien, Darla M. Castelli, Kaya de Barbaro, Gabriella M. Harari, R. Cameron Craddock, Kerry A. Kinney, Samuel D. Gosling, David M. Schnyer

专题命中 视频多模态 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.08059 2020-04-14 eess.SP cs.LG stat.ML 71%

Towards a Flexible Deep Learning Method for Automatic Detection of Clinically Relevant Multi-Modal Events in the Polysomnogram

Alexander Neergaard Olesen, Stanislas Chambon, Valentin Thorey, Poul Jennum, Emmanuel Mignot, Helge B. D. Sorensen

专题命中 视频多模态 :multi-modal(title)

Comments Accepted for publication in 41st International Engineering in Medicine and Biology Conference (EMBC), July 23-27, 2019

Journal ref 2019 41st Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC), Berlin, Germany, 2019, pp. 556-561

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.08608 2019-11-21 eess.SP cs.HC cs.LG 71%

Seq2Seq RNN based Gait Anomaly Detection from Smartphone Acquired Multimodal Motion Data

Riccardo Bonetto, Mattia Soldan, Alberto Lanaro, Simone Milani, Michele Rossi

专题命中 视频多模态 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.09402 2019-05-24 cs.HC 71%

Detecting Events of Daily Living Using Multimodal Data

Hyungik Oh, Ramesh Jain

专题命中 视频多模态 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.11149 2019-03-27 physics.optics 71%

Multimodal unidirectionnal pulse propagation equation

P. Béjot

专题命中 视频多模态 :multimodal(title)

Comments 12 pages, 7 figures

Journal ref Phys. Rev. E 99, 032217 (2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.00498 2018-09-05 cs.RO 71%

Directional grid maps: modeling multimodal angular uncertainty in dynamic environments

Ransalu Senanayake, Fabio Ramos

专题命中 视频多模态 :multimodal(title)

Comments To appear in the proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.00797 2016-03-21 cs.CY cs.HC 71%

The SPHERE Challenge: Activity Recognition with Multimodal Sensor Data

Niall Twomey, Tom Diethe, Meelis Kull, Hao Song, Massimo Camplani, Sion Hannuna, Xenofon Fafoutis, Ni Zhu, Pete Woznowski, Peter Flach, Ian Craddock

专题命中 视频多模态 :multimodal(title)

Comments Paper describing dataset. 11 pages; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/9902019 2009-11-30 cs.DL cs.HC 71%

Multimodal Surrogates for Video Browsing

Wei Ding, Gary Marchionini, Dagobert Soergel

专题命中 视频多模态 :multimodal(title)

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-08-25 cs.CL 版本更新 70%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 70%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15869 2026-08-18 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 70%

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

超越视觉思维链:用于主动视频推理的内化视觉思维

Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt

机构 * Apple(苹果公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14070 2026-08-17 cs.CV 新提交 70%

InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

Dingbao Shao, Song Wu, Xinyu Chen, Qian Wang, Jiahang Li, Kuai Jiang, Jiang Lin, Yuhang Liu, Ziyu Chen, Duo Li, Jiaxin Hu, Shengrong Gu, Ziheng Tang, Rongrong Liu, Yanlun Peng, Liang Li, Junlan Feng, Lujia Jin, Ting Zhang, Jian Yang, Zili Yi

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。

Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30045 2026-08-14 cs.CV 版本更新 70%

DualEraser: Joint Video Object and Effect Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

机构 * Tsinghua University(清华大学) Pengcheng National Laboratory(鹏城实验室) Huawei(华为) Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11201 2026-08-12 cs.CV 新提交 70%

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习

Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Renmin University of China(中国人民大学) Microsoft(微软公司)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交 70%

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05703 2026-08-07 cs.CV 新提交 70%

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

StreamArena:面向连续、交互式且长视界的智能体流媒体视频理解

Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对当前智能体流媒体视频理解评估的缺陷,提出StreamArena基准,设计StreamMind架构解决连续交互与长视界理解的张力,在四项能力上优于现有基线并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04902 2026-08-06 cs.CV cs.LG cs.SD 新提交 70%

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

视觉表示很重要:利用视频到音频生成中的时间差异

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25266 2026-08-03 cs.CV cs.LG 版本更新 70%

FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

FORGE:用于长视频理解的相关几何中的帧正交性

Ghazal Kaviani, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院) Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28516 2026-07-31 cs.CV 新提交 70%

Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

超越帧选择:用于长视频理解的生成式潜在证据聚合

Bowen Liu, Shuning Wang, Xinpeng Ding, Zhiheng Wu, Bodong Du, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) Baidu Inc.(百度公司) Alibaba Group(阿里巴巴集团) Xidian University(西安电子科技大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对长视频理解的帧选择局限,提出GenEvA框架,通过查询条件化分布聚合跨帧潜在证据,在四个基准和两个视频多模态大语言模型主干上显著提升性能且开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11140 2026-07-30 cs.CV 版本更新 70%

Hyper-FEOD: Sparse Hypergraph-Enhanced Frame-Event Object Detection with Fine-Grained MoE

稀疏超图增强的帧事件目标检测与细粒度MoE

Wei Bao, Yuehan Wang, Tianhang Zhou, Siqi Li

机构 * BNRist, THUIBCS, BLBCI, School of Software, Tsinghua University(清华大学软件学院,北京信息科学与技术国家研究中心,清华-英特尔先进移动计算中心,北京国家信息科学与技术实验室) State Key Laboratory of Heavy Oil Processing, China University of Petroleum (Beijing)(中国石油大学(北京)重质油国家重点实验室)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Hyper-FEOD框架,通过稀疏超图增强交叉模态融合和细粒度MoE增强模块,实现高效的多模态交互优化,提升动态环境下目标检测的准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏