arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4757 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4757 篇

1601.00022 2016-01-06 cs.CV 79%

Event Specific Multimodal Pattern Mining with Image-Caption Pairs

Hongzhi Li, Joseph G. Ellis, Shih-Fu Chang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1507.08761 2015-08-03 cs.CV 79%

Multimodal Multipart Learning for Action Recognition in Depth Videos

Amir Shahroudy, Gang Wang, Tian-Tsong Ng, Qingxiong Yang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07892 2024-06-10 cs.LG math.DS nlin.CD 79%

Integrating Multimodal Data for Joint Generative Modeling of Complex Dynamics

Manuel Brenner, Florian Hess, Georgia Koppe, Daniel Durstewitz

专题命中 视频多模态 :multimodal(title,abstract)

Comments ICML 2024. Previously published as a workshop paper for the AAAI 2023 Workshop MLmDS as "Multimodal Teacher Forcing for Reconstructing Nonlinear Dynamical Systems"

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19528 2026-07-23 cs.CV cs.AI 新提交 79%

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景

Heesang Han, A. Lynn Abbott, Abhijit Sarkar

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29136 2026-06-30 cs.CV cs.AI 79%

CMTFormer: Marrying Transformer with Hierarchical Information Interaction for RGB-Event Object Detection

CMTFormer:融合Transformer与层次化信息交互的RGB-事件目标检测

Yu Li, Yuenan Hou, Yingmei Wei, Jiangming Chen, Yanming Guo

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出CMTFormer,通过浅层对齐、中层增强和深层可学习融合的层次化交互机制,有效融合RGB帧与事件流,在DSEC-Detection和PKU-DAVIS-SOD基准上超越现有方法。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22870 2026-06-23 cs.CV cs.AI 新提交 79%

VideoLatent: Video-Language Learning via Latent Self-Forcing

VideoLatent: 通过潜在自强制进行视频-语言学习

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI(微图AI)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12813 2026-06-16 cs.CV cs.MM 版本更新 79%

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

DPC-VQA: 解耦质量感知与残差校准用于视频质量评估

Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Baidu Inc.(百度公司) Xinjiang University(新疆大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出DPC-VQA框架,通过冻结多模态大模型提供感知先验,轻量校准分支预测残差修正,实现低训练成本下视频质量评估,在UGC和AIGC基准上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09151 2026-06-09 cs.CV cs.AI cs.LG 版本更新 79%

Video Understanding by Design: How Datasets Shape Video Models

通过设计理解视频:数据集如何塑造视频模型

Lei Wang, Syuan-Hao Li, Piotr Koniusz, Yongsheng Gao

机构 * School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学) School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 本文从数据集视角出发,提出统一框架连接数据集结构、归纳偏差与架构设计,分析数据集特性如何驱动视频理解架构创新,并讨论不同数据体制下的表征偏差。

Comments Research report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00101 2026-06-02 cs.CV cs.AI 79%

CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection

CoCoVideo: 基于商业模型的高质量对比基准用于AI生成视频检测

Huidong Feng, Wentao Chen, Jie Chen, Xinqi Cai, Ruolong Ma, Yinglin Zheng, Yuxin Lin, Ming Zeng

机构 * School of Informatics, Xiamen University(厦门大学信息学院) China Academy of Information and Communications Technology(中国信息通信技术研究院) AI Transcend Pte. Ltd.(AI Transcend有限公司)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有数据集依赖低质量开源模型且商业样本带水印的问题,提出包含13个商业生成器的CoCoVideo-26K对比数据集,并设计结合对比学习与置信门控多模态大语言模型的CoCoDetect检测框架,实现高保真AI生成视频的鲁棒检测。

Comments Accepected by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16953 2026-05-26 cs.AI cs.CL 79%

How do Humans Process AI-generated Hallucination Contents: a Neuroimaging Study

人类如何处理AI生成的幻觉内容:一项神经影像学研究

Shuqi Zhu, Yi Zhong, Ziyi Ye, Bangde Du, Yujia Zhou, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Institute of Trustworthy Embodied AI, Fudan University, Shanghai, China(复旦大学可信具身人工智能研究院)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 通过EEG实验,研究人类在处理多模态大语言模型生成的幻觉与非幻觉内容时的神经动力学差异,揭示误判的幻觉内容未能触发标准神经认知事实验证通路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00891 2026-05-05 cs.CV cs.AI 79%

X2SAM: Any Segmentation in Images and Videos

X2SAM:图像和视频中的任意分割

Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 X2SAM是一种统一的分割多模态大语言模型,能够将图像分割能力扩展到视频,结合LLM和Mask Memory模块,支持通用、开放词汇、指称、推理、基于视觉的对话生成及交互式分割。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05418 2026-04-17 cs.CV cs.AI 79%

VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG

VideoStir:通过时空结构化和意图感知的RAG理解长视频

Honghao Fu, Miao Xu, Yiwei Wang, Dailing Zhang, Jun Liu, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校) Institute of Automation, CAS(中国科学院自动化研究所) Lancaster University(兰卡斯特大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoStir通过构建时空图和意图相关性评分器,改进长视频RAG框架,实现基于意图的结构化推理,无需辅助信息即可竞争现有最佳基线。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14777 2026-01-22 cs.CV cs.AI 79%

FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes

FunCineForge: 一个统一的数据集工具包和模型,用于多样的影视场景零样本配音

Jiaxuan Liu, Yang Xiang, Han Zhao, Xiangang Li, Zhenhua Ling

机构 * Alibaba Group(阿里巴巴集团) Tongyi Lab(通义实验室)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 FunCineForge提出了一种统一的数据集工具包和模型,用于多样的影视场景零样本配音,通过构建大规模数据集和基于大规模语言模型的模型,提升了音频质量、唇形同步和情绪表达性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06810 2025-12-09 cs.CV cs.CL 79%

MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning

MMDuet2:通过多轮强化学习增强视频MLLMs的主动交互

Yueqian Wang, Songxiang Liu, Disong Wang, Nuo Xu, Guanglu Wan, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 MMDuet2通过多轮强化学习方法,实现了视频MLLMs在多轮对话中的主动交互,提升了回复时机和质量,达到ProactiveVideoQA基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10503 2025-07-29 cs.CV cs.CL cs.LG 79%

Everything is a Video: Unifying Modalities through Next-Frame Prediction

G. Thomas Hudson, Dean Slack, Thomas Winterbottom, Jamie Sterling, Chenghao Xiao, Junjie Shentu, Noura Al Moubayed

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21495 2025-05-01 cs.CV cs.MM 79%

Consistency-aware Fake Videos Detection on Short Video Platforms

Junxi Wang, Jize liu, Na Zhang, Yaxiong Wang

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments 2025 icic

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14423 2025-04-22 cs.CV cs.AI 79%

Adversarial Attack for RGB-Event based Visual Object Tracking

Qiang Chen, Xiao Wang, Haowen Wang, Bo Jiang, Lin Zhu, Dawei Zhang, Yonghong Tian, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Beijing Institute of Technology(北京理工大学) Zhejiang Normal University(浙江师范大学) Peng Cheng Laboratory(鹏城实验室) National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室) School of Electronic and Computer Engineering, Shenzhen, Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02885 2025-04-09 cs.CV cs.AI cs.LG 79%

Expertized Caption Auto-Enhancement for Video-Text Retrieval

Baoyao Yang, Junxiang Chen, Wanyun Li, Wenbin Yao, Yang Zhou

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12109 2024-10-17 cs.CL cs.CV 79%

OMCAT: Omni Context Aware Transformer

Arushi Goel, Karan Sapra, Matthieu Le, Rafael Valle, Andrew Tao, Bryan Catanzaro

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

Comments Demo page: https://om-cat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06176 2023-09-13 cs.CV cs.MM 79%

Dual-Path Temporal Map Optimization for Make-up Temporal Video Grounding

Jiaxiu Li, Kun Li, Jia Li, Guoliang Chen, Dan Guo, Meng Wang

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22819 2026-07-24 cs.CV 版本更新 78%

Cambrian-P: Pose-Grounded Video Understanding

Cambrian-P: 基于姿态的视频理解

Jihan Yang, Zifan Zhao, Xichen Pan, Shusheng Yang, Junyi Zhang, Bingyi Kang, Hu Xu, Shang-Wen Li, Saining Xie

机构 * New York University(纽约大学) UC Berkeley(加州大学伯克利分校) Meta FAIR

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究提出Cambrian-P,一种增强的视频多模态大语言模型,通过引入可学习的相机令牌和姿态回归头,利用姿态作为轻量级监督信号,显著提升了空间推理能力,并在多个视频问答基准上实现了SOTA表现。

Comments Project Page: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23192 2026-08-25 eess.IV 新提交 78%

An Energy-Proportional Multimodal and Context-Aware Vision IoT Node

能量比例型多模态上下文感知视觉物联网节点

Julian Moosmann, Philipp Mayer, Luca Benini, Michele Magno

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 该研究提出一种异构多模态双摄像头架构的视觉物联网节点,采用 TinyissimoYOLOv12 模型,实现节能的始终开启视觉监测,在低功耗下完成目标检测与遥测,可支持三个月运行寿命。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23254 2026-08-25 cs.LG 新提交 78%

From Multimodal Observation to Interpretable Suggestions: Counterfactual Time-Expanded Relational Modeling of Surgical Teams

从多模态观察到可解释建议:手术团队的反事实时间扩展关系建模

Vincenzo Marco De Luca, Antonio Longa, Giovanna Varni, Andrea Passerini

机构 * University of Trento(特伦托大学) UiT the Arctic University of Norway(挪威北极大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 针对现有外科AI忽略团队互动建模的问题,提出tempo-relational框架结合Time-Expanded图,通过反事实程序生成可解释建议,在模拟手术实验中提升了多目标预测性能。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16972 2026-08-19 cs.LG 新提交 78%

MultiSigBERT: Beyond Survival Analysis through Multimodal and Sequential Modeling in Oncology

MultiSigBERT:肿瘤学中超越生存分析的多模态与序列建模

Paul Minchella, Stéphane Chrétien, Guillaume Metzler, Loïc Verlingue, Rémi Vaucher

机构 * Université Lumière Lyon 2(里昂第二大学) Léon Bérard Center(莱昂·贝拉尔中心) EPITA(EPITA(法国高等计算机与技术学院))

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究提出基于路径特征表示的多模态序列生存建模框架MultiSigBERT,结合电子健康记录的多模态数据与时间特性,在含2500余名患者的肿瘤队列上取得0.743的一致性指数,提升了生存预测性能。

Comments Accepted at ECML PKDD 2026, Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12857 2026-08-14 cs.HC 新提交 78%

PolyPresentation: A Multimodal AI Platform for Slide-Aware Iterative Presentation Practice

PolyPresentation:一种面向幻灯片感知迭代演示练习的多模态AI平台

Chen Chen, Jihao Li, Zhiyuan Wen, Tianhui Zhang, Di Zou, Jiannong Cao

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 该研究针对现有AI演示排练工具缺乏幻灯片关联与迭代练习规划支持的问题,推出PolyPresentation多模态AI平台,经20次学术演示对比验证其能提供更优的演示改进支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11109 2026-08-13 cs.RO 版本更新 78%

FEWT: Frequency-Enhanced Wavelet-based Transformer for Multimodal Wheeled Bimanual Manipulation

FEWT:用于多模态轮式双臂操作的频率增强型小波Transformer

Jiaxin Huang, Hanyu Liu, Yunsheng Ma, Jian Shen, Yilin Zheng, Jiayi Wen, Zhigong Song

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究针对轮式双臂操作的空间视觉与物理动力学表示不匹配问题,提出FEWT框架,整合FE-EMA与TS-DWT模块并结合STF传感器,在模拟及真实操作任务中较基准取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08522 2026-08-12 cs.RO 版本更新 78%

EsaacSim: A Multimodal Event Camera Add-on for NVIDIA Isaac Sim

EsaacSim:适用于NVIDIA Isaac Sim的多模态事件相机附加组件

Ignacio Bugueno-Cordova, Malte Kuhlmann, Nicolás Navarro-Guerrero, Miguel Campusano, Rodrigo Verschae

机构 * Leibniz Universität Hannover(莱布尼茨汉诺威大学) L3S Research Center(L3S研究中心) University of Southern Denmark(南丹麦大学) University of Chile(智利大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出适用于NVIDIA Isaac Sim的多模态事件相机附加组件EsaacSim,可实现多模态事件相机在线仿真,在多种分辨率下具备高效性能,支持机器人研究的多模态仿真与合成数据生成。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07730 2026-08-11 cs.NI 新提交 78%

FedSceneX: Time-to-Target Orchestration for Same-Scene Multimodal Federated Edge Learning

FedSceneX:面向同场景多模态联邦边缘学习的目标时间编排

Dhe Yeong Tchalla, Beining Wu, Jun Huang, Shuyang Gu, Qiang Duan

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 FedSceneX针对同场景多模态联邦边缘学习的轮次耗时不固定问题,提出VHP优化方法,在nuScenes基准测试中缩短每轮次活跃时间,20小时预算内准确率最高且保持全部四种模态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29393 2026-08-11 cs.RO 版本更新 78%

AquaJEPA: An Action-Conditioned Multimodal JEPA Family for Underwater Robot Dynamics

AquaJEPA:面向水下机器人动力学的动作条件多模态预测表示

Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov

机构 * ITMO University(ITMO大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 该研究提出动作条件多模态预测模型AquaJEPA,在Stonefish环境中对比多种基线,经120个带计划DVL损失的配对环境实验,其闭环性能最优,配对最终误差显著优于多数基线。

Comments Submitted to IEEE ICRA 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20336 2026-08-11 cs.RO 版本更新 78%

Autonomous Driving with Priority-Ordered STL Specifications Under Multimodal Uncertainty

多模态不确定性下基于优先级排序STL规范的自动驾驶

Taha Bouzid, Shuhao Qi, Mircea Lazar, Sofie Haesaert

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 提出一种不确定性感知的轨迹规划框架,通过信号时序逻辑的词典序优先级处理冲突目标,并结合模型预测路径积分控制实现,在仿真中验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏