arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46618 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4790 篇

2510.14862 2026-05-26 cs.CV cs.DC 79%

Multi-modal video data-pipelines for machine learning with minimal human supervision

最小人工监督的机器学习多模态视频数据管道

Mihai-Cristian Pîrvu, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy "Simion Stoilow"(罗马尼亚科学院数学研究所 "Simion Stoilow") Faculty of Automatic Control and Computer Science, National University of Science and Technology POLITEHNICA(自动控制与计算机科学系,波兰技术大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出一种全自动数据管道,利用预训练专家模型和程序化组合,在无需人工监督下融合多种视觉模态,并基于PHG-MAE模型实现高效蒸馏,以低参数(<1M)达到与300M参数模型竞争的性能,部署于实时语义分割和深度估计任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24691 2026-05-26 cs.CV 79%

AdaFuse-Det: Adaptive Cross-Modal Fusion of Event Cameras for Robust Object Detection in Low-Light RGB Imagery

AdaFuse-Det: 自适应跨模态融合事件相机用于低光照RGB图像中的鲁棒目标检测

Raju Imandi, Chethana B, Bharatesh Chakravarthi, Yong-Guk Kim, Manipriya S, Pavan Kumar B N

机构 * SRM University AP, India(印度SRM大学AP分校) Aptiv, Bengaluru, India(印度Aptiv公司,班加罗尔) Arizona State University, USA(美国亚利桑那州立大学) Sejong University, South Korea(韩国世宗大学) Indian Institute of Information Technology Sri City, India(印度Sri City信息学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出AdaFuse-Det双流框架,通过基于最小方差线性估计的自适应跨模态融合模块融合CLAHE增强RGB与事件数据,在低光照下实现鲁棒目标检测,在LLE-VOS基准上召回率65.54%、精确率53.85%、F1分数59.12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17468 2026-05-25 cs.HC cs.AI 79%

An Interpretable Closed-Loop Intelligent Tutoring System for Multimodal Affective Feedback in Asynchronous Presentation Training

一种可解释的闭环智能辅导系统,用于异步演讲训练中的多模态情感反馈

Hung-Yue Suen, Kuo-En Hung

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于XGBoost的可解释闭环智能辅导系统,通过三层可解释反馈架构将多模态输入映射为可追溯的反馈,在MOOC视频上训练并验证了其提升演讲技能的有效性。

Comments 12 pages, 8 figures, IEEE Transactions on Learning Technologies, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19995 2026-05-25 cs.CV 79%

A Computational Model of Message Sensation Value in Short Video Multimodal Features that Predicts Sensory and Behavioral Engagement

短视频多模态特征中信息感知价值的计算模型预测感官与行为参与

Haoning Xue, Jingwen Zhang, Xiaohui Wang, Diane Dagyong Kim, Yunya Song

机构 * Department of Communication, University of Utah(犹他大学通讯系) Department of Communication, University of California, Davis(加州大学戴维斯分校通讯系) Department of Media and Communication, City University of Hong Kong(香港城市大学媒体与传播系) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科学与技术大学新兴跨学科领域 division)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 基于信息感知价值理论,通过多模态特征分析和人工评估构建计算模型,预测短视频的感官与行为参与,发现MSV与感官参与正相关,与行为参与呈倒U型关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22629 2026-05-22 cs.CV 79%

H-Flow: Self-supervised Human Scene Flow via Physics-inspired Joint Multi-modal Learning

H-Flow:通过物理启发的联合多模态学习实现自监督的人体场景流

Zhanbo Huang, Xiaoming Liu, Yu Kong

机构 * Michigan State University(密歇根州立大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出H-Flow,一种能够同时捕捉骨骼运动学和表面变形的密集人体场景流方法,通过物理启发的联合多模态学习实现自监督,引入高保真合成基准DynAct4D,并在标准基准和零样本场景中优于现有方法。

Comments 19 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22493 2026-05-22 cs.LG cs.AI cs.RO 79%

Understanding Multimodal Failure in Action-Chunking Behavioral Cloning

理解动作分块行为克隆中的多模态失败

Lorenzo Mazza, Massimiliano Datres, Ariel Rodriguez, Sebastian Bodenstedt, Gitta Kutyniok, Stefanie Speidel

机构 * NCT-Dresden(NCT-德累斯顿)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究行为克隆在多模态情况下失败的机制,分析不同多模态参数化在动作分块策略中的不同失效方式,并提出通过调整正则化程度和改进生成策略来提升鲁棒性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19794 2026-05-20 cs.HC cs.AI cs.DB 79%

AffectAI-Capture: A Reproducible Multimodal Protocol for Small-Group Meeting Research

AffectAI-Capture:一种可重复的多模态协议用于小型小组会议研究

Meisam Jamshidi Seikavandi, Alice Modica, Anna Obara, Fabricio Batista Narcizo, Tanya Ignatenko, Ted Vucurevich, Jesper Bünsow Boldt, Paolo Burelli, Andrew Burke Dittberner

机构 * GN Advanced Science, GN Group, Ballerup, Denmark(GN先进科学,GN集团,丹麦Ballerup) IT University of Copenhagen, brAIn lab, Copenhagen, Denmark(哥本哈根IT大学,brAIn实验室,丹麦哥本哈根) Copenhagen Business School, Copenhagen, Denmark(哥本哈根商学院,丹麦哥本哈根) Aalborg University, Denmark(奥尔堡大学,丹麦)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种可重复的多模态协议AffectAI-Capture,用于收集四人会议类互动的同步多模态数据,结合眼动追踪、可穿戴生理、近距离和房间音频、多视角视频、事件日志和结构化自我报告。通过固定任务块和已建立的小组互动范式,结合权威事件时间线和标准化输出进行数据采集和后期处理。本文贡献在于建立了可重复的协议架构,将任务设计、仪器化、时间溯源和数据封装连接起来,用于情绪、行为和会议分析研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13080 2026-05-14 cs.CV 79%

Learning to See What You Need: Gaze Attention for Multimodal Large Language Models

学习你需要看到的东西:多模态大语言模型的注视注意力

Junha Song, Byeongho Heo, Geonmo Gu, Jaegul Choo, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Gaze Attention机制,使多模态大语言模型在生成过程中选择性关注任务相关的视觉区域,减少冗余计算并提升聚焦效果,实验表明其在图像和视频理解任务中性能优于密集注意力基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22455 2026-05-14 cs.CV 79%

Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge

探索多模态大语言模型用于边缘端在线事件记忆问答

Giuseppe Lando, Rosario Forte, Antonino Furnari

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(数学与计算机科学系,卡塔尼亚大学,意大利)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在边缘端实时在线事件记忆问答中的可行性,通过双线程架构实现视频转文本记忆与问答推理,实验显示边缘端方案在隐私保护方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11760 2026-05-13 cs.CV 79%

M$^4$-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection

M$^4$-SAM:基于内存增强的SAM多模态混合专家用于RGB-D视频显著目标检测

Jiyuan Liu, Jia Lin, Xiaofei Zhou, Runmin Cong, Deyang Liu, Zhi Liu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Shandong University(山东大学) Anqing Normal University(安庆师范学院) Shanghai University(上海大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 M$^4$-SAM通过引入模态感知MoE-LORA、分层特征融合和伪引导初始化,提升SAM2在RGB-D视频显著目标检测中的性能,实现零样本检测。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09343 2026-05-12 cs.AI 79%

SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making

SKG-VLA:用于结构化场景语义和决策制定多模态推理的场景知识图谱先验

Zeyu Li, Lei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SKG-VLA通过构建场景知识图谱,提升多模态投诉决策的推理能力与准确性,采用三阶段训练策略注入结构化场景先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03276 2026-05-12 cs.CV 79%

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

VEBench: 多模态大模型在真实世界视频编辑中的基准测试

Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) CRCV, University of Central Florida(中央佛罗里达大学CRCV)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VEBench通过高质量视频和人工验证问题对多模态大模型在视频编辑中的知识理解和操作推理能力进行评估,揭示当前模型与人类水平间的显著差距。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08084 2026-05-11 cs.RO cs.CV 79%

123D: Unifying Multi-Modal Autonomous Driving Data at Scale

123D:规模化统一多模态自动驾驶数据

Daniel Dauner, Valentin Charraut, Bastian Berle, Tianyu Li, Long Nguyen, Jiabao Wang, Changhui Jing, Maximilian Igl, Holger Caesar, Boris Ivanovic, Yiyi Liao, Andreas Geiger, Kashyap Chitta

机构 * KE:SAI University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) NVIDIA Research(NVIDIA研究) Valeo Brain(法雷奥大脑) OpenDriveLab at Shanghai Innovation Institute(上海创新研究院自动驾驶实验室) Zhejiang University(浙江大学) Delft University of Technology(代尔夫特理工大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 123D通过单一API统一多模态自动驾驶数据,解决数据碎片化、同步难题,并提供分析工具,支持跨数据集3D目标检测和强化学习规划应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07232 2026-05-11 cs.CV 79%

Towards multi-modal forgery representation learning for AI-generated video detection and localization

迈向多模态伪造表示学习的AI生成视频检测与定位

Dat Le, Khoa Nguyen, Xin Wang, Shu Hu

机构 * Purdue University(普渡大学) University at Albany, SUNY(纽约州立大学阿尔巴尼分校)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态融合框架,结合语义、时空视觉与多尺度音频分支,实现AI生成视频的检测与细粒度时间定位,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00963 2026-05-05 cs.RO cs.AI 79%

Ablation Study of Multimodal Perception, Language Grounding, and Control for Human-Robot Interaction in an Object Detection and Grasping Task

多模态感知、语言接地与控制在物体检测与抓取任务中的人机交互消融研究

Zi Tian, Guanting Shen

机构 * Dalian University of Technology(大连理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过消融研究探讨多模态感知、语言接地和控制模块对端到端性能的影响,评估最佳组合以优化执行时间和成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01116 2026-05-04 cs.CV 79%

Structural Prognostic Event Modeling for Multimodal Cancer Survival Analysis

多模态癌症生存分析中的结构预后事件建模

Yilan Zhang, Li Nanbo, Changchun Yang, Jürgen Schmidhuber, Xin Gao

机构 * King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SlotSPE框架,通过槽注意力机制压缩多模态数据为结构化槽,有效建模癌症生存分析中的复杂交互,提升预后相关性与可解释性。

Comments 37 pages, 14 Figures

Journal ref The Fourteenth International Conference on Learning Representations (ICLR2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00351 2026-05-04 cs.LG cs.AI 79%

Hypergraph and Latent ODE Learning for Multimodal Root Cause Localization in Microservices

超图与潜在ODE学习用于微服务多模态根本原因定位

Xin Liu, Yuhang He, Sichen Zhao, Kejian Tong, Xingyu Zhang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HyperODE RCA框架,结合超图注意力学习、潜在ODE和多模态交叉注意力融合,用于微服务系统中精细的根本原因分析,通过可微超边构建学习高阶服务交互,利用ODE RNN编码捕捉异常演变,采用上下文感知模态路由融合多种数据,提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26379 2026-04-30 cs.CV 79%

A Multimodal Pre-trained Network for Integrated EEG-Video Seizure Detection

一种用于整合EEG-视频癫痫发作检测的多模态预训练网络

Tong Lu, Ke Xu, Zimo Zhang, Zitong Zhao, Danwei Weng, Ruiyu Wang, Miao Liu, Zizuo Zhang, Jingyi Yao, Yixuan Zhao, Wenchao Zhang, Min Wang, Guoming Luan, Minmin Luo, Zhifeng Yue

机构 * organization= Beijing Institute for Brain Research, Chinese Academy of Medical Sciences \& Peking Union Medical College , city= Beijing , postcode= 102206 , country= China organization= Chinese Institute for Brain Research, Beijing , city= Beijing , postcode= 102206 , country= China organization= Department of Neurosurgery, SanBo Brain Hospital, Capital Medical University , city= Beijing , postcode= 100018 , country= China organization= GenAns Biotechnology Co., Ltd , city= Beijing , postcode= 102206 , country= China organization= Laboratory for Clinical Medicine, Capital Medical University , city= Beijing , postcode= 100069 , country= China organization= Center of Epilepsy, Beijing Institute for Brain Disorders, Sanbo Brain Hospital, Capital Medical University , city= Beijing , postcode= 100018 , country= China organization= Beijing Key Laboratory of Brain Science

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EEGVFusion框架,结合自监督EEG学习、时空视频编码、最优传输对齐和双向交叉注意力,整合神经和行为证据,实现高准确率的癫痫发作检测,同时降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26247 2026-04-30 cs.IR cs.AI 79%

TimeMM: Time-as-Operator Spectral Filtering for Dynamic Multimodal Recommendation

TimeMM: 时域作为算子的动态多模态推荐谱过滤

Wei Yang, Rui Zhong, Zihan Lin, Xiaodan Wang, Cheng Chen, Huan Ren, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 TimeMM通过时域算子谱过滤框架,解决动态多模态推荐中用户兴趣非平稳性问题,引入自适应谱过滤和模态感知路由,提升推荐性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18662 2026-04-30 cs.RO cs.AI 79%

M2R2: MultiModal Robotic Representation for Temporal Action Segmentation

M2R2:多模态机器人表示用于时序动作分割

Daniel Sliwowski, Dongheui Lee

机构 * Autonomous Systems Lab, Technische Universität Wien (TU Wien)(自主系统实验室,维也纳技术大学) Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(机器人与机电研究所,德国航空航天中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出M2R2多模态特征提取器,结合本体感知和体外感知信息,解决时序动作分割中多模态特征复用难题,并在三个机器人数据集上取得新突破。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25584 2026-04-29 cs.AI 79%

DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

DualFact+: 一种用于过程视频理解的多模态事实验证框架

Cennet Oguz, Yasser Hamidullah, Josef van Genabith, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland Informatics Campus(萨尔兰信息学校区)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DualFact+通过双层多模事实验证框架,针对过程视频描述中的概念事实和上下文事实进行评估,揭示了多模态事实 grounding 的挑战。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23173 2026-04-28 cs.CV 79%

One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

一个身份,多种角色:多模态实体指代用于增强视频情境识别

Balaji Darur, Amanmeet Garg, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(IIIT海得拉尔学院计算机视觉研究所,印度) Amazon Prime Video, Seattle(亚马逊Prime视频,西雅图)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态实体指代(MEC)方法,通过结合文本和视频信息提升视频情境识别的准确性和一致性,实验结果显示在描述和视觉定位方面均取得显著提升。

Comments Accepted to CVPR 2026 Findings. Project Page: https://katha-ai.github.io/projects/cinemec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21094 2026-04-28 cs.CV 79%

EMCompress: Video-LLMs with Endomorphic Multimodal Compression

EMCompress: 具有端态多模态压缩的视频大语言模型

Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出端态多模态压缩(EMC)作为视频问答的结构约束充分统计问题,通过端态变换保持答案不变性,提升视频语言理解的训练和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21235 2026-04-24 cs.LG cs.CL stat.ME 79%

Learning Dynamic Representations and Policies from Multimodal Clinical Time-Series with Informative Missingness

从具有信息性缺失的多模态临床时间序列中学习动态表示和策略

Zihan Liang, Ziwen Pan, Ruoxuan Xiong

机构 * Emory University(埃默里大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种多模态临床时间序列患者表示学习框架,利用信息性缺失来提升治疗策略学习和患者预后预测性能。

Comments Findings of ACL 2026 (30 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07295 2026-04-23 cs.RO cs.AI 79%

Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots

多模态全身控制学习用于现实世界的人形机器人

Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

机构 * Collaborative Robotics and Intelligent Systems Institute (CoRIS)(协同机器人与智能系统研究所)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态全身控制器,通过统一接口实现多样化的人形机器人行为控制,展示了在仿真和真实世界中的有效性。

Comments Website: https://masked-humanoid.github.io/mhc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16367 2026-04-21 cs.CY cs.AI 79%

Talk, Walk, and Market Response: Multimodal Measurement of AI Washing and Its Capital Market Consequences in China

讲话、行走与市场反应:多模态测量AI洗绿及其资本市场后果在中国

Wen Zhanjie, Guo Jingqiao

机构 * School of Economics and Trade, Guangdong University of Finance(广东金融学院经济贸易学院) Department of Computer Science, Faculty of Science, Hong Kong Baptist University(香港 Baptist 大学科学学院计算机科学系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过多模态方法测量中国AI洗绿现象,发现其对资本市场的负面影响,揭示了AI投资与实际创新之间的关系及市场反应机制。

Comments 18 pages, 3 figures, 7 tables, academic research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15127 2026-04-20 cs.MM 79%

MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production

MCSC-Bench:多模态情境到脚本创建用于真实视频制作

Huanran Hu, Zihui Ren, Dingyi Yang, Liangyu Chen, Qixiang Gao, Tiezheng Ge, Qin Jin

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出MCSC任务,通过多模态输入和用户指令生成结构化视频脚本,并引入首个大规模MCSC数据集MCSC-Bench,包含11K+标注视频,支持全面评估材料选择、叙事规划和条件脚本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15312 2026-04-17 cs.CV 79%

Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo

双向跨模态提示用于事件-帧不对称立体

Ninghui Xu, Fabio Tosi, Lihui Wang, Jiawei Han, Luca Bartolomei, Zhiting Yao, Matteo Poggi, Stefano Mattoccia

机构 * School of Instrument Science and Engineering, Southeast University, State Key Lab of Comprehensive PNT Network and Equipment Technology, Key Lab of Micro-Inertial Instrument and Advanced Navigation Technology, MOE(仪器科学与工程学院,东南大学,综合PNT网络与设备技术国家重点实验室,微惯性仪器与先进导航技术重点实验室,教育部) Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学) College of Computer Science and Software Engineering, Hohai University(计算机科学与软件工程学院,河海大学) Beijing Institute of Technology(北京理工大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Bi-CMPStereo框架,通过双向跨模态提示利用语义和结构特征实现稳健匹配,提升高速运动和复杂光照下的3D感知性能。

Comments CVPR 2026. Code URL: https://github.com/xnh97/Bi-CMPStereo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14766 2026-04-17 eess.SP cs.AI 79%

Temporal Cross-Modal Knowledge-Distillation-Based Transfer-Learning for Gas Turbine Vibration Fault Detection

基于时间跨模态知识蒸馏的转移学习用于燃气轮机振动故障检测

Ali Bagheri Nejad, Mahdi Aliyari-Shoorehdeli, Abolfazl Hasanzadeh

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出基于时间跨模态知识蒸馏的转移学习框架,解决燃气轮机振动故障检测中时间上下文不足和数据稀缺问题,提升特征分离度和诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15602 2026-04-17 cs.CV 79%

TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?

TennisTV: 多模态大语言模型能否理解网球发球?

Zhongyuan Bao, Lejun Zhang

机构 * New York University(纽约大学) Tandon School of Engineering(坦顿工程学院) Shanghai, China(上海,中国) New York, USA(纽约,美国)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏