arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2604.04239 2026-04-07 cs.LG cs.AI q-bio.QM 79%

Good Rankings, Wrong Probabilities: A Calibration Audit of Multimodal Cancer Survival Models

好的排名,错误的概率:多模态癌症生存模型的校准审计

Sajad Ghawami

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究评估了多模态癌症生存模型的校准性,发现其生存概率未经过校准,提出通过Post-hoc Platt缩放可减少误校准,但不改变区分能力。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03685 2026-04-07 cs.CV 79%

DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

DSERT-RoLL:多模态感知用于多样驾驶条件的鲁棒性,结合立体事件-RGB-热成像相机、4D雷达和双光雷达

Hoonhee Cho, Jae-Young Kang, Yuhwan Jeong, Yunseo Yang, Wonyoung Lee, Youngho Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab, KAIST(韩国科学技术院视觉智能实验室)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出DSERT-RoLL数据集,结合立体事件、RGB和热成像相机以及4D雷达和双光雷达,涵盖多样的天气和光照条件,提供精确的2D和3D边界框及轨迹ID,支持跨传感器组合的公平比较,提升新型传感器的数据可用性,并建立统一的3D和2D基准,促进传感器性能的系统研究。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00318 2026-04-07 cs.CV 79%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19851 2026-04-02 cs.CV 79%

Towards Online Multi-Modal Social Interaction Understanding

面向在线多模态社交交互理解

Xinpeng Li, Shijian Deng, Bolin Lai, Weiguo Pian, James M. Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出在线多模态社交交互理解问题,通过历史信息实现多模态社交交互理解,采用多模态大语言模型框架,引入多对话者预测和社交感知视觉提示,实现三个任务的最优性能。

Comments Accepted to Transactions on Machine Learning Research (TMLR). Project page: https://sampson-lee.github.io/online-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27690 2026-03-31 cs.CV 79%

Customized Visual Storytelling with Unified Multimodal LLMs

基于统一多模态大语言模型的定制化视觉叙事

Wei-Hua Li, Cheng Sun, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。

Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27531 2026-03-31 cs.CV 79%

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

OmniColor: 一种多模态线稿上色的统一框架

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 OmniColor提出一种统一框架,通过空间对齐和语义参考信号分类,提升线稿上色的可控性、视觉质量和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26699 2026-03-31 eess.SP cs.CV cs.LG 79%

EMPD: An Event-based Multimodal Physiological Dataset for Remote Pulse Wave Detection

EMPD:基于事件的多模态生理数据集用于远程脉波检测

Qian Feng, Pengfei Li, Rongshan Gao, Jiale Xu, Rui Gong, Yidi Li

机构 * College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 EMPD数据集通过事件相机和临床级脉氧仪采集多模态数据,用于提升非接触式生理监测算法的鲁棒性,支持高时间精度的脉波检测。

Comments 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25420 2026-03-27 cs.CV 79%

VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

VideoWeaver:多模态多视角视频到视频转换用于具身智能体

George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Yang Bai, Liudi Yang, Ziyuan Liu

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Ludwig Maximilian University of Munich(慕尼黑大学) University of Freiburg(弗莱堡大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VideoWeaver是首个多视角视频到视频转换框架,通过共享4D潜在空间实现多视角一致性,支持动态相机运动和不同视角的自回归合成,提升具身智能体在真实环境中的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24636 2026-03-27 cs.LG cs.AI 79%

DyMRL: Dynamic Multispace Representation Learning for Multimodal Event Forecasting in Knowledge Graph

DyMRL: 动态多空间表征学习用于知识图谱中的多模态事件预测

Feng Zhao, Kangzheng Liu, Teng Peng, Yu Yang, Guandong Xu

机构 * Huazhong University of Science and Technology(华中科技大学) Centre for Learning, Teaching and Technology(学习、教学与技术中心) The Education University of Hong Kong(香港教育大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DyMRL通过动态多空间表征学习,解决多模态知识动态获取与融合问题,提升事件预测性能。

Comments Accepted to The ACM Web Conference 2026 (WWW '26). This version is published under a CC BY license

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22313 2026-03-25 cs.LG cs.AI 79%

A Multi-Modal CNN-LSTM Framework with Multi-Head Attention and Focal Loss for Real-Time Elderly Fall Detection

一种集成多头注意力和聚焦损失的多模态CNN-LSTM框架用于实时老年人跌倒检测

Lijie Zhou, Luran Wang

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态深度学习框架MultiModalFallDetector,结合多尺度CNN、多传感器数据融合、多头注意力机制和聚焦损失,实现高精度实时老年人跌倒检测,实验表明其在SisFall数据集上达到98.7的F1分数,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 79%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20351 2026-03-24 cs.CR cs.AI 79%

MANA: Towards Efficient Mobile Ad Detection via Multimodal Agentic UI Navigation

MANA:通过多模态代理UI导航实现高效的移动广告检测

Yizhe Zhao, Yongjian Fu, Zihao Feng, Hao Pan, Yongheng Deng, Yaoxue Zhang, Ju Ren

机构 * Department of Computer Science and Technology(计算机科学与技术系) University of Southern California(南加州大学) Shanghai Jiao Tong University(上海交通大学) State Key Laboratory of Internet Architecture(互联网架构国家重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MANA框架,通过整合多种信号实现高效移动广告检测,提升准确率和效率,有效识别隐蔽恶意广告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10887 2026-03-20 cs.CV 79%

AutoOEP -- A Multi-modal Framework for Online Exam Proctoring

AutoOEP -- 一种用于在线考试监考的多模态框架

Aryan Kashyap Naveen

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出AutoOEP,通过计算机视觉和机器学习实现高效的自动监考,采用双摄像头和LSTM网络检测可疑行为,准确率达90.7%。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV 79%

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15392 2026-03-17 cs.MM cs.HC 79%

Multimodal Cyber-physical Interaction in XR: Hybrid Doctoral Thesis Defense

XR中的多模态物理交互:混合博士论文答辩

Ahmad Alhilal, Kit Yung Lam, Lik-Hang Lee, Xuetong Wang, Sijia Li, Matti Siekkinen, Tristan Braud, Pan Hui

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出一种多模态框架,突破传统答辩模式,支持现场、虚拟现实和浏览器等多种参与方式,通过全身体姿追踪实现自然交互,验证了其在混合活动中的有效性。

Comments 10 pages, 3 figures, magazine paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07463 2026-03-17 cs.CV cs.LG eess.IV 79%

MSEG-VCUQ: Multimodal SEGmentation with Enhanced Vision Foundation Models, Convolutional Neural Networks, and Uncertainty Quantification for High-Speed Video Phase Detection Data

MSEG-VCUQ: 多模态分割与增强视觉基础模型、卷积神经网络和不确定性量化用于高速视频相位检测数据

Chika Maduabuchi, Ericmoore Jossou, Matteo Bucci

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MSEG-VCUQ,结合U-Net和SAM提升高速视频相位检测分割精度,引入不确定性量化和首个开源多模态数据集,实现更可靠的相位分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13759 2026-03-17 cs.CV 79%

QTrack: Query-Driven Reasoning for Multi-modal MOT

QTrack: 基于查询的多模态 MOT 推理

Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。

Comments Project Page: https://gaashlab.github.io/QTrack/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13367 2026-03-17 cs.CV cs.LG 79%

Multimodal Deep Learning for Dynamic and Static Neuroimaging: Integrating MRI and fMRI for Alzheimer Disease Analysis

多模态深度学习用于动态和静态神经影像:整合MRI和fMRI进行阿尔茨海默病分析

Anima Kujur, Zahra Monfared

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习框架,整合MRI和fMRI对阿尔茨海默病、轻度认知障碍和正常认知状态进行多类分类,通过3D卷积神经网络提取结构特征,用递归架构学习fMRI的时间特征,并融合这些表示进行联合空间-时间学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12746 2026-03-16 cs.CV 79%

Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态

Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09287 2026-03-11 cs.CV 79%

Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking

探索多模态感知融合与解耦时间传播用于多模态目标跟踪

Shilei Wang, Pujian Lai, Dong Gao, Jifeng Ning, Gong Cheng

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 MDTrack通过模态感知融合和解耦时间传播提升多模态目标跟踪性能,实现统一的模态处理和独立的时间信息捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11954 2026-03-10 cs.AI 79%

UniCast: A Unified Framework for Instance-Conditioned Multimodal Time-Series Forecasting

UniCast: 一个实例条件多模态时间序列预测的统一框架

Sehyuk Park, Soyeon Caren Han, Eduard Hovy

机构 * The Universito of Melbourne(墨尔本大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 UniCast通过实例条件提示和动态模态路由,实现多模态时间序列预测的统一框架,有效提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05581 2026-03-09 cs.LG cs.AI eess.SP 79%

Spatiotemporal Heterogeneity of AI-Driven Traffic Flow Patterns and Land Use Interaction: A GeoAI-Based Analysis of Multimodal Urban Mobility

人工智能驱动交通流模式与土地利用相互作用的时空异质性:基于GeoAI的多模式城市交通分析

Olaf Yunus Laitinen Imanov

机构 * Department of Applied Mathematics(应用数学系) Computer Science (DTU Compute), Technical University of Denmark, Kongens Lyngby, Denmark(计算机科学(DTU Compute),丹麦技术大学,Kongens Lyngby)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出GeoAI混合框架,通过整合MGWR、RF和ST-GCN,分析多模式城市交通的时空异质性及土地利用互动,提升交通管理与政策设计的科学性。

Comments 13 pages, 7 figures, 9 tables. Submitted to Computers, Environment and Urban Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04509 2026-03-06 cs.CV 79%

Recognition of Daily Activities through Multi-Modal Deep Learning: A Video, Pose, and Object-Aware Approach for Ambient Assisted Living

通过多模态深度学习识别日常活动:一种面向环境辅助养老的视频、姿态和物体感知方法

Kooshan Hashemifard, Pau Climent-Pérez, Francisco Florez-Revuelta

机构 * Alicante Institute for Health and Biomedical Research (ISABIAL)(阿利坎特健康与生物医学研究所(ISABIAL)) ValgrAI - Valencian Graduate School and Research Network of Artificial Intelligence(瓦尔格AI——瓦伦西亚人工智能研究生院与研究网络)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习方法,结合视频、姿态和物体信息,用于老年人日常活动识别,提升环境辅助养老系统的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02481 2026-03-04 cs.CV 79%

ModalPatch: A Plug-and-Play Module for Robust Multi-Modal 3D Object Detection under Modality Drop

ModalPatch: 一种插拔式模块,用于在模态缺失情况下鲁棒的多模态3D目标检测

Shuangzhi Li, Lei Ma, Xingyu Li

机构 * University of Alberta, Canada(阿尔伯塔大学) The University of Tokyo, Japan(东京大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 ModalPatch是一种插拔式模块,通过利用传感器数据的时间特性实现感知连续性,提升多模态3D目标检测在模态缺失情况下的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01701 2026-03-03 cs.DB cs.AI 79%

Beyond Single-Modal Analytics: A Framework for Integrating Heterogeneous LLM-Based Query Systems for Multi-Modal Data

超越单一模态分析:一种整合异构LLM查询系统的框架用于多模态数据

Ruyu Li, Tinghui Zhang, Haodi Ma, Daisy Zhe Wang, Yifan Wang

机构 * University of Hawaii at Manoa(夏威夷大学曼纳oa分校) University of Florida(佛罗里达大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出Meta Engine,一种整合异构LLM查询系统的框架,通过统一的语义查询引擎提升多模态数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00405 2026-03-03 cs.LG cs.AI 79%

UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings

UME-R1: 探索基于推理的生成多模态嵌入

Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) WeChat AI, Tencent Inc, China(腾讯公司微信AI部门) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 UME-R1通过生成嵌入和强化学习提升多模态嵌入性能,实现判别与生成嵌入的互补,展现生成嵌入在推理和下游任务中的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03905 2026-03-03 cs.CV 79%

EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation

EchoMimicV3:13亿参数足矣实现统一的多模态和多任务人类动画

Rang Meng, Yan Wang, Weipeng Wu, Ruobing Zheng, Yuming Li, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 EchoMimicV3通过统一多任务和多模态人类动画,以13亿参数实现高效且稳定的多任务和多模态动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23937 2026-03-02 cs.RO cs.CV 79%

Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos

通过真实世界室内游览视频的多模态事件知识增强视觉语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Xingxing Zuo, Yaoxian Song, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(马尔代夫 bin Zayed 大学人工智能学院) Hangzhou City University(杭州城市学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于多模态事件知识的视觉语言导航增强方法,通过构建大规模时空知识图谱并结合层次检索机制,提升长视界推理和粗粒度指令处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08578 2026-03-02 cs.CV 79%

Multimodal Knowledge Distillation for Egocentric Action Recognition Robust to Missing Modalities

多模态知识蒸馏用于抗缺失模态的自体视觉动作识别

Maria Santos-Villafranca, Dustin Carrión-Ojeda, Alejandro Perez-Yus, Jesus Bermudez-Cameo, Jose J. Guerrero, Simone Schaub-Meyer

机构 * I3A – University of Zaragoza(萨拉戈萨大学I3A研究中心) Technical University of Darmstadt, Department of Computer Science(达姆施塔特技术大学计算机科学系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 KARMMA通过多模态知识蒸馏实现抗缺失模态的自体视觉动作识别,以轻量模型提升机器人部署效率。

Comments Project Page: https://visinf.github.io/KARMMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22920 2026-02-27 cs.CV 79%

OSDaR-AR: Enhancing Railway Perception Datasets via Multi-modal Augmented Reality

OSDaR-AR: 通过多模态增强现实提升铁路感知数据集

Federico Nesti, Gianluca D'Amico, Mauro Marinoni, Giorgio Buttazzo

机构 * Department of Excellence in Robotics & AI, Scuola Superiore Sant’Anna(机器人与人工智能卓越部门,圣安娜高等学院) Simulatrix MV srl(Simulatrix MV公司)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出OSDaR-AR数据集,通过多模态增强现实技术整合逼真虚拟对象,提升铁路感知任务的数据质量与真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏