arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46618 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4790 篇

2604.09326 2026-04-13 cs.RO cs.CV 79%

Multimodal Anomaly Detection for Human-Robot Interaction

多模态异常检测用于人机交互

Guilherme Ribeiro, Iordanis Antypas, Leonardo Bizzaro, João Bimbo, Nuno Cruz Garcia

机构 * LASIGE Faculty of Sciences U. Lisboa, Portugal Dep. of Information Engineering University of Padova Padova, Italy

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MADRI框架,通过将视频流转换为语义特征向量进行基于重建的异常检测,并结合机器人内部传感器数据和场景图,提升人机协作中多模态异常检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08418 2026-04-10 cs.RO cs.AI 79%

Exploring Temporal Representation in Neural Processes for Multimodal Action Prediction

探索神经过程在多模态动作预测中的时间表示

Marco Gabriele Fedozzi, Yukie Nagai, Francesco Rea, Alessandra Sciutti

机构 * DIBRIS Department, University of Genoa(热那亚大学DIBRIS系) CONTACT Unit, Italian Institute of Technology(意大利理工学院CONTACT单元) International Research Center for Neurointelligence, The University of Tokyo(东京大学国际神经智能研究中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了条件神经过程在机器人自监督多模态动作预测中的应用,提出改进的DMBN-PTE模型以提升时间信息表示的鲁棒性。

Comments Submitted to the AIC 2023 (9th International Workshop on Artificial Intelligence and Cognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08062 2026-04-10 cs.HC cs.AI 79%

From Gaze to Guidance: Interpreting and Adapting to Users' Cognitive Needs with Multimodal Gaze-Aware AI Assistants

从注视到引导:通过多模态注视感知AI助手解读和适应用户认知需求

Valdemar Danry, Javier Hernandez, Andrew Wilson, Pattie Maes, Judith Amores

机构 * Microsoft Research(微软研究院) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于注视的多模态LLM助手,通过眼动追踪提升用户阅读行为评估的准确性与个性化,实验表明其能有效提升信息回忆能力并提高交互效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04614 2026-04-09 cs.LG cs.AI 79%

A Clinical Point Cloud Paradigm for In-Hospital Mortality Prediction from Multi-Level Incomplete Multimodal EHRs

一种用于院内死亡预测的临床点云范式:从多级不完整多模态电子健康记录

Bohao Li, Tao Zou, Junchen Ye, Yan Gong, Bowen Du

机构 * Beihang University(北京航空航天大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HealthPoint范式,通过统一的4D空间表示多级不完整多模态EHRs,引入低秩关系注意力机制和分层交互策略,实现灵活的事件级交互与细粒度自监督,提升模态恢复和未标记数据利用效率,实验表明其在风险预测中性能优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05079 2026-04-08 cs.CV 79%

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

SVAgent:通过跨模态多智能体协作实现故事线引导的长视频理解

Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦特大学BCML) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 SVAgent通过跨模态多智能体协作,利用故事线引导实现视频问答的高效理解,提升推理鲁棒性和答案一致性。

Comments Published in CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04239 2026-04-07 cs.LG cs.AI q-bio.QM 79%

Good Rankings, Wrong Probabilities: A Calibration Audit of Multimodal Cancer Survival Models

好的排名,错误的概率:多模态癌症生存模型的校准审计

Sajad Ghawami

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究评估了多模态癌症生存模型的校准性,发现其生存概率未经过校准,提出通过Post-hoc Platt缩放可减少误校准,但不改变区分能力。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03685 2026-04-07 cs.CV 79%

DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

DSERT-RoLL:多模态感知用于多样驾驶条件的鲁棒性,结合立体事件-RGB-热成像相机、4D雷达和双光雷达

Hoonhee Cho, Jae-Young Kang, Yuhwan Jeong, Yunseo Yang, Wonyoung Lee, Youngho Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab, KAIST(韩国科学技术院视觉智能实验室)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出DSERT-RoLL数据集,结合立体事件、RGB和热成像相机以及4D雷达和双光雷达,涵盖多样的天气和光照条件,提供精确的2D和3D边界框及轨迹ID,支持跨传感器组合的公平比较,提升新型传感器的数据可用性,并建立统一的3D和2D基准,促进传感器性能的系统研究。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00318 2026-04-07 cs.CV 79%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19851 2026-04-02 cs.CV 79%

Towards Online Multi-Modal Social Interaction Understanding

面向在线多模态社交交互理解

Xinpeng Li, Shijian Deng, Bolin Lai, Weiguo Pian, James M. Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出在线多模态社交交互理解问题,通过历史信息实现多模态社交交互理解,采用多模态大语言模型框架,引入多对话者预测和社交感知视觉提示,实现三个任务的最优性能。

Comments Accepted to Transactions on Machine Learning Research (TMLR). Project page: https://sampson-lee.github.io/online-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27690 2026-03-31 cs.CV 79%

Customized Visual Storytelling with Unified Multimodal LLMs

基于统一多模态大语言模型的定制化视觉叙事

Wei-Hua Li, Cheng Sun, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。

Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27531 2026-03-31 cs.CV 79%

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

OmniColor: 一种多模态线稿上色的统一框架

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 OmniColor提出一种统一框架,通过空间对齐和语义参考信号分类,提升线稿上色的可控性、视觉质量和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26699 2026-03-31 eess.SP cs.CV cs.LG 79%

EMPD: An Event-based Multimodal Physiological Dataset for Remote Pulse Wave Detection

EMPD:基于事件的多模态生理数据集用于远程脉波检测

Qian Feng, Pengfei Li, Rongshan Gao, Jiale Xu, Rui Gong, Yidi Li

机构 * College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 EMPD数据集通过事件相机和临床级脉氧仪采集多模态数据,用于提升非接触式生理监测算法的鲁棒性,支持高时间精度的脉波检测。

Comments 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25420 2026-03-27 cs.CV 79%

VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

VideoWeaver:多模态多视角视频到视频转换用于具身智能体

George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Yang Bai, Liudi Yang, Ziyuan Liu

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Ludwig Maximilian University of Munich(慕尼黑大学) University of Freiburg(弗莱堡大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VideoWeaver是首个多视角视频到视频转换框架,通过共享4D潜在空间实现多视角一致性,支持动态相机运动和不同视角的自回归合成,提升具身智能体在真实环境中的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24636 2026-03-27 cs.LG cs.AI 79%

DyMRL: Dynamic Multispace Representation Learning for Multimodal Event Forecasting in Knowledge Graph

DyMRL: 动态多空间表征学习用于知识图谱中的多模态事件预测

Feng Zhao, Kangzheng Liu, Teng Peng, Yu Yang, Guandong Xu

机构 * Huazhong University of Science and Technology(华中科技大学) Centre for Learning, Teaching and Technology(学习、教学与技术中心) The Education University of Hong Kong(香港教育大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DyMRL通过动态多空间表征学习,解决多模态知识动态获取与融合问题,提升事件预测性能。

Comments Accepted to The ACM Web Conference 2026 (WWW '26). This version is published under a CC BY license

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22313 2026-03-25 cs.LG cs.AI 79%

A Multi-Modal CNN-LSTM Framework with Multi-Head Attention and Focal Loss for Real-Time Elderly Fall Detection

一种集成多头注意力和聚焦损失的多模态CNN-LSTM框架用于实时老年人跌倒检测

Lijie Zhou, Luran Wang

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态深度学习框架MultiModalFallDetector,结合多尺度CNN、多传感器数据融合、多头注意力机制和聚焦损失,实现高精度实时老年人跌倒检测,实验表明其在SisFall数据集上达到98.7的F1分数,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 79%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20351 2026-03-24 cs.CR cs.AI 79%

MANA: Towards Efficient Mobile Ad Detection via Multimodal Agentic UI Navigation

MANA:通过多模态代理UI导航实现高效的移动广告检测

Yizhe Zhao, Yongjian Fu, Zihao Feng, Hao Pan, Yongheng Deng, Yaoxue Zhang, Ju Ren

机构 * Department of Computer Science and Technology(计算机科学与技术系) University of Southern California(南加州大学) Shanghai Jiao Tong University(上海交通大学) State Key Laboratory of Internet Architecture(互联网架构国家重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MANA框架,通过整合多种信号实现高效移动广告检测,提升准确率和效率,有效识别隐蔽恶意广告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10887 2026-03-20 cs.CV 79%

AutoOEP -- A Multi-modal Framework for Online Exam Proctoring

AutoOEP -- 一种用于在线考试监考的多模态框架

Aryan Kashyap Naveen

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出AutoOEP,通过计算机视觉和机器学习实现高效的自动监考,采用双摄像头和LSTM网络检测可疑行为,准确率达90.7%。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV 79%

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15392 2026-03-17 cs.MM cs.HC 79%

Multimodal Cyber-physical Interaction in XR: Hybrid Doctoral Thesis Defense

XR中的多模态物理交互:混合博士论文答辩

Ahmad Alhilal, Kit Yung Lam, Lik-Hang Lee, Xuetong Wang, Sijia Li, Matti Siekkinen, Tristan Braud, Pan Hui

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出一种多模态框架,突破传统答辩模式,支持现场、虚拟现实和浏览器等多种参与方式,通过全身体姿追踪实现自然交互,验证了其在混合活动中的有效性。

Comments 10 pages, 3 figures, magazine paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07463 2026-03-17 cs.CV cs.LG eess.IV 79%

MSEG-VCUQ: Multimodal SEGmentation with Enhanced Vision Foundation Models, Convolutional Neural Networks, and Uncertainty Quantification for High-Speed Video Phase Detection Data

MSEG-VCUQ: 多模态分割与增强视觉基础模型、卷积神经网络和不确定性量化用于高速视频相位检测数据

Chika Maduabuchi, Ericmoore Jossou, Matteo Bucci

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MSEG-VCUQ,结合U-Net和SAM提升高速视频相位检测分割精度,引入不确定性量化和首个开源多模态数据集,实现更可靠的相位分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13759 2026-03-17 cs.CV 79%

QTrack: Query-Driven Reasoning for Multi-modal MOT

QTrack: 基于查询的多模态 MOT 推理

Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。

Comments Project Page: https://gaashlab.github.io/QTrack/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13367 2026-03-17 cs.CV cs.LG 79%

Multimodal Deep Learning for Dynamic and Static Neuroimaging: Integrating MRI and fMRI for Alzheimer Disease Analysis

多模态深度学习用于动态和静态神经影像:整合MRI和fMRI进行阿尔茨海默病分析

Anima Kujur, Zahra Monfared

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习框架,整合MRI和fMRI对阿尔茨海默病、轻度认知障碍和正常认知状态进行多类分类,通过3D卷积神经网络提取结构特征,用递归架构学习fMRI的时间特征,并融合这些表示进行联合空间-时间学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12746 2026-03-16 cs.CV 79%

Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态

Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09287 2026-03-11 cs.CV 79%

Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking

探索多模态感知融合与解耦时间传播用于多模态目标跟踪

Shilei Wang, Pujian Lai, Dong Gao, Jifeng Ning, Gong Cheng

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 MDTrack通过模态感知融合和解耦时间传播提升多模态目标跟踪性能,实现统一的模态处理和独立的时间信息捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11954 2026-03-10 cs.AI 79%

UniCast: A Unified Framework for Instance-Conditioned Multimodal Time-Series Forecasting

UniCast: 一个实例条件多模态时间序列预测的统一框架

Sehyuk Park, Soyeon Caren Han, Eduard Hovy

机构 * The Universito of Melbourne(墨尔本大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 UniCast通过实例条件提示和动态模态路由,实现多模态时间序列预测的统一框架,有效提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05581 2026-03-09 cs.LG cs.AI eess.SP 79%

Spatiotemporal Heterogeneity of AI-Driven Traffic Flow Patterns and Land Use Interaction: A GeoAI-Based Analysis of Multimodal Urban Mobility

人工智能驱动交通流模式与土地利用相互作用的时空异质性:基于GeoAI的多模式城市交通分析

Olaf Yunus Laitinen Imanov

机构 * Department of Applied Mathematics(应用数学系) Computer Science (DTU Compute), Technical University of Denmark, Kongens Lyngby, Denmark(计算机科学(DTU Compute),丹麦技术大学,Kongens Lyngby)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出GeoAI混合框架,通过整合MGWR、RF和ST-GCN,分析多模式城市交通的时空异质性及土地利用互动,提升交通管理与政策设计的科学性。

Comments 13 pages, 7 figures, 9 tables. Submitted to Computers, Environment and Urban Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04509 2026-03-06 cs.CV 79%

Recognition of Daily Activities through Multi-Modal Deep Learning: A Video, Pose, and Object-Aware Approach for Ambient Assisted Living

通过多模态深度学习识别日常活动:一种面向环境辅助养老的视频、姿态和物体感知方法

Kooshan Hashemifard, Pau Climent-Pérez, Francisco Florez-Revuelta

机构 * Alicante Institute for Health and Biomedical Research (ISABIAL)(阿利坎特健康与生物医学研究所(ISABIAL)) ValgrAI - Valencian Graduate School and Research Network of Artificial Intelligence(瓦尔格AI——瓦伦西亚人工智能研究生院与研究网络)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习方法,结合视频、姿态和物体信息,用于老年人日常活动识别,提升环境辅助养老系统的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02481 2026-03-04 cs.CV 79%

ModalPatch: A Plug-and-Play Module for Robust Multi-Modal 3D Object Detection under Modality Drop

ModalPatch: 一种插拔式模块,用于在模态缺失情况下鲁棒的多模态3D目标检测

Shuangzhi Li, Lei Ma, Xingyu Li

机构 * University of Alberta, Canada(阿尔伯塔大学) The University of Tokyo, Japan(东京大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 ModalPatch是一种插拔式模块,通过利用传感器数据的时间特性实现感知连续性,提升多模态3D目标检测在模态缺失情况下的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01701 2026-03-03 cs.DB cs.AI 79%

Beyond Single-Modal Analytics: A Framework for Integrating Heterogeneous LLM-Based Query Systems for Multi-Modal Data

超越单一模态分析:一种整合异构LLM查询系统的框架用于多模态数据

Ruyu Li, Tinghui Zhang, Haodi Ma, Daisy Zhe Wang, Yifan Wang

机构 * University of Hawaii at Manoa(夏威夷大学曼纳oa分校) University of Florida(佛罗里达大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出Meta Engine,一种整合异构LLM查询系统的框架,通过统一的语义查询引擎提升多模态数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏