arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-21 至 2025-11-21 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 6 篇

2511.16227 2025-11-21 cs.CV 79%

SwiTrack: Tri-State Switch for Cross-Modal Object Tracking

SwiTrack:跨模态目标跟踪的三态开关

Boyue Xu, Ruichao Hou, Tongwei Ren, Dongming Zhou, Gangshan Wu, Jinde Cao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Mathematics, Southeast University(东南大学数学学院) Purple Mountain Laboratories(紫金山实验室)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 SwiTrack通过三态开关框架提升跨模态目标跟踪的鲁棒性和精度,实现7.2%和4.3%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15722 2025-11-21 cs.AI 79%

Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods

多模态大语言模型中的空间推理:任务、基准和方法的调查

Weichen Liu, Qiyao Xue, Haoming Wang, Xiangyu Yin, Boyuan Yang, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文调查多模态大语言模型中的空间推理问题,从认知角度分类任务和基准,分析评估方法与改进策略,揭示模型与人类推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16169 2025-11-21 eess.SP 78%

UT-OSANet: A Multimodal Deep Learning model for Evaluating and Classifying Obstructive Sleep Apnea

UT-OSANet: 一种用于评估和分类阻塞性睡眠呼吸暂停的多模态深度学习模型

Zijian Wang, Xiaoyu Bao, Chenhao Zhao, Jihui Zhang, Sizhi Ai, Yuanqing Li

专题命中 视频多模态 :multimodal(title);cross-modal(abstract)

AI总结 UT-OSANet是一种多模态深度学习模型,用于高精度评估和分类阻塞性睡眠呼吸暂停,通过多种输入模态和灵活训练策略实现事件层面的诊断。

Comments 12 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16524 2025-11-21 cs.CV 74%

BoxingVI: A Multi-Modal Benchmark for Boxing Action Recognition and Localization

BoxingVI:一种多模态基准,用于拳击动作识别与定位

Rahul Kumar, Vipul Baghel, Sudhanshu Singh, Bikash Kumar Badatya, Shivam Yadav, Babji Srinivasan, Ravi Hegde

机构 * Indian Institute of Technology Gandhinagar(印度理工学院甘地纳加尔) Indian Institute of Technology Madras(印度理工学院马德拉斯) Dr. A. P. J. Abdul Kalam Technical University(阿卜杜勒·卡拉姆技术大学)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 BoxingVI提供了一个多模态数据集,用于拳击动作识别与定位,旨在促进低资源环境下的实时视觉动作识别研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20470 2025-11-21 cs.CV 57%

Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence

Conan:基于多尺度视觉证据的逐步学习以像侦探一样推理

Kun Ouyang, Yuanxin Liu, Linli Yao, Yishuo Cai, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Conan通过多阶段渐进冷启动策略和AIR RLVR框架,实现证据基础的多步视频推理,超越基线模型,达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05274 2025-11-21 cs.CV 57%

From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos

从游戏到回放:面向时间精细粒度视频的组合视频检索

Animesh Gupta, Jay Parmar, Ishan Rajendrakumar Dave, Mubarak Shah

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 TF-CoVR提出了一种针对时间精细粒度视频检索的框架,通过预训练视频编码器和对比学习提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏