arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-02 至 2025-12-02 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2512.00714 2025-12-02 cs.CV cs.AI 81%

Deep Learning-Based Computer Vision Models for Early Cancer Detection Using Multimodal Medical Imaging and Radiogenomic Integration Frameworks

基于深度学习的计算机视觉模型用于多模态医学影像和放射基因组整合框架中的早期癌症检测

Emmanuella Avwerosuoghene Oghenekaro

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于深度学习的计算机视觉模型,结合多模态医学影像和放射基因组学,用于早期癌症检测,提升肿瘤基因型预测和治疗抗性分析能力。

Journal ref International Journal of Computer Applications Technology and Research, vol. 14, no. 11, pp. 1-14, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12263 2025-12-02 cs.CV cs.AI 81%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07867 2025-12-02 cs.CV 79%

Continuous Perception Matters: Diagnosing Temporal Integration Failures in Multimodal Models

持续感知至关重要:多模态模型中时间整合失败的诊断

Zeyu Wang, Zhenzhen Weng, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CP-Bench,通过简单任务揭示多模态模型在持续感知中的时间整合缺陷,指出现有模型无法有效跨时间积累证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01882 2025-12-02 cs.LG 78%

New Spiking Architecture for Multi-Modal Decision-Making in Autonomous Vehicles

多模态决策中自动驾驶车辆的新脉冲架构

Aref Ghoreishee, Abhishek Mishra, Lifeng Zhou, John Walsh, Nagarajan Kandasamy

机构 * Electrical and Computer Engineering Department(电子与计算机工程系)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 本文提出了一种基于脉冲神经元的高效多模态决策架构,用于提升自动驾驶车辆的实时决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00989 2025-12-02 q-bio.QM cs.LG 71%

Sleep Apnea Detection on a Wireless Multimodal Wearable Device Without Oxygen Flow Using a Mamba-based Deep Learning Approach

基于Mamba深度学习方法的无线多模态可穿戴设备无氧流睡眠呼吸暂停检测

Dominik Luszczynski, Richard Fei Yin, Nicholas Afonin, Andrew S. P. Lim

机构 * University of Toronto Department of Medicine(多伦多大学医学系) Sunnybrook Research Institute Department of Medicine Neurology Div.(圣玛丽医院研究学院医学系神经病学部)

专题命中 视频多模态 :multimodal(title)

AI总结 本文提出基于Mamba架构的深度学习模型,利用无线多模态可穿戴设备无氧流信号,实现睡眠呼吸暂停的准确检测与事件级表征。

Comments 29 pages, 14 figures. Authors Dominik Luszczynski, Richard Fei Yin and Nicholas Afonin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01312 2025-12-02 cs.CV 57%

IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval

IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索

Ning Han, Yawen Zeng, Shaohua Long, Chengqing Li, Sijie Yang, Dun Tan, Jianfeng Dong, Jingjing Chen

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Zhejiang Gongshang University(浙江工商大学) Fudan University(复旦大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。

Comments Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01298 2025-12-02 cs.CV 57%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00953 2025-12-02 cs.CV 57%

Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval

自适应证据学习用于时刻检索中的时序-语义鲁棒性

Haojian Huang, Kaijing Ma, Jin Chen, Haodong Chen, Zhou Wu, Xianghao Zang, Han Fang, Chao Ban, Hao Sun, Mulin Chen, Zhongjiang He

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DEMR框架,通过引入RFF模块和几何正则化器,提升时刻检索中对复杂视频场景的适应性与鲁棒性。

Comments Accepted by AAAI 2026, 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏