arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-04 至 2026-02-04 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 7 篇

2602.02453 2026-02-04 cs.AI 79%

Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling

用漫画思考:通过结构化视觉叙事增强多模态推理

Andong Chen, Wenxin Zhu, Qiuyu Ding, Yuchen Song, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出用漫画作为中间视觉表示,通过结构化视觉叙事提升多模态推理效率和性能。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03230 2026-02-04 cs.CV 70%

EventFlash: Towards Efficient MLLMs for Event-Based Vision

EventFlash: 向基于事件的视觉高效MLLMs迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Wen Jiang, Ming Li, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 EventFlash通过时空令牌稀疏化技术,实现高效事件视觉处理,提升吞吐量并支持更长的事件流处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02551 2026-02-04 cs.LG cs.AI cs.CV 62%

EEO-TFV: Escape-Explore Optimizer for Web-Scale Time-Series Forecasting and Vision Analysis

EEO-TFV:面向网络级时间序列预测和视觉分析的逃逸-探索优化器

Hua Wang, Jinghao Lu, Fan Zhang

机构 * School of Computer and Artificial Intelligence, Ludong University(计算机与人工智能学院,鲁东大学) School of Computer Science and Technology, Shandong Technology and Business University(计算机科学与技术学院,山东技术与商务大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 EEO-TFV通过轻量级Transformer架构与逃逸-探索优化器,提升网络级时间序列预测和视觉分析的性能与泛化能力。

Comments Main paper: 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17873 2026-02-04 cs.CV cs.AI 62%

SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model

SurgVidLM:迈向多粒度外科视频理解的大型语言模型

Guankun Wang, Junyi Wang, Wenjin Mo, Long Bai, Kun Yuan, Ming Hu, Jinlin Wu, Junjun He, Yiming Huang, Nicolas Padoy, Zhen Lei, Hongbin Liu, Nassir Navab, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑技术大学) Monash University(墨尔本大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,HKISI-CAS) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SurgVidLM通过多粒度分析提升外科视频理解能力,结合全局与局部机制实现更精确的手术流程解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23729 2026-02-04 cs.CV 57%

Proteus-ID: ID-Consistent and Motion-Coherent Video Customization

Proteus-ID:身份一致且运动协调的视频定制

Guiyu Zhang, Chen Shi, Zijian Jiang, Xunzhi Xiang, Jingjing Qian, Shaoshuai Shi, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Voyager Research, Didi Chuxing(Voyager Research与滴滴出行)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Proteus-ID通过多模态身份融合、时间感知身份注入和自适应运动学习,实现了身份一致且运动协调的视频定制,提升了视频生成的真实性和流畅度。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02982 2026-02-04 cs.HC 50%

Invisible Users in Digital Health: A Scoping Review of Digital Interventions to Promote Physical Activity Among Culturally and Linguistically Diverse Women

数字健康中的隐形用户:一项关于促进文化及语言多样性女性身体活动的数字干预措施的综述

Yilin Ke, Yun Suen Pai, Burkhard C. Wuensche, Angus Donald Campbell, Mairi Gunn

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本研究提出文化嵌入互动框架,通过整合文化适应与长期策略,解决数字健康干预在文化多样性女性中持续参与度不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02769 2026-02-04 cs.LG 50%

BiTimeCrossNet: Time-Aware Self-Supervised Learning for Pediatric Sleep

BiTimeCrossNet:面向儿童睡眠的时序自监督学习

Saurav Raj Pandey, Harlin Lee

机构 * Department of Computer Science, UNC Chapel Hill(UNC夏洛特分校计算机科学系) School of Data Science and Society, UNC Chapel Hill(UNC夏洛特分校数据科学与社会学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 BiTimeCrossNet通过引入时间信息和交叉注意力机制,在儿童睡眠分析中实现更高效的多模态自监督学习。

详情

展开后加载摘要…

URL PDF HTML 收藏