arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-15 至 2025-12-15 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2512.11178 2025-12-15 cs.LG cs.SI 71%

Harnessing Rich Multi-Modal Data for Spatial-Temporal Homophily-Embedded Graph Learning Across Domains and Localities

利用丰富的多模态数据进行跨领域和地域的时空同质性嵌入图学习

Takuya Kurihana, Xiaojian Zhang, Wing Yee Au, Hon Yung Wong

机构 * Fujitsu Research of America(富士通美国研究机构) Department of Civil and Coastal Engineering University of Florida(佛罗里达大学土木与海岸工程系)

专题命中 视频多模态 :multi-modal(title)

AI总结 本文提出一种跨领域和地域的时空同质性嵌入图学习框架,通过整合多模态数据提升城市预测性能,解决智能城市分析中的关键挑战。

Comments 18 pages, 8 figures, Presented in part at the 2025 INFORMS Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11510 2025-12-15 cs.CV 57%

Reconstruction as a Bridge for Event-Based Visual Question Answering

重建作为事件驱动视觉问答的桥梁

Hanyue Lou, Jiayi Zhou, Yang Zhang, Boyu Li, Yi Wang, Guangnan Ye, Boxin Shi

机构 * Peking University(北京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于重建的框架,通过FRT和ART方法提升事件驱动视觉问答性能,并引入EvQA基准验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11189 2025-12-15 cs.CV 57%

Multi-task Learning with Extended Temporal Shift Module for Temporal Action Localization

多任务学习与扩展时间移位模块用于时间动作定位

Anh-Kiet Duong, Petra Gomez-Krämer

机构 * L3i Laboratory, La Rochelle University(拉罗谢尔大学L3i实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于扩展时间移位模块的多任务学习方法,用于多视角多模态视频中的时间动作定位,通过引入背景类别和加权集成策略提升了预测的鲁棒性和一致性。

Comments BinEgo360@ICCV25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23158 2025-12-15 cs.LG cs.AI 57%

Deep Learning-Based Detection of Cognitive Impairment from Passive Smartphone Sensing with Routine-Aware Augmentation and Demographic Personalization

基于深度学习的被动智能手机传感认知障碍检测:具有常规感知增强和人口统计学个性化

Yufei Shen, Ji Hwan Park, Minchao Huang, Jared F. Benge, Justin F. Rousseau, Rosemary A. Lester-Smith, Edison Thomaz

机构 * Department of Electrical and Computer Engineering, Cockrell School of Engineering, The University of Texas at Austin(电气与计算机工程系,Cockrell工程学院,德克萨斯大学奥斯汀分校) Department of Neurology, Dell Medical School, The University of Texas at Austin(神经病学系,德克萨斯医学学院,德克萨斯大学奥斯汀分校) Department of Neurology, University of Texas Southwestern Medical Center(神经病学系,德克萨斯西南医学中心) Peter O’Donnell Jr. Brain Institute, University of Texas Southwestern Medical Center(彼得·奥·唐纳德·杰罗姆脑研究所,德克萨斯西南医学中心) Department of Speech, Language, and Hearing Sciences, Moody College of Communication, The University of Texas at Austin(语言病理学系,摩依学院,德克萨斯大学奥斯汀分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于深度学习的被动智能手机传感方法,通过常规感知增强和人口统计学个性化技术,提高模型在老年人认知障碍检测中的泛化能力。

Comments Accepted at 2025 IEEE EMBS International Conference on Biomedical and Health Informatics (IEEE BHI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11245 2025-12-15 cs.HC 50%

Breast-Rehab: A Postoperative Breast Cancer Rehabilitation Training Assessment System Based on Human Action Recognition

Breast-Rehab: 一种基于人体动作识别的术后乳腺癌康复训练评估系统

Zikang Chen, Tan Xie, Qinchuan Wang, Heming Zheng, Xudong Lu

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Breast-Rehab通过结合人体动作识别与RAG框架,提供低成本的居家乳腺癌术后上肢康复训练评估系统,提升患者康复依从性。

Comments has been accepted by CHIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏