arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-08 至 2025-08-08 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2411.08882 2025-08-08 cs.MM cs.AI cs.CV 82%

A Novel Multimodal System to Predict Agitation in People with Dementia Within Clinical Settings: A Proof of Concept

Abeer Badawi, Somayya Elmoghazy, Samira Choudhury, Sara Elgazzar, Khalid Elgazzar, Amer Burhan

机构 * IoT Research Laboratory, Ontario Tech University(Ontario Tech 大学物联网研究实验室) Ontario Shores Centre for Mental Health Sciences(Ontario Shores 精神健康科学中心) Temerty Faculty of Medicine, University of Toronto(多伦多大学Temerty医学学院) Faculty of Science, Ontario Tech University(Ontario Tech 大学科学学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04900 2025-08-08 cs.CV cs.AI 81%

Revealing Temporal Label Noise in Multimodal Hateful Video Classification

Shuonan Yang, Tailin Chen, Rahul Singh, Jiangbei Yue, Jianbo Jiao, Zeyu Fu

机构 * Multimodal Intelligence Lab(多模态智能实验室) Department of Computer Science(计算机科学系) University of Exeter(埃克塞特大学) University of Birmingham(伯明翰大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21586 2025-08-08 cs.CL cs.AI cs.CV 67%

Can Vision Language Models Understand Mimed Actions?

Hyundong Cho, Spencer Lin, Tejas Srinivasan, Michael Saxon, Deuksin Kwon, Natali T. Chavez, Jonathan May

机构 * Information Sciences Institute(信息科学研究所) Institute for Creative Technologies(创意技术研究所) Department of Computer Science(计算机科学系) University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Aristotle University of Thessaloniki(希腊雅典纳大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05145 2025-08-08 cs.AI 57%

Graph-based Event Log Repair

Sebastiano Dissegna, Chiara Di Francescomarino, Massimiliano Ronzani

机构 * Department of Computer Science Engineering University of Trento(计算机科学工程系 特伦托大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10855 2025-08-08 cs.RO cs.LG 50%

Fast and Robust Visuomotor Riemannian Flow Matching Policy

Haoran Ding, Noémie Jaquier, Jan Peters, Leonel Rozo

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院) Computer Science Department of the Technische Universität Darmstadt(达姆施塔特技术大学计算机科学系)

专题命中 视频多模态 :multi-modal(abstract)

Comments Accepted for publication in IEEE T-RO. Project website: https://sites.google.com/view/rfmp 17 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏