arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-15 至 2025-08-15 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 6 篇

2508.10572 2025-08-15 cs.CV 83%

Towards Agentic AI for Multimodal-Guided Video Object Segmentation

Tuyen Tran, Thao Minh Le, Truyen Tran

机构 * Applied Artificial Intelligence Institute, Deakin University, Australia(应用人工智能研究所,德金大学,澳大利亚)

专题命中 视频多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10828 2025-08-15 cs.RO cs.AI 79%

A Multimodal Neural Network for Recognizing Subjective Self-Disclosure Towards Social Robots

Henry Powell, Guy Laban, Emily S. Cross

机构 * Amazon(亚马逊) School of Psychology and Neuroscience, University of Glasgow(心理学与神经科学学院,格拉斯哥大学) Ben-Gurion University of the Negev(内盖夫本·古里安大学) University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

Comments Accepted at 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10784 2025-08-15 q-bio.NC cs.CV 57%

Insights from the Algonauts 2025 Winners

Paul S. Scotti, Mihir Tripathy

机构 * Medical AI Research Center ( MedARC )(医学人工智能研究中心(MedARC)) Baylor College of Medicine(贝勒医学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Perspective piece on Algonauts 2025 Challenge conclusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07171 2025-08-15 cs.CV 57%

EventRR: Event Referential Reasoning for Referring Video Object Segmentation

Huihui Xu, Jiashi Lin, Haoyu Chen, Junjun He, Lei Zhu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00399 2025-08-15 cs.CV 57%

iSafetyBench: A video-language benchmark for safety in industrial environment

Raiyaan Abdullah, Yogesh Singh Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to VISION'25 - ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03096 2025-08-15 cs.CV 57%

Scaling Open-Vocabulary Action Detection

Zhen Hao Sia, Yogesh Singh Rawat

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏