arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-07 至 2025-11-07 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4 篇

2510.11321 2025-11-07 cs.RO 78%

HiMaCon: Discovering Hierarchical Manipulation Concepts from Unlabeled Multi-Modal Data

Ruizhe Liu, Pei Zhou, Qian Luo, Li Sun, Jun Cen, Yibing Song, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science(香港大学数据科学学院) The University of Hong Kong(香港大学) DAMO Academy(达摩院) Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multi-modal(title);cross-modal(abstract)

Comments Accepted at 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04670 2025-11-07 cs.CV 61%

Cambrian-S: Towards Spatial Supersensing in Video

Shusheng Yang, Jihan Yang, Pinzhi Huang, Ellis Brown, Zihao Yang, Yue Yu, Shengbang Tong, Zihan Zheng, Yifan Xu, Muhan Wang, Daohan Lu, Rob Fergus, Yann LeCun, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV;MLLM(comments)

Comments Website: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04281 2025-11-07 cs.CV 57%

DINOv2 Driven Gait Representation Learning for Video-Based Visible-Infrared Person Re-identification

Yujie Yang, Shuang Li, Jun Ye, Neng Dong, Fan Li, Huafeng Li

机构 * Kunming University of Science and Technology(昆明理工大学) Chongqing University of Post and Telecommunications(重庆邮电大学) China University of Mining Technology(中国矿业大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03750 2025-11-07 stat.AP 50%

Centralized Health and Exposomic Resource (C-HER): Analytic and AI-Ready Data for External Exposomic Research

Heidi A. Hanson, Joemy Ramsay, Josh Grant, Maggie Davis, Janet O. Agbaje, Dakotah Maguire, Jeremy Logan, Marissa Taddie, Chad Melton, Midgie MacFarland, James VanDerslice

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏