arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2501.13536 2025-01-24 cs.CV cs.CL 62%

ReasVQA: Advancing VideoQA with Imperfect Reasoning Process

Jianxin Liang, Xiaojun Meng, Huishuai Zhang, Yueqian Wang, Jiansheng Wei, Dongyan Zhao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted to main conference at NAACL 2025; 8 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13468 2025-01-24 cs.CV cs.AI 62%

Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge

Haomiao Xiong, Zongxin Yang, Jiazuo Yu, Yunzhi Zhuge, Lu Zhang, Jiawen Zhu, Huchuan Lu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2025. Code is available at https://github.com/hmxiong/StreamChat

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09582 2025-01-22 cs.LG cs.AI cs.CV 62%

Neptune: The Long Orbit to Benchmarking Long Video Understanding

Arsha Nagrani, Mingda Zhang, Ramin Mehran, Rachel Hornung, Nitesh Bharadwaj Gundavarapu, Nilpa Jha, Austin Myers, Xingyi Zhou, Boqing Gong, Cordelia Schmid, Mikhail Sirotenko, Yukun Zhu, Tobias Weyand

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07978 2025-01-15 cs.CV cs.AI 62%

Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness

Jiaxing Zhao, Boyuan Sun, Xiang Chen, Xihan Wei

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08195 2025-01-14 cs.AI cs.CL cs.MA 62%

A Text-to-Game Engine for UGC-Based Role-Playing Games

Lei Zhang, Xuezheng Peng, Shuyi Yang, Feiyang Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20064 2024-12-31 cs.CV cs.AI cs.NE 62%

VELoRA: A Low-Rank Adaptation Approach for Efficient RGB-Event based Recognition

Lan Chen, Haoxiang Yang, Pengpeng Shao, Haoyu Song, Xiao Wang, Zhicheng Zhao, Yaowei Wang, Yonghong Tian

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments In Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17238 2024-12-24 cs.CV cs.MM 62%

Modality-Aware Shot Relating and Comparing for Video Scene Detection

Jiawei Tan, Hongxing Wang, Kang Dang, Jiaxin Li, Zhilong Ou

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07024 2024-12-20 cs.CV cs.AI 62%

Exploring Scalability of Self-Training for Open-Vocabulary Temporal Action Localization

Jeongseok Hyun, Su Ho Han, Hyolim Kang, Joon-Young Lee, Seon Joo Kim

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13454 2024-12-19 cs.CV cs.AI 62%

Pre-training a Density-Aware Pose Transformer for Robust LiDAR-based 3D Human Pose Estimation

Xiaoqi An, Lin Zhao, Chen Gong, Jun Li, Jian Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06618 2024-12-17 cs.CV cs.IR cs.MM 62%

Text Proxy: Decomposing Retrieval from a 1-to-N Relationship into N 1-to-1 Relationships for Text-Video Retrieval

Jian Xiao, Zhenzhen Hu, Jia Li, Richang Hong

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09991 2024-12-16 cs.CV cs.AI 62%

Visual Object Tracking across Diverse Data Modalities: A Review

Mengmeng Wang, Teli Ma, Shuo Xin, Xiaojun Hou, Jiazheng Xing, Guang Dai, Jingdong Wang, Yong Liu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10188 2024-12-16 cs.CV cs.CL 62%

LongVILA: Scaling Long-Context Visual Language Models for Long Videos

Yukang Chen, Fuzhao Xue, Dacheng Li, Qinghao Hu, Ligeng Zhu, Xiuyu Li, Yunhao Fang, Haotian Tang, Shang Yang, Zhijian Liu, Ethan He, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Linxi Fan, Yuke Zhu, Yao Lu, Song Han

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Code and models are available at https://github.com/NVlabs/VILA/tree/main/longvila

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09627 2024-12-13 cs.CV cs.AI cs.LG 62%

Doe-1: Closed-Loop Autonomous Driving with Large World Model

Wenzhao Zheng, Zetian Xia, Yuanhui Huang, Sicheng Zuo, Jie Zhou, Jiwen Lu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Code is available at: https://github.com/wzzheng/Doe

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09230 2024-12-13 cs.CV cs.AI 62%

Foundation Models and Adaptive Feature Selection: A Synergistic Approach to Video Question Answering

Sai Bhargav Rongali, Mohamad Hassan N C, Ankit Jha, Neha Bhargava, Saurabh Prasad, Biplab Banerjee

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Journal ref WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05185 2024-12-12 cs.CV cs.LG cs.MM 62%

LinVT: Empower Your Image-level Large Language Model to Understand Videos

Lishuai Gao, Yujie Zhong, Yingsen Zeng, Haoxian Tan, Dengjie Li, Zheng Zhao

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05426 2024-12-10 cs.RO cs.AI cs.CV cs.LG 62%

What's the Move? Hybrid Imitation Learning via Salient Points

Priya Sundaresan, Hengyuan Hu, Quan Vuong, Jeannette Bohg, Dorsa Sadigh

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19652 2024-12-06 cs.CV cs.AI 62%

VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization

Yuliang Liu, Mingxin Huang, Hao Yan, Linger Deng, Weijia Wu, Hao Lu, Chunhua Shen, Lianwen Jin, Xiang Bai

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02186 2024-12-04 cs.CV cs.AI 62%

VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video Understanding

Kangsan Kim, Geon Park, Youngwan Lee, Woongyeong Yeo, Sung Ju Hwang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00378 2024-12-03 cs.CL cs.CV cs.HC 62%

Long-Term Ad Memorability: Understanding & Generating Memorable Ads

Harini SI, Somesh Singh, Yaman K Singla, Aanisha Bhattacharyya, Veeky Baths, Changyou Chen, Rajiv Ratn Shah, Balaji Krishnamurthy

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Published in WACV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19460 2024-12-02 cs.CV cs.AI cs.LG 62%

Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing

Hosu Lee, Junho Kim, Hyunjun Kim, Yong Man Ro

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Project page: https://ivy-lvlm.github.io/Video-MA2MBA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19141 2024-12-02 cs.CV cs.AI 62%

On Moving Object Segmentation from Monocular Video with Transformers

Christian Homeyer, Christoph Schnörr

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments WICCV2023

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision 2023 (880--891)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18211 2024-11-28 cs.CV cs.AI 62%

TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability

Shimin Chen, Xiaohan Lan, Yitian Yuan, Zequn Jie, Lin Ma

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12293 2024-11-20 cs.CV cs.HC cs.MM 62%

Generative Timelines for Instructed Visual Assembly

Alejandro Pardo, Jui-Hsien Wang, Bernard Ghanem, Josef Sivic, Bryan Russell, Fabian Caba Heilbron

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04998 2024-11-08 cs.CV cs.AI cs.LG 62%

HourVideo: 1-Hour Video-Language Understanding

Keshigeyan Chandrasegaran, Agrim Gupta, Lea M. Hadzic, Taran Kota, Jimming He, Cristóbal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, Li Fei-Fei

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024 Datasets and Benchmarks Track; 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03628 2024-11-07 cs.CV cs.AI 62%

StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding

Junming Lin, Zheng Fang, Chi Chen, Zihao Wan, Fuwen Luo, Peng Li, Yang Liu, Maosong Sun

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00862 2024-11-06 cs.CV cs.AI 62%

A Simple and Effective Temporal Grounding Pipeline for Basketball Broadcast Footage

Levi Harris

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00308 2024-11-05 cs.CV cs.AI 62%

From Image to Language: A Critical Analysis of Visual Question Answering (VQA) Approaches, Challenges, and Opportunities

Md Farhan Ishmam, Md Sakib Hossain Shovon, M. F. Mridha, Nilanjan Dey

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23629 2024-11-04 cs.CV cs.AI cs.HC 62%

Posture-Informed Muscular Force Learning for Robust Hand Pressure Estimation

Kyungjin Seo, Junghoon Seo, Hanseok Jeong, Sangpil Kim, Sang Ho Yoon

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to NeurIPS 2024. Project Page Link: https://pimforce.hcitech.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07476 2024-10-31 cs.CV cs.CL 62%

VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Ziyang Luo, Deli Zhao, Lidong Bing

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments ZC, SL, HZ, YX, and XL contributed equally to this project. Code: https://github.com/DAMO-NLP-SG/VideoLLaMA2

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06960 2024-10-23 cs.CV cs.AI 62%

Transformer for Object Re-Identification: A Survey

Mang Ye, Shuoyi Chen, Chenyue Li, Wei-Shi Zheng, David Crandall, Bo Du

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by International Journal of Computer Vision (IJCV) in October 2024

详情

展开后加载摘要…

URL PDF HTML 收藏