arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-26 至 2025-11-26 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2510.05034 2025-11-26 cs.CV 83%

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

视频大模型训练后:深入探讨大型多模态模型在视频推理中的应用

Yolo Y. Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Junhua Huang, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu

专题命中 视频理解 :video reasoning(title);video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文深入探讨了Video-LMMs训练后处理方法,分析了监督微调、强化学习和测试时扩展等关键技术,总结了设计原则与挑战,为视频推理研究提供了统一框架。

Comments Version v1.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17432 2025-11-26 cs.CV cs.CL 79%

Video Understanding with Large Language Models: A Survey

利用大语言模型进行视频理解:综述

Yolo Y. Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, Ali Vosoughi, Chao Huang, Zeliang Zhang, Pinxin Liu, Mingqian Feng, Feng Zheng, Jianguo Zhang, Ping Luo, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。

Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19475 2025-11-26 cs.CV cs.AI cs.MM 62%

Tracking and Segmenting Anything in Any Modality

任何模态下任何事物的跟踪与分割

Tianlu Zhang, Qiang Zhang, Guiguang Ding, Jungong Han

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 SATA提出了一种通用框架,通过解耦的专家混合机制和任务感知多目标跟踪流程,统一了多种跟踪和分割任务,提升了模型的泛化能力。

Comments Accpetd by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏