arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-16 至 2025-09-16 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 3 篇

2509.11796 2025-09-16 cs.CV 79%

FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning

Haodong Chen, Haojian Huang, XinXiang Yin, Dian Shao

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) The University of Hong Kong(香港大学) School of Software, Northwestern Polytechnical University(软件学院,西北工业大学) Unmanned System Research Institute, Northwestern Polytechnical University(无人系统研究院,西北工业大学)

专题命中 视频问答 :video understanding(title,abstract);分类 cs.CV

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21403 2025-09-16 cs.CV 70%

Static or Dynamic: Towards Query-Adaptive Token Selection for Video Question Answering

Yumeng Shi, Quanyu Long, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 视频问答 :video language model(abstract);long video(abstract);分类 cs.CV

Comments Accepted to EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11862 2025-09-16 cs.CV cs.AI cs.LG 57%

Bridging Vision Language Models and Symbolic Grounding for Video Question Answering

Haodi Ma, Vyom Pathak, Daisy Zhe Wang

机构 * Univerisy of Florida(佛罗里达大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏