arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-27 至 2026-01-27 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 2 篇

2509.17743 2026-01-27 cs.CV 84%

VideoPro: Adaptive Program Reasoning for Long Video Understanding

VideoPro: 针对长视频理解的自适应程序推理

Chenglin Li, Feng Han, Yikun Wang, Ruilin Li, Shuai Dong, Haowen Hou, Haitao Li, Qianglong Chen, Feng Tao, Jingqi Tong, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频问答 :video understanding(title);long video(title);分类 cs.CV

AI总结 VideoPro通过自适应程序推理框架提升长视频理解的效率和可靠性,利用快慢推理机制和参数优化在视觉任务中取得更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09396 2026-01-27 cs.CV 57%

Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA

过多的帧,但并非都有用:长视频问答的高效策略

Jongwoo Park, Kanchana Ranasinghe, Kumara Kahatapitiya, Wonjeong Ryu, Donghyun Kim, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 视频问答 :long video(abstract);分类 cs.CV

AI总结 LVNet通过高效的关键帧选择器提升长视频问答效率,实现四个基准数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏