arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-25 至 2026-08-25 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 2 篇

2608.23330 2026-08-25 cs.CV 新提交 57%

IntentQA: Intent Question Answering in Videos by Cognitive Context Reasoning

IntentQA:基于认知上下文推理的视频意图问答

Jiapeng Li, Ping Wei, Wenjuan Han, Song-Chun Zhu, Lifeng Fan

机构 * Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Beijing Jiaotong University(北京交通大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 本文提出视频意图问答任务 IntentQA,构建相关大规模数据集,提出 X-CaVIR 框架并引入对比性能下降指标,实验验证其有效性、优越性与稳定性。

Comments 18 pages, 7 figures. Accepted manuscript of an article published in IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22279 2026-08-25 cs.CV cs.AI 新提交 57%

OVIBench: Benchmarking Online Video Question Answering under Interruption

OVIBench:面向中断场景的在线视频问答基准测试

Naiming Liu, Zhiheng Wu, Shuning Wang, Tie Zhang, Bowen Liu, Tong Wang

机构 * HIT(哈尔滨工业大学) CASIA(中国科学院自动化研究所) ZJU(浙江大学) UESTC(电子科技大学) HKUST(香港科技大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 该研究针对现有视频问答基准未考虑用户中断的问题,提出首个面向中断场景的在线视频问答基准OVIBench,开发模拟协议与指标集,构建训练集OVI-Train,验证了其有效性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏