arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-05 至 2025-12-05 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 2 篇

2512.01424 2025-12-05 cs.CV 79%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11520 2025-12-05 cs.RO 50%

Scalable Policy Evaluation with Video World Models

可扩展的策略评估与视频世界模型

Wei-Cheng Tseng, Jinwei Gu, Qinsheng Zhang, Hanzi Mao, Ming-Yu Liu, Florian Shkurti, Lin Yen-Chen

机构 * Nvidia Research(Nvidia 研究院) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频数据与评测 :video generation(abstract)

AI总结 本文提出利用动作条件视频生成模型进行可扩展的策略评估,通过预训练模型利用互联网视频数据,减少现实世界测试需求,提升机器人策略评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏