arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-05 至 2025-12-05 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2512.04451 2025-12-05 cs.CV 83%

StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios

StreamEQA:迈向具身场景的流式视频理解

Yifei Wang, Zhenkai Li, Tianwen Qian, Huanran Zheng, Zheng Wang, Yuqian Fu, Xiaoling Wang

机构 * School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,华东师范大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 StreamEQA是一个针对具身场景中流式视频问答的基准测试,通过评估模型在感知、交互和规划方面的能力,推动流式视频理解在具身应用中的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15470 2025-12-05 cs.CV cs.AI 79%

EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining

EgoDTM: 向3D感知的自体视频-语言预训练迈进

Boshen Xu, Yuting Mei, Xinbi Liu, Sipeng Zheng, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能3实验室)

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

AI总结 EgoDTM通过结合大规模3D感知视频预训练和视频-文本对比学习,提升视频-语言模型的3D感知能力,实现更丰富的空间理解。

Comments Code: https://github.com/xuboshen/EgoDTM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04643 2025-12-05 cs.CV cs.AI cs.CL cs.LG 57%

SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

SEASON: 通过自诊断对比解码缓解视频大语言模型中的时间幻觉

Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SEASON通过自诊断对比解码方法,无需训练即可提升视频大语言模型在时间信息处理上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏