arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-08 至 2025-12-08 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2509.19552 2025-12-08 cs.CV 79%

iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning

iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理

Manyi Yao, Bingbing Zhuang, Sparsh Garg, Amit Roy-Chowdhury, Christian Shelton, Manmohan Chandraker, Abhishek Aich

机构 * NEC Laboratories, America(NEC美国实验室) University of California, Riverside(加州大学河滨分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05472 2025-12-08 cs.NE 50%

Unleashing Temporal Capacity of Spiking Neural Networks through Spatiotemporal Separation

通过时空分离释放脉冲神经网络的时间能力

Yiting Dong, Zhaofei Yu, Jianhao Ding, Zijie Xu, Tiejun Huang

专题命中 视频理解 :video understanding(abstract)

AI总结 本文提出STSep网络,通过解耦空间与时间分支,提升脉冲神经网络在视频理解中的时空建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2508.09476 2025-12-08 cs.CV 79%

Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses

视频生成中的协作面部专家融合:提升大面部姿态下的身份一致性

Yuji Wang, Moran Li, Xiaobin Hu, Ran Yi, Jiangning Zhang, Chengming Xu, Weijian Cao, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出协作面部专家融合方法,通过动态融合身份、语义和细节专家信号,提升大姿态下视频生成的身份一致性,并构建了大规模姿态标注数据集。

Comments Project page: https://rain152.github.io/CoFE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07978 2025-12-08 cs.CV 57%

Martian World Model: Controllable Video Synthesis with Physically Accurate 3D Reconstructions

火星世界模型:可控视频合成与物理准确的3D重建

Longfei Li, Zhiwen Fan, Wenyan Cong, Xinhang Liu, Yuyang Yin, Matt Foutter, Panwang Pan, Chenyu You, Yue Wang, Zhangyang Wang, Yao Zhao, Marco Pavone, Yunchao Wei

机构 * BJTU(北京工业大学) UT Austin(德克萨斯大学奥斯汀分校) HKUST(香港科技大学) Stanford University(斯坦福大学) XMU(厦门大学) SBU(雪城大学) USC(南加州大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出M3arsSynth和MarsGen,通过物理准确的3D重建生成逼真的火星视频,提升任务模拟与机器人训练的可视化效果。

Comments Project Page: https://marsgenai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2512.05754 2025-12-08 cs.CV 83%

USV: Unified Sparsification for Accelerating Video Diffusion Models

USV:统一稀疏化以加速视频扩散模型

Xinjian Wu, Hongmei Wang, Yuan Zhou, Qinglin Lu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 USV通过统一稀疏化策略提升视频扩散模型的效率,实现去噪速度提升83.3%和端到端加速22.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05240 2025-12-08 cs.CV 70%

IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction

IE2Video: 适配预训练扩散模型以实现事件视频重建

Dmitrii Torbunov, Onur Okuducu, Yi Huang, Odera Dim, Rebecca Coles, Yonggang Cui, Yihui Ren

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 IE2Video通过适配预训练扩散模型,实现从单帧和事件数据重建RGB视频,提升视频重建质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2412.07755 2025-12-08 cs.CV cs.AI cs.GR cs.RO 57%

SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models

SAT:多模态语言模型的动态空间能力训练

Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko

机构 * Boston University(波士顿大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) Microsoft Research(微软研究院) New York University(纽约大学)

专题命中 视频问答 :long video(abstract);分类 cs.CV

AI总结 SAT通过模拟数据提升多模态语言模型在动态空间推理中的能力,实验表明其在多个基准测试中优于现有方法。

Comments Accepted to COLM 2025. Project webpage: https://arijitray.com/SAT/

详情

展开后加载摘要…

URL PDF HTML 收藏