arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-08 至 2025-12-08 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2509.19552 2025-12-08 cs.CV 79%

iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning

iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理

Manyi Yao, Bingbing Zhuang, Sparsh Garg, Amit Roy-Chowdhury, Christian Shelton, Manmohan Chandraker, Abhishek Aich

机构 * NEC Laboratories, America(NEC美国实验室) University of California, Riverside(加州大学河滨分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05472 2025-12-08 cs.NE 50%

Unleashing Temporal Capacity of Spiking Neural Networks through Spatiotemporal Separation

通过时空分离释放脉冲神经网络的时间能力

Yiting Dong, Zhaofei Yu, Jianhao Ding, Zijie Xu, Tiejun Huang

专题命中 视频理解 :video understanding(abstract)

AI总结 本文提出STSep网络,通过解耦空间与时间分支,提升脉冲神经网络在视频理解中的时空建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏