arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-12 至 2025-12-12 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2511.02427 2025-12-12 cs.CV cs.RO 57%

From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics

从实验室到现实应用:评估边缘设备上用于移动机器人的零样本场景解读

Nicolas Schuler, Lea Dewald, Nick Baldig, Jürgen Graf

机构 * Laboratories for Cognitive Systems and Robotics(认知系统与机器人实验室) University of Luxembourg(卢森堡大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文评估了适用于移动机器人边缘设备的小型视觉语言模型在零样本场景解读任务中的性能与应用潜力。

Comments 15 pages, 6 figures, 1 table; accepted for AI-2025 Forty-fifth SGAI International Conference on Artificial Intelligence CAMBRIDGE, ENGLAND 16-18 DECEMBER 2025

Journal ref Artificial Intelligence XLII. SGAI-AI 2025. Lecture Notes in Computer Science, vol 16302. Springer, Cham (2026), pp 301-315

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2511.00090 2025-12-12 cs.CV cs.AI 83%

LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation

LeMiCa:基于词典极小极大路径缓存的高效扩散式视频生成

Huanlin Gao, Ping Chen, Fuyuan Shi, Chao Tan, Zhaoxiang Liu, Fang Zhao, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(数据科学与人工智能研究院,中国联合电信) Unicom Data Intelligence, China Unicom(中国联合电信数据智能中心)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 LeMiCa通过词典极小极大路径优化策略,提升扩散式视频生成的推理速度与生成质量,实现高效且高质量的视频合成。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10943 2025-12-12 cs.CV cs.AI 79%

AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

AlcheMinT:多参考一致视频生成的细粒度时间控制

Sharath Girish, Viacheslav Ivanov, Tsai-Shien Chen, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。

Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10286 2025-12-12 cs.CV 79%

ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions

ShotDirector: 电影化可控多镜头视频生成

Xiaoxue Wu, Xinyuan Chen, Yaohui Wang, Yu Qiao

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ShotDirector通过整合参数级相机控制和分层编辑模式感知提示,实现了电影化可控的多镜头视频生成。

Comments Project Page: https://uknowsth.github.io/ShotDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09363 2025-12-12 cs.CV 79%

StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation

StereoWorld: 一种基于几何的单目到立体视频生成方法

Ke Xing, Xiaojie Jin, Longfei Li, Yuyang Yin, Hanwen Liang, Guixun Luo, Chen Fang, Jue Wang, Konstantinos N. Plataniotis, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Dzine AI University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 StereoWorld通过几何感知正则化和时空拼接方案,实现高效高质量的单目到立体视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI 79%

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 2 篇

2512.10617 2025-12-12 cs.CV 57%

Lang2Motion: Bridging Language and Motion through Joint Embedding Spaces

Lang2Motion: 通过联合嵌入空间连接语言与运动

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 Lang2Motion通过联合嵌入空间连接语言与运动,利用文本描述和视觉化监督生成高精度的轨迹,实现跨领域运动迁移和风格编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05537 2025-12-12 cs.CV cs.AI 57%

Towards Efficient Real-Time Video Motion Transfer via Generative Time Series Modeling

通过生成时间序列建模实现高效的实时视频运动迁移

Tasmiah Haque, Md. Asif Bin Syed, Byungheon Jeong, Xue Bai, Sumit Mohan, Somdyuti Paul, Imtiaz Ahmed, Srinjoy Das

机构 * Coupa Software(Coupa软件) Intel Corporation(英特尔公司)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本研究提出基于生成时间序列模型的实时视频运动迁移框架,通过关键点预测和光流模块实现高效低帧率视频传输,提升带宽效率与视频生成的可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2512.10363 2025-12-12 cs.CV 79%

Point to Span: Zero-Shot Moment Retrieval for Navigating Unseen Hour-Long Videos

点到跨度:零样本时刻检索用于导航未见的小时级视频

Mingyu Jeon, Jisoo Yang, Sungjin Han, Jinkwon Hwang, Sunjae Yoon, Jonghee Kim, Junyeoung Kim

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 P2S提出了一种无训练框架,通过适应性跨度生成器和查询分解技术,解决零样本长视频时刻检索中的搜索和细化阶段效率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 3 篇

2506.06277 2025-12-12 cs.CV 79%

ExAct: A Video-Language Benchmark for Expert Action Analysis

ExAct:一种视频-语言基准,用于专家动作分析

Han Yi, Yulu Pan, Feihong He, Xinyu Liu, Benjamin Zhang, Oluwatumininu Oguntola, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

AI总结 ExAct是一个用于专家级物理活动理解的视频-语言基准,通过专家整理的视频问题-答案对评估VLMs的精准理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI 57%

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05094 2025-12-12 cs.RO cs.CV 57%

From Generated Human Videos to Physically Plausible Robot Trajectories

从生成的人类视频到物理上合理的机器人轨迹

James Ni, Zekai Wang, Wei Lin, Amir Bar, Yann LeCun, Trevor Darrell, Jitendra Malik, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) Johannes Kepler University(约翰·凯撒大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出GenMimic方法,通过物理感知强化学习策略,从生成的视频中实现零样本的人形机器人动作模仿,并建立了评估零样本泛化能力的基准。

Comments For project website, see https://genmimic.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏