arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-09 至 2026-02-09 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2602.06619 2026-02-09 cs.CV 79%

CauCLIP: Bridging the Sim-to-Real Gap in Surgical Video Understanding via Causality-Inspired Vision-Language Modeling

CauCLIP:通过因果启发的视觉-语言模型弥合手术视频理解的仿真到现实差距

Yuxin He, An Li, Cheng Xue

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 CauCLIP通过因果启发的视觉-语言模型,在不访问目标领域数据的情况下,提升手术视频理解的领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2602.06959 2026-02-09 cs.CV 83%

CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation

CineScene:隐式3D作为电影视频生成的有效场景表示

Kaiyi Huang, Yukun Huang, Yu Li, Jianhong Bai, Xintao Wang, Zinan Lin, Xuefei Ning, Jiwen Yu, Pengfei Wan, Yu Wang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Tsinghua University(清华大学) Zhejiang University(浙江大学) Microsoft Research Project Page(微软研究院项目页面)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 CineScene通过隐式3D场景表示实现电影视频生成,能生成动态主体且保持场景一致的高质量视频。

Comments Project website: https://karine-huang.github.io/CineScene/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2602.04928 2026-02-09 cs.LG 67%

Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics

euphonium:通过过程奖励梯度引导的随机动态控制视频流匹配

Ruizhe Zhong, Jiesong Lian, Xiaoyue Mi, Zixiang Zhou, Yuan Zhou, Qinglin Lu, Junchi Yan

机构 * Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯混元) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract)

AI总结 Euphonium通过过程奖励梯度引导动态,提升视频流匹配的生成效率和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06597 2026-02-09 cs.LG 50%

DiTS: Multimodal Diffusion Transformers Are Time Series Forecasters

DiTS:多模态扩散变换器是时间序列预测器

Haoran Zhang, Haixuan Liu, Yong Liu, Yunzhong Qiu, Yuxuan Wang, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 DiTS通过双流Transformer块处理时间序列的内生和外生变量依赖,实现高效生成预测。

详情

展开后加载摘要…

URL PDF HTML 收藏