arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-09 至 2026-02-09 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2602.04928 2026-02-09 cs.LG 67%

Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics

euphonium:通过过程奖励梯度引导的随机动态控制视频流匹配

Ruizhe Zhong, Jiesong Lian, Xiaoyue Mi, Zixiang Zhou, Yuan Zhou, Qinglin Lu, Junchi Yan

机构 * Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯混元) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract)

AI总结 Euphonium通过过程奖励梯度引导动态,提升视频流匹配的生成效率和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06597 2026-02-09 cs.LG 50%

DiTS: Multimodal Diffusion Transformers Are Time Series Forecasters

DiTS:多模态扩散变换器是时间序列预测器

Haoran Zhang, Haixuan Liu, Yong Liu, Yunzhong Qiu, Yuxuan Wang, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 DiTS通过双流Transformer块处理时间序列的内生和外生变量依赖,实现高效生成预测。

详情

展开后加载摘要…

URL PDF HTML 收藏