arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-01 至 2025-12-01 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 7 篇

2511.23146 2025-12-01 cs.CV 85%

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD 83%

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.MM

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23475 2025-12-01 cs.CV 79%

AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement

AnyTalker: 通过交互细化扩展多人物谈话视频生成

Zhizhou Zhong, Yicheng Ji, Zhe Kong, Yiying Liu, Jiarui Wang, Jiasun Feng, Lupeng Liu, Xiangyi Wang, Yanjia Li, Yuqing She, Ying Qin, Huan Li, Shuiyang Mao, Wei Liu, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Video Rebirth(视频重生) Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。

Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22974 2025-12-01 cs.CV 79%

McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning

McSc: 基于自批评分层推理的视频生成运动校正偏好对齐

Qiushi Yang, Yingjie Chen, Yuan Yao, Yifang Men, Huaizhuo Liu, Miaomiao Cui

机构 * Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 McSc通过自批评分层推理框架,提升视频生成中对人类偏好的对齐精度,减少对低运动内容的偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21579 2025-12-01 cs.CV 74%

Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

Harmony: 通过跨任务协同实现音频和视频生成

Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan Project(腾讯文心项目)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04675 2025-12-01 cs.CV 70%

InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation

InfinityStar: 一种统一的时空自回归模型用于视觉生成

Jinlai Liu, Jian Han, Bin Yan, Hui Wu, Fengda Zhu, Xing Wang, Yi Jiang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 InfinityStar是一种统一的时空自回归模型,能够高效生成高分辨率图像和动态视频,其在VBench上的表现优于现有自回归模型,且生成速度显著快于扩散方法。

Comments NeurIPS 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07769 2025-12-01 cs.CV 70%

Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation

Dream4D: 通过可控视频生成与神经4D重建提升I2V向时空一致4D生成

Xiaoyan Liu, Kangrui Li, Yuehao Song, Jiaxin Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学) The University of New South Wales(新南威尔士大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Dream4D通过可控视频生成与神经4D重建的协同,实现高质量的时空一致4D内容生成。

Comments Project Page: https://wanderer7-sk.github.io/Dream4D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏