arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2512.07469 2026-04-07 cs.CV 57%

VideoCoF: Unified Video Editing with Temporal Reasoner

VideoCoF:基于时间推理的统一视频编辑

Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

机构 * University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 VideoCoF通过引入时间推理机制,解决视频编辑中精度与统一性的矛盾,实现无需掩码的精确区域映射和细粒度编辑,验证了方法的高效性与有效性。

Comments Accepted by CVPR 2026, Project Page: https://videocof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02867 2026-04-06 cs.CV 57%

HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits

HairOrbit: 从单人像中基于多视角的3D毛发建模

Leyang Jin, Yujian Zheng, Bingkui Tong, Yuda Qiu, Zhenyu Xie, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) SSE, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Pinscreen

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出HairOrbit框架,利用视频生成模型的3D先验知识,将单视角毛发重建转化为校准的多视角重建任务,并设计两阶段毛发生长算法,实现高质量的3D毛发合成。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14674 2026-04-03 cs.CV cs.LG 57%

LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

LaVR:基于大规模4D重建模型的场景潜在条件生成视频轨迹重绘

Mingyang Xie, Numair Khan, Tianfu Wang, Naina Dhingra, Seonghyeon Nam, Haitao Yang, Zhuo Hui, Christopher Metzler, Andrea Vedaldi, Hamed Pirsiavash, Lei Luo

机构 * Meta University of Maryland(马里兰大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出LaVR模型,通过利用大规模4D重建模型的潜在空间中的隐式几何知识,解决视频重绘中几何未条件化模型的空间感知不足和几何条件化模型对深度不准确的依赖问题,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24506 2026-04-02 cs.CV 57%

Toward Physically Consistent Driving Video World Models under Challenging Trajectories

迈向在挑战性轨迹下物理一致的驾驶视频世界模型

Jiawei Zhou, Zhenxin Zhu, Lingyi Du, Linye Lyu, Lijun Zhou, Zhanqian Wu, Hongcheng Luo, Zhuotao Tian, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Yu Li

机构 * Zhejiang University(浙江大学) Xiaomi EV(小米电动汽车) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出PhyGenesis,通过物理条件生成器和物理增强视频生成器,解决挑战性轨迹下视频生成的物理不一致问题,实验表明其在复杂轨迹上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19979 2026-04-01 cs.CV cs.AI 57%

X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving

X-World: 可控的以自身为中心的多摄像头世界模型用于可扩展的端到端驾驶

Chaoda Zheng, Sean Li, Jinhao Deng, Zhennan Wang, Shijia Chen, Liqiang Xiao, Ziheng Chi, Hongbin Lin, Kangjie Chen, Boyang Wang, Yu Zhang, Xianming Liu

机构 * GWM Team(长城汽车团队) XPeng Inc.(小鹏汽车)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 X-World通过可控的多摄像头生成世界模型,实现高质量多视角视频生成,支持跨摄像头一致性、长时间动态稳定性和严格动作遵循,为可扩展的端到端驾驶评估提供基础。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 57%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12057 2026-03-31 cs.CV cs.AI 57%

Coarse-Guided Visual Generation via Weighted h-Transform Sampling

通过加权h变换采样实现粗引导的视觉生成

Yanghao Wang, Ziqi Jiang, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种基于h变换的粗引导视觉生成方法,通过调整采样步骤的概率过渡,结合噪声水平感知调度,提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV 57%

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25053 2026-03-31 cs.CV 57%

GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator

GaussFusion: 通过几何引导的视频生成提升野外3D重建

Liyuan Zhu, Manjunath Narayana, Michal Stary, Will Hutchcroft, Gordon Wetzstein, Iro Armeni

机构 * Stanford University(斯坦福大学) Zillow Group(Zillow集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 GaussFusion通过几何引导的视频生成技术改进3DGS重建,解决常见伪影问题,提供更鲁棒的3D重建方法,实现在新型视图合成中的最佳性能。

Comments CVPR 2026 main paper camera-ready. Project page: http://research.zhuliyuan.net/projects/GaussFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07455 2026-03-31 cs.CV cs.AI cs.CL cs.GR 57%

Image Generation Models: A Technical History

图像生成模型:技术史

Rouzbeh Shirvani

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了过去十年图像生成模型的快速发展,涵盖VAEs、GANs、正常化流、自回归和Transformer模型以及扩散方法,分析其技术原理、训练方法及局限性,并讨论视频生成和模型鲁棒性等最新进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19623 2026-03-30 cs.CV cs.AI cs.HC 57%

PedaCo-Gen: Scaffolding Pedagogical Agency in Human-AI Collaborative Video Authoring

PedaCo-Gen:在人机协作视频制作中构建教学代理

Injun Baek, Yearim Kim, Nojun Kwak

机构 * Seoul National University(首尔大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 PedaCo-Gen通过引入中间表示阶段,使教育者能与AI审查员互动审查和优化视频蓝图,提升视频质量与教学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18746 2026-03-30 cs.CV cs.AI 57%

Any4D: Open-Prompt 4D Generation from Natural Language and Images

Any4D: 从自然语言和图像生成开放提示的4D生成

Hao Li, Qiao Sun

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Primitive Embodied World Models,通过限制视频生成时间范围,实现语言与视觉表示的细粒度对齐,降低学习复杂度,提升数据效率,并减少推理延迟,支持复杂任务的组合泛化。

Comments The authors identified issues in the 4D generation pipeline and evaluation that affect result validity. To ensure scientific accuracy, we will revise the methodology and experiments thoroughly before resubmitting. This version should not be cited or relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00393 2026-03-27 cs.CV 57%

NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

NeoVerse:基于真实世界单目视频增强4D世界模型

Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, Zhaoxiang Zhang

机构 * NLPR & MAIS, CASIA(国家工程实验室与机器智能研究所,中国科学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出NeoVerse,一种能实现4D重建、生成新颖轨迹视频及多种下游应用的 versatile 4D 世界模型。通过解决现有方法在可扩展性上的局限,NeoVerse 基于单目视频构建可扩展的全流程,实现高泛化能力与高性能。

Comments CVPR 2026; Project Page: https://neoverse-4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23960 2026-03-26 cs.CV 57%

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

不留死角:揭示深度伪造检测中的整体音频视觉内在一致性

Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出HAVIC方法,通过学习模态特定的结构一致性及跨模态微/宏观一致性,提升深度伪造检测的鲁棒性和泛化能力,实验表明其在跨数据集场景中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05848 2026-03-24 cs.CV cs.AI cs.RO 57%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15700 2026-03-24 cs.CV 57%

First Frame Is the Place to Go for Video Content Customization

视频内容定制中的首帧至关重要

Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang Wu, Fuxiao Liu, Cornelia Fermuller, Brandon Y. Feng, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) USC(南加州大学) MIT(麻省理工学院) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文揭示视频生成模型将首帧视为概念记忆缓冲区,通过少量训练示例实现鲁棒且通用的视频内容定制。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08536 2026-03-24 cs.CV 57%

SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution

SWIFT: 基于滑动窗口的少样本训练自由生成视频属性识别

Chao Wang, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SWIFT方法,通过滑动窗口实现视频属性识别,无需额外训练即可在多种生成模型上达到90%以上的准确率,支持零样本识别。

Comments 8 pages. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19402 2026-03-24 cs.RO cs.CV cs.GR 57%

Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface

Real2Edit2Real:通过3D控制界面生成机器人演示

Yujie Zhao, Hongwei Fan, Di Chen, Shengcong Chen, Liliang Chen, Xiaoqi Li, Guanghui Ren, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PKU-AgiBot Lab(北大AgiBot实验室) AgiBot

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Real2Edit2Real框架,通过3D可编辑性与2D视觉数据结合,减少重复数据收集,提升空间泛化能力,实验表明其数据效率提升显著。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19231 2026-03-20 cs.CV 57%

MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

MonoArt:基于渐进结构推理的单目关节3D重建

Haitian Li, Haozhe Xie, Junxiang Xu, Beichen Wen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, 637335 Singapore(南洋理工大学S实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MonoArt通过渐进结构推理实现单目关节3D重建,无需外部运动模板或多阶段流程,提升重建精度和推理速度,并扩展至机器人操作和关节场景重建。

Comments Project page: https://lihaitian.com/MonoArt

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21818 2026-03-19 cs.CV 57%

SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model

SkyReels-V4:多模态视频-音频生成、修复和编辑模型

Guibin Chen, Dixuan Lin, Jiangping Yang, Youqiang Zhang, Zhengcong Fei, Debang Li, Sheng Chen, Chaofeng Ao, Nuo Pang, Yiming Wang, Yikun Dou, Zheng Chen, Mingyuan Fan, Tuanhui Li, Mingshan Chang, Hao Zhang, Xiaopeng Sun, Jingtao Xu, Yuqiang Xie, Jiahua Wang, Zhiheng Xu, Weiming Xiong, Yuzhe Jin, Baoxuan Gu, Binjie Mao, Yunjie Yu, Jujie He, Yuhao Feng, Shiwen Tu, Chaojie Wang, Rui Yan, Wei Shen, Jingchen Wu, Peng Zhao, Xuanyue Zhong, Zhuangzhuang Liu, Kaifei Wang, Fuxiang Zhang, Weikai Xu, Wenyan Liu, Binglu Zhang, Yu Shen, Tianhui Xiong, Bin Peng, Liang Zeng, Xuchen Song, Haoxiang Guo, Peiyu Wang, Max W. Y. Lam, Chien-Hung Liu, Yahui Zhou

机构 * Skywork AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 SkyReels-V4是一款多模态视频基础模型,支持视频音频生成、修复和编辑,采用双流多模态扩散变换器架构,结合文本编码器实现多模态指令处理,支持高分辨率、长时长视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16669 2026-03-18 cs.RO cs.CV 57%

Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation

Kinema4D: 用于空间时间具身模拟的运动学4D世界建模

Mutian Xu, Tianbao Zhang, Tianqi Liu, Zhaoxi Chen, Xiaoguang Han, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) SSE, CUHKSZ(香港中文大学深圳校区SSE)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Kinema4D,一种基于动作条件的4D生成机器人模拟器,通过精确的4D机器人控制表示和环境反应的生成建模,实现了高精度的空间时间交互模拟,并首次展示零样本迁移能力。

Comments Project page: https://mutianxu.github.io/Kinema4D-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15583 2026-03-17 cs.CV 57%

Grounding World Simulation Models in a Real-World Metropolis

将世界模拟模型扎根于现实世界中的城市

Junyoung Seo, Hyunwook Choi, Minkyung Kwon, Jinhyeok Choi, Siyoon Jin, Gayoung Lee, Junho Kim, JoungBin Lee, Geonmo Gu, Dongyoon Han, Sangdoo Yun, Seungryong Kim, Jin-Hwa Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(成均馆大学人工智能研究所)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Seoul World Model,通过检索增强的条件生成真实城市场景,解决时间错位和轨迹多样性问题,生成高保真、时序一致的长时景视频。

Comments project page: https://seoul-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09924 2026-03-17 cs.CV 57%

Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning

面向统一模型的基于推理的视频编辑:带有自我反思学习

Xinyu Liu, Hangjie Yuan, Yujie Wei, Jiazheng Xing, Yujin Han, Jiahao Pan, Yanbiao Ma, Chi-Min Chan, Kang Zhao, Shiwei Zhang, Wenhan Luo, Yike Guo

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13615 2026-03-17 cs.CV cs.RO 57%

Egocentric World Model for Photorealistic Hand-Object Interaction Synthesis

第一人称世界模型用于逼真手-物体交互合成

Dayou Li, Lulin Liu, Bangya Liu, Shijie Zhou, Jiu Feng, Ziqi Lu, Minghui Zheng, Chenyu You, Zhiwen Fan

机构 * Texas A&M University(德克萨斯A&M大学) University of Minnesota(明尼苏达大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(得克萨斯大学奥斯汀分校) Amazon(亚马逊) State University of New York at Stony Brook(纽约州立大学石溪分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出EgoHOI模型,通过动作信号模拟物理一致的交互,克服了高速头部运动、严重遮挡和高自由度手部运动带来的挑战,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12655 2026-03-16 cs.CV 57%

VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model

VGGT-World:将VGGT转变为一个自回归的几何世界模型

Xiangyu Sun, Shijie Wang, Fengyi Zhang, Lin Liu, Caiyan Jia, Ziying Song, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Beijing Jiaotong University(北京交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出VGGT-World,通过自回归方法预测冻结几何基础模型特征的时空演变,提升深度预测性能并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12267 2026-03-13 cs.CV 57%

EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation

EVATok: 适应性长度视频分块化以实现高效的视觉自回归生成

Tianwei Xiong, Jun Hao Liew, Zilong Huang, Zhijie Lin, Jiashi Feng, Xihui Liu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 EVATok通过自适应分块器提升视频重建和自回归生成的效率与质量,实现令牌使用量减少24.4%。

Comments Accepted by CVPR 2026. Project page: https://silentview.github.io/EVATok/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26796 2026-03-13 cs.CV cs.GR 57%

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11048 2026-03-12 cs.CV cs.AI cs.CL cs.MA cs.NE 57%

COMIC: Agentic Sketch Comedy Generation

COMIC:基于代理的即兴喜剧生成

Susung Hong, Brian Curless, Ira Kemelmacher-Shlizerman, Steve Seitz

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 COMIC提出了一种基于代理的自动化系统,通过LLM评论家和迭代优化生成高质量喜剧视频。

Comments Project page: https://susunghong.github.io/COMIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08648 2026-03-10 cs.CV 57%

CAST: Modeling Visual State Transitions for Consistent Video Retrieval

CAST:为一致视频检索建模视觉状态转换

Yanqing Liu, Yingcheng Liu, Fanghong Dong, Budianto Budianto, Cihang Xie, Yan Jiao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 CAST通过建模视觉状态转换,提升视频检索的一致性和连贯性,适用于多种视觉-语言嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07192 2026-03-10 cs.CV 57%

FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis

FastSTAR: 空间时间令牌修剪用于高效的自回归视频合成

Sungwoong Yune, Suheon Jeong, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 FastSTAR通过时空令牌修剪和部分更新机制,实现高效视频生成,在保持质量的同时提升处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏