arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 221 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 221 篇

2606.19958 2026-06-19 cs.CV 新提交 70%

SketchKeyAnime: Reference-anchored Sparse Key-Sketch Animation Synthesis

SketchKeyAnime:基于参考锚点的稀疏关键草图动画合成

Meixi Li, Xianlin Zhang, Yue Zhang, Xueming Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出SketchKeyAnime视频扩散框架,通过双分支条件机制和可学习门控的草图交叉注意力,从单张参考RGB图像和稀疏关键草图生成结构可控、外观一致且时间连贯的动画,在Sakuga-42M数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19495 2026-06-19 cs.CV 新提交 70%

LooseControlVideo: Directorial Video Control using Spatial Blocking

LooseControlVideo: 使用空间分块进行导演式视频控制

Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli

机构 * Adobe Research(Adobe研究院)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出LooseControlVideo框架,通过稀疏定向3D框作为“分块”代理,实现文本到视频生成中多对象场景的直观布局与轨迹控制,显著优于现有2D框和流方法。

Comments Project page at https://shariqfarooq123.github.io/LooseControlVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16742 2026-06-16 cs.CV cs.AI 新提交 70%

Revealing Artifacts via Noise Amplification: A Novel Perspective for AI-Generated Video Detection

通过噪声放大揭示伪影:AI生成视频检测的新视角

Renxi Cheng, Jie Gui, Hongsong Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education(教育部区块链应用监管工程研究中心(东南大学)) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对AI生成视频检测难题,提出基于位平面的噪声放大方法,通过像素级强度增强、区域级空间放大和帧级时间聚合,在GenVidBench和HardGVD基准上超越现有方法。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09156 2026-06-09 cs.CV 新提交 70%

OmniGen-AR: AutoRegressive Any-to-Image Generation

OmniGen-AR: 自回归任意到图像生成

Junke Wang, Xun Wang, Qiushan Guo, Peize Sun, Weilin Huang, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Bytedance Seed(字节跳动Seed) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出统一自回归框架OmniGen-AR,通过共享视觉分词器和解耦因果注意力,支持文本、空间信号和视觉上下文等多种条件输入,在多项基准上达到最优或竞争性能。

Comments Accepted by NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12290 2026-08-13 cs.CV cs.AI cs.MM 新提交 62%

Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

超越试错:面向图像到视频一致性的智能体优化

Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert, Steven Hickson

机构 * Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06732 2026-08-10 cs.AI cs.CV cs.MM 新提交 62%

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

从廉价伪造到纯合成:应对文本生成视频(T2V)假新闻视频的新时代

Yifeng Luo, Yupeng Li, Liang Lan, Tian Wang

机构 * Hong Kong Baptist University(香港浸会大学) Beijing Normal University(北京师范大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 该研究针对纯合成T2V假新闻视频带来的新威胁,构建了首个纯合成假新闻视频数据集,提出R-T2V框架,在10种主流基准上取得最优检测性能。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13556 2026-08-14 cs.CV 新提交 57%

V-RAE: Rethinking Video Latent Spaces for Generation

V-RAE:重新思考用于生成的视频隐空间

Minghui Guo, Shengqiong Wu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出V-RAE视频表示自动编码器,基于冻结视觉基础模型构建生成隐空间,在多项视频任务上优于现有模型,还引入tFVD指标,证明冻结语义表示可支持多种视频建模任务。

Comments 26 pages, 8 tables, 13 figures, project page: https://v-rae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11201 2026-08-12 cs.CV 新提交 57%

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习

Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Renmin University of China(中国人民大学) Microsoft(微软公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05776 2026-08-07 cs.CV 新提交 57%

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

Vorch-Director:基于噪声感知误差校正的交互式世界故事模型

Lisai Zhang, Yidi Wu, Qi Liu, Xin Ma, Yang Ding, Gang Yue, Siqian Yang, Jingyuan Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Vorch-Director是一种噪声感知残差校正策略,基于LTX-2扩散Transformer,可提升视听长视频生成的稳定性与保真度,支持多镜头、多主体的参考引导生成。

Comments Project page: https://vorch-project.github.io/Vorch-Director-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-07 cs.CV cs.AI 新提交 57%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05600 2026-08-07 cs.LG cs.AI cs.CV 新提交 57%

LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction

LC-GRPO:通过朗之万校正弥合基于流的GRPO的训练-推理差距

Yingqing Guo, Hui Yuan, Zijian He, Mengdi Wang, Zheng Ding

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 LC-GRPO 是带朗之万校正的基于流的 GRPO 框架,通过对齐推理的 ODE 欧拉步加朗之万校正,缩小流模型训练与推理的样本差距,在多任务上提升奖励优化并保留生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05070 2026-08-06 cs.CV 新提交 57%

HelloWorld: Enabling Socially Interactive Characters in Video World Models

HelloWorld:在视频世界模型中实现具有社交互动性的角色

Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学) Alaya Lab(阿莱亚实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究提出HelloWorld视频世界模型,通过自蒸馏流水线和训练模块实现角色与用户的社交互动,构建含400样本的基准,其互动质量优于基线且保持顶尖图像美学。

Comments Project page: https://github.com/AlayaLab/HelloWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04426 2026-08-06 cs.CV cs.CL 新提交 57%

Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

预测再检索:从视频前缀中进行跨实例未来状态检索

Quynh Vo, Thong Nguyen, Vinh-Hien Do, Cong-Duy Nguyen, Anh-Tuan Luu

机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究提出PSR任务,构建含多数据集的基准,提出LFTR模型,发现预测而非感知是核心挑战,LFTR缩小差距且成本低,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04224 2026-08-06 cs.CV 新提交 57%

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

OmniVR:用于恢复退化历史影片的联合视频-音频条件生成模型

Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出首个联合音视频生成修复模型OmniVR,通过三项关键设计解决历史影片的音视频共同退化问题,在多类指标上超越现有方法,还发布了相关基准OmniVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03211 2026-08-05 cs.CV cs.RO 新提交 57%

CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction

CrossScope:用于联合双视野手术视频预测的角色非对称世界模型

Wanhao Liu, Jinsong Lin, Rulin Zhou, Chi Kit Ng, Wenbin Pan, Zhiqing Tang, Dongyue Li, Liwei Luo, Yanshen Wu, Panshuo Li, Zhiyong Xiong, Huxin Gao, Tamas Haidegger, Hongliang Ren

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对母子ERCP中双柔性镜无校准立体关系的手术视频预测问题,提出角色非对称的CrossScope双流模型,经配对双视野基准评估,其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02603 2026-08-04 cs.CV 新提交 57%

WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

WorldExam:从表观外观到内在反应性对世界模型进行基准测试

Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng, Ruizhi Li, Junyan Li, Yu Liu, Xiao Yang, Yong Li, Jun Zhu, Hongsheng Li, Tieniu Tan, Lue Fan, Zhaoxiang Zhang

机构 * CASIA(中国科学院自动化研究所) SLAI(智能科学与技术实验室) CUHK(香港中文大学) AMAP(中国农业科学院) THU(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究推出WorldExam基准,评估20个模型在视觉质量等四层级的表现,发现不同驱动模型能力有明显分化,无模型兼具广泛任务覆盖与稳定性能,高视觉质量不代表内在反应性强。

Comments Project Website: https://WorldExam.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28760 2026-08-03 cs.CV cs.AI cs.LG stat.ML 新提交 57%

WaiT for the Signal: Simple Frequency-Aware Flow-Matching

面向信号的WaiT:简单的频率感知流匹配

Krunoslav Lehman Pavasovic, Théophane Vallaeys, Stéphane Mallat, Giulio Biroli, Luke Zettlemoyer, Brian Karrer, Jakob Verbeek

机构 * FAIR, Meta(FAIR(Meta旗下研究机构)) École Normale Supérieure(巴黎高等师范学院) Sorbonne University(索邦大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究提出频率感知流匹配模型WaiT,通过无损小波分解生成过程,引入三轴评估协议,在ImageNet等数据集上实现SOTA生成性能,采样计算量降低50%,还可无缝扩展至视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26037 2026-07-29 cs.CV cs.GR 新提交 57%

Wonder: Video World Model Done Better

Wonder:改进的视频世界模型

Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel, Yiqun Mei

机构 * Adobe Research(Adobe研究院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Wonder是用于实时相机可控世界探索的通用视频世界模型,通过系统级协同设计,包括新型相机条件设定、高效内存机制等,能合成多样视频,支持视频条件生成,保持长时间的连贯视觉效果。

Comments Project Page: https://wonder-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25984 2026-07-29 cs.CV cs.LG 新提交 57%

Schrödinger's Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics

薛定谔的猫:潜在场景运动学的概率表示与预测

Timy Phan, Jannik Wiese, Björn Ommer

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究如何从部分观测预测场景演变,提出GARFIELD概率模型,能学习潜在表示实现轨迹联合采样和运动分布访问,实验显示其在运动规划性能、采样速度及密度估计上优势显著。

Comments Accepted at ECCV 2026. Project page: https://compvis.github.io/schroedingers_cat

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24560 2026-07-28 cs.CV cs.AI 新提交 57%

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

EgoPlay:用于第一人称视角视频流的事件触发式视频编辑

Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal

机构 * Snap Inc.(Snap公司) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。

Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24377 2026-07-28 cs.LG cs.AI cs.CV 新提交 57%

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention

MXAttention:用于MXFP4注意力的数据无关最优缩放和预归一化量化

Jianlin Yu, Jing Lin, Linghui Kong, Aiyue Chen, Weiyi Sun, Chenyu Zeng, Wangli Lan, Jinxi Li, Zhuo Zheng, Ziyang Yue, Danning Ke, Fei Yi, Tianchi Hu, Yuan Ding, Yiwu Yao, Junsong Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对基于扩散的视频生成模型中注意力二次成本的瓶颈,提出MXAttention框架,通过引入通用最优缩放和预归一化量化组件,缩小了MXFP4与FP16的成像质量差距,提升了帧级相似度,且性能与强大基线竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19895 2026-07-23 cs.CV cs.AI 新提交 57%

OSVE: One Step Video Editing with One Step Diffusion Models

OSVE:使用单步扩散模型进行单步视频编辑

Habin Lim, Gyeong-Moon Park

机构 * Korea University(韩国大学)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 研究针对扩散模型文本引导视频编辑慢的问题,提出OSVE框架。通过训练可学习编码器预测初始噪声,引入UFE技术及滑动窗口策略保持一致性,实现高质量视频编辑,速度比现有方法快约155 - 171倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19876 2026-07-23 cs.RO cs.CV 新提交 57%

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 57%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 视频生成 :video reasoning(abstract);分类 cs.CV

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交 57%

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17523 2026-07-21 cs.CV cs.AI cs.CL 新提交 57%

Thinking in Video: Can Video Generators Really Reason About the Real World?

视频中的思考:视频生成器真的能对现实世界进行推理吗?

Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun

机构 * Central South University(中南大学) Tencent(腾讯) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14976 2026-07-17 cs.CV 新提交 57%

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

从带草稿到无草稿:通过特权蒸馏和快速植入实现一步视频对象移除

Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究视频对象移除问题,提出D2DF框架,通过特权蒸馏和自引导快速植入模块,将教师模型多步细化能力提炼到学生模型,实现一步视频对象移除,在质量和效率上优于传统及多步生成方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交 57%

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11081 2026-07-14 cs.CV cs.AI 新提交 57%

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

通过注意力头控制扩散变换器中的运动传递

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) University of California, Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究如何控制扩散变换器中的运动传递,通过在注意力头层面分析,提出无需参数更新的头感知可控运动传递框架,利用语义对应引导和选择性特征注入,实现精确运动传递并为可控视频生成提供可解释基础。

Comments Accepted to ECCV 2026, Project page: https://sunyj-hxppy.github.io/halo/

详情

展开后加载摘要…

URL PDF HTML 收藏