arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2605.26113 2026-05-26 cs.RO cs.CV 57%

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

AnyScene: 迈向高度可控的任意位置驾驶场景生成及超越

Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto(利汽车) Southwest Jiaotong University(西南交通大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出AnyScene框架,通过时空占用扩散Transformer和几何引导视图扩展模块,实现从BEV布局生成语义占用序列和参考无关的多视角驾驶视频,支持精确可控和长时生成。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25343 2026-05-26 cs.CV 57%

Toward Native Multimodal Modeling: A Roadmap

迈向原生多模态建模:路线图

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Warwick(沃林汉大学) Monash University(墨尔本大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出从非原生多模态范式向原生多模态建模(NMM)过渡的正式路线图,通过输入-输出二元性分类现有模型,并系统探讨架构协调、数据整理、训练推理及评估的全栈工业级方案。

Comments 52 pages, 5 figures, 3 tables, ~300 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23891 2026-05-25 cs.CV 57%

Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework

Smart-Insertion-V: 通过闭环反馈双流框架实现逼真的视频插入

Xiao Cao, Yansong Qu, Xiangzhen, Chang, Wen Xiao, Jiakui Hu, Heyuan Li, Jialun Liu, Zhiyong Huang, Xuelong Li

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出一种端到端双流框架Smart-Insertion-V,通过闭环反馈机制和双世界视角旋转位置编码解决参考对象与源视频风格域差异大的问题,实现无需掩码的逼真视频对象插入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18214 2026-05-25 cs.CV 57%

EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation

EgoInteract: 用于交互理解和预测的合成自我中心视频生成

Rosario Leonardi, Francesco Ragusa, Daniele Materia, Alessandro Passanisi, James Fort, Jakob Engel, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系) Next Vision s.r.l.(Next Vision公司) Reality Labs Research, Meta(Meta现实实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出EgoInteract可控模拟器,生成带密集时空标注的合成自我中心视频,用于动作分割、下一活动物体检测、交互预测和手物交互检测,在多个真实基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23381 2026-05-25 cs.CV 57%

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

VDE: 通过速度分解与估计实现无训练加速整流流模型

Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

机构 * South China University of Technology(华南理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出速度分解与估计(VDE)方法,通过将模型速度分解为平行和正交分量并利用其时间可预测性和方向稳定性进行输入自适应估计,无需训练即可加速整流流模型,在图像和视频生成任务中实现显著加速且视觉质量损失极小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05202 2026-05-25 cs.CV 57%

GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

GT-SVJ: 基于生成式Transformer的自监督视频评判器用于高效视频奖励建模

Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki, Mehrab Tanjim, Somdeb Sarkhel, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Inc.(Adobe公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出GT-SVJ,通过将视频生成模型重新用作能量模型,并利用对比目标训练,实现高效、时间感知的视频质量评估,在少量标注下达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22144 2026-05-22 cs.CV 57%

One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems

一句话,一出戏剧:通过多智能体系统实现个性化短剧生成

Yufei Shi, Weilong Yan, Naixuan Huang, Yucheng Chen, Chenyu Zhang, Tao He, Si Yong Yeo, Ming Li

机构 * MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University(MedVisAI实验室,李光前医学院,南洋理工大学) National University of Singapore(新加坡国立大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Guangming Laboratory(光明实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种多智能体框架,通过结构化中间模块和迭代优化,将用户的单句想法转化为完整短剧,解决了短剧生成中的叙事节奏、空间一致性及生产质量控制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21411 2026-05-21 cs.CV 57%

RoadTones: Tone Controllable Text Generation from Road Event Videos

RoadTones: 从道路事件视频生成可调节语气的文本

Chirag Parikh, Siddhi Pravin Lipare, Ravi Kiran Sarvadevabhatla

机构 * CVIT & iHub-Data, IIIT Hyderabad, India(CVIT与iHub-Data,IIIT海得拉巴,印度)

专题命中 视频生成 :video-language(abstract);分类 cs.CV

AI总结 本文提出RoadTones-51K数据集和RoadTones-VL-CoT模型,通过生成语气条件的推理草稿提升可解释性,并引入RoadTones-Eval评估体系,共同为上下文敏感的可调节视频描述奠定基础。

Comments Accepted at CVPR Findings 2026. Project page: https://roadtones.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18678 2026-05-21 cs.CV cs.AI 57%

Lance: Unified Multimodal Modeling by Multi-Task Synergy

Lance:通过多任务协同实现统一多模态建模

Fengyi Fu, Mengqi Huang, Shaojin Wu, Yunsheng Jiang, Yufei Huo, Hao Li, Yinghang Song, Fei Ding, Jianzhu Guo, Qian He, Zheren Fu, Zhendong Mao, Yongdong Zhang

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Lance,一种轻量级的原生统一模型,支持图像和视频的多模态理解、生成和编辑。该模型通过协同多任务训练的实用范式实现统一多模态建模,基于统一上下文建模和解耦能力路径两个核心原则,通过双流混合专家架构实现联合上下文学习并解耦理解和生成路径。

Comments 34 pages, 14 figures, 10 tables, homepage url: https://lance-project.github.io , code url: https://github.com/bytedance/Lance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22940 2026-05-20 cs.CV 57%

One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer

一对一动画:无对齐角色动画和图像姿态转换

Shijun Shi, Jing Xu, Zhihang Li, Chunli Peng, Xiaoda Yang, Lijing Lu, Kai Hu, Jiangning Zhang

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种统一框架,用于高保真角色动画和图像姿态转换,解决了参考姿态错位问题,通过自监督补全任务和混合参考融合注意力机制提升生成质量。

Comments Project Page:https://ssj9596.github.io/one-to-all-animation-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19319 2026-05-20 cs.CV 57%

SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution

SWEET:基于图像编辑的稀疏世界建模用于具身任务执行

Yiren Song, Yihan Wang, Xiyao Deng, Zhuoran Yan, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) Central South University(中南大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文研究图像编辑模型能否作为稀疏视觉世界模型用于机器人操作,通过预测任务级未来状态而非密集视频生成,提出SWEET框架实现稀疏视觉规划,结合语言指令和空间引导生成关键帧,并通过扩散动作预测器生成可执行动作,实验表明其在不同场景中提升关键帧预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18748 2026-05-19 cs.CV 57%

Aurora: Unified Video Editing with a Tool-Using Agent

Aurora: 一种基于工具使用的统一视频编辑框架

Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

机构 * MIT-IBM(MIT-IBM研究院) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出Aurora框架,通过结合增强的视觉语言模型(VLM)代理和统一视频扩散变换器,解决视频编辑中的文本和视觉不充分问题,提升了视频编辑的灵活性和准确性。

Comments Code: https://github.com/yeates/Aurora

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18467 2026-05-19 cs.CV 57%

InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

InstructAV2AV:基于指令的音频视频联合编辑

Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出InstructAV2AV,首个端到端的指令引导音频视频联合编辑框架,通过构建大规模音频视频编辑数据集InsAVE-80K和改进的生成模型,实现了更高质量的音频视频联合编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01843 2026-05-19 cs.CV 57%

PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models

PhyDetEx: 检测和解释T2V模型的物理合理性

Zeqing Wang, Keze Wang, Lei Zhang

机构 * Zeqing Wang 1,3(王泽清 1,3) Keze Wang 1(王凯泽 1) Lei Zhang 2(张磊 2)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出PhyDetEx,通过构建PID数据集和轻量级微调方法,评估T2V模型在生成物理合理视频方面的性能,并发现尽管模型在视频生成上有所进步,但理解并遵循物理定律仍存在挑战。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17423 2026-05-19 cs.CV 57%

Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration

Soap2Soap:通过多智能体协作实现长 cinematic 视频重制

Yiren Song, Huilin Zhong, Kevin Qinghong Lin, Haofan Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) University of Oxford(牛津大学) Lovart AI(Lovart人工智能)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出 Soap2Soap 框架,通过多智能体协作实现长 cinematic 视频重制,解决视频到视频生成中长期一致性与叙事保真度的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16937 2026-05-19 cs.CV 57%

DEVIS-GRPO: Unleashing GRPO on Dynamic Extreme View Synthesis

DEVIS-GRPO:释放GRPO用于动态极视合成

Yi Zuo, Huimin Wu, Lingling Li, Fang Liu, Licheng Jiao, Qing Li

机构 * Xidian University(西安电子科技大学) State Key Laboratory of General Artificial Intelligence, BIGAI(人工智能国家重点实验室,BIGAI)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出DEVIS-GRPO,一种基于GRPO的框架,用于轨迹控制的视频生成,是首个在线策略梯度方法用于极视视频生成。核心方法是新颖的采样策略ADEVIS,通过逐步积累小视增量实现大视运动,提高了训练效率和采样多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15725 2026-05-18 cs.CV cs.AI cs.RO 57%

DiLA: Disentangled Latent Action World Models

DiLA:解耦的潜在动作世界模型

Tianqiu Zhang, Muyang Lyu, Yufan Zhang, Fang Fang, Si Wu

机构 * Peking-Tsinghua Center for Life Sciences, Academy for Advanced Interdisciplinary Studies, IDG/McGovern Institute for Brain Research, Peking University(北京大学-清华生命科学中心,先进跨学科研究院,IDG/麦克戈文脑科学研究院,北京大学) Center of Quantitative Biology, Peking University(北京大学定量生物学中心) School of Psychological and Cognitive Sciences, Key Laboratory of Machine Perception (Ministry of Education), Peking University(心理与认知科学学院,机器感知重点实验室(教育部),北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DiLA通过内容-结构解耦解决动作抽象与生成保真度的平衡问题,实现高质量视频生成和动作迁移。

Comments Project Page: http://disentangled-latent-action-world-models.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15196 2026-05-15 cs.CV cs.LG 57%

RefDecoder: Enhancing Visual Generation with Conditional Video Decoding

RefDecoder:通过条件视频解码增强视觉生成

Xiang Fan, Yuheng Wang, Bohan Fang, Zhongzheng Ren, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出RefDecoder,通过引入高保真参考图像信号提升视频生成质量,改进解码器结构以保持结构完整性,在多个基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14984 2026-05-15 cs.CV cs.AI 57%

Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

Sat3DGen:从单张卫星图像生成全面的街景3D场景

Ming Qian, Zimin Xia, Changkun Liu, Shuailei Ma, Wen Wang, Zeran Ke, Bin Tan, Hang Zhang, Gui-Song Xia

机构 * LIESMARS & School of Artificial Intelligence, Wuhan University(珞珈实验室与武汉大学人工智能学院) EPFL(苏黎世联邦理工学院) HKUST(香港科技大学) Northeastern University(东北大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Amap, Alibaba Group(高德地图,阿里巴巴集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Sat3DGen,通过几何优先方法提升从单张卫星图像生成高精度3D场景的性能,改进几何精度和真实感,并在新基准上验证其效果。

Comments ICLR 2026; code: https://github.com/qianmingduowan/Sat3DGen demo: https://huggingface.co/spaces/qian43/Sat3DGen project page: https://qianmingduowan.github.io/Sat3DGen_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13775 2026-05-14 cs.RO cs.CV 57%

RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data

RoboEvolve:用于有限数据的机器人操作共进化规划-模拟器

Harold Haodong Chen, Sirui Chen, Yingjie Xu, Wenhang Ge, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 RoboEvolve通过共进化循环提升机器人操作性能,利用无标签种子图像实现高效数据生成,显著提升规划和模拟效果,同时表现出极高的数据效率和持续学习能力。

Comments On-going work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12198 2026-05-13 cs.CV 57%

Enhancing Domain Generalization in 3D Human Pose Estimation through Controllable Generative Augmentation

通过可控生成增强在3D人体姿态估计中的领域泛化

Xinhao Hu, Yiyi Zhang, Liqing Zhang, Jianfu Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出可控人体姿态生成框架,通过系统变化姿态、背景和摄像机视角合成多样化视频数据,增强训练集多样性,提升模型泛化能力,验证了在处理领域差异方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12167 2026-05-13 cs.RO cs.CV 57%

From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation

从想象的未来到可执行的动作:用于机器人操作的潜在动作混合

Yajie Li, Bozhou Zhang, Chun Gu, Zipei Ma, Jiahui Zhang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出MoLA,一种面向控制的接口,将想象的未来视频转化为可执行的表示,通过混合预训练的逆动力学模型,提升机器人操作的稳定性和通用性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11363 2026-05-13 cs.CV cs.CL 57%

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

PresentAgent-2: 向通用多模态展示代理迈进

Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PresentAgent-2通过多模态资源收集与生成,实现基于用户查询的交互式展示视频生成,支持单人叙述、多人讨论及观众互动三种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10806 2026-05-12 cs.CV cs.AI cs.LG 57%

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10434 2026-05-12 cs.CV 57%

WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors

WorldReasonBench: 视频生成器作为未来世界状态预测器的人类对齐压力测试

Keming Wu, Yijing Cui, Wenhan Xue, Qijie Wang, Xuan Luo, Zhiyuan Feng, Zuhao Yang, Sudong Wang, Sicong Jiang, Haowei Zhu, Zihan Wang, Ping Nie, Wenhu Chen, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 WorldReasonBench通过结构化地面真实QA注释,测试视频生成器能否在物理、社会、逻辑和信息层面保持一致性。该基准包含436个测试案例和22个子类别,结合人类对齐的两阶段方法评估生成视频的质量。

Comments Project Page: https://unix-ai-lab.github.io/WorldReasonBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21581 2026-05-12 cs.CV 57%

MultiAnimate: Pose-Guided Image Animation Made Extensible

MultiAnimate:基于姿态的图像动画使其可扩展

Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种可扩展的多人物图像动画框架,通过引入标识符分配器和标识符适配器,解决多人物场景中的身份混淆和不合理的遮挡问题,实现高质量多人物动画生成。

Comments CVPR2026 Accepted. Project page at https://hyc001.github.io/MultiAnimate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07695 2026-05-11 cs.CV 57%

OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos

OphEdit: 无需训练的文本引导眼科手术视频编辑

Ritul Jangir, Arkya Jyoti Bagchi, Aiman Farooq, Mangalton Okram, Saurabh Seetaram Korgaonkar, Deepak Mishra

机构 * Indian Institute of Technology Jodhpur(印度理工学院贾布尔分校) All India Institute of Medical Sciences Delhi(全国医学科学研究所德里)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出OphEdit框架,通过确定性二阶ODE反向管道和条件分类器自由引导分支,实现无需训练的文本引导眼科手术视频编辑,保持眼部解剖结构并实现语义修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10571 2026-05-05 cs.CV 57%

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

AVI-Edit: 基于粒度感知掩码细化的音频同步视频实例编辑

Haojie Zheng, Shuchen Weng, Jingqi Liu, Siqi Yang, Boxin Shi, Xinlong Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Tech., School of Computer Science, Peking University(北京大学计算机学院视觉技术工程研究中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出AVI-Edit框架,通过粒度感知掩码细化和自反馈音频代理,实现音频同步的高质量视频实例编辑,提升了空间和时间控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28980 2026-05-04 cs.CV 57%

Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas

Stepper:基于多视角全景图的分步沉浸式场景生成

Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari

机构 * Google(谷歌) University of Oxford(牛津大学) MCML Technical University of Munich(慕尼黑技术大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Stepper通过分步扩展多视角全景图,解决传统方法在视觉保真度与可探索性之间的权衡问题,实现高质量沉浸式3D场景生成。

Comments Accepted at CVPR 2026 Findings; Find our project page under https://fwmb.github.io/stepper/

详情

展开后加载摘要…

URL PDF HTML 收藏