Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
面向统一模型的基于推理的视频编辑:带有自我反思学习
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
面向统一模型的基于推理的视频编辑:带有自我反思学习
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。
第一人称世界模型用于逼真手-物体交互合成
机构 * Texas A&M University(德克萨斯A&M大学) ; University of Minnesota(明尼苏达大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Amazon(亚马逊) ; State University of New York at Stony Brook(纽约州立大学石溪分校)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出EgoHOI模型,通过动作信号模拟物理一致的交互,克服了高速头部运动、严重遮挡和高自由度手部运动带来的挑战,实验验证其有效性。
VGGT-World:将VGGT转变为一个自回归的几何世界模型
机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) ; Beijing Jiaotong University(北京交通大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出VGGT-World,通过自回归方法预测冻结几何基础模型特征的时空演变,提升深度预测性能并提高效率。
EVATok: 适应性长度视频分块化以实现高效的视觉自回归生成
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 EVATok通过自适应分块器提升视频重建和自回归生成的效率与质量,实现令牌使用量减少24.4%。
Comments Accepted by CVPR 2026. Project page: https://silentview.github.io/EVATok/
See4D: 通过自回归视频修复实现无姿态4D生成
机构 * NUS(新加坡国立大学) ; HKU(香港大学) ; CUHK(香港中文大学) ; THU(清华大学) ; Shanghai AI Lab(上海人工智能实验室) ; Horizon Robotics(地平线机器人) ; NTU(国立科技大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。
Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/
COMIC:基于代理的即兴喜剧生成
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 COMIC提出了一种基于代理的自动化系统,通过LLM评论家和迭代优化生成高质量喜剧视频。
Comments Project page: https://susunghong.github.io/COMIC/
CAST:为一致视频检索建模视觉状态转换
机构 * University of California, Santa Cruz(加州大学圣克ruz分校) ; Google(谷歌)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 CAST通过建模视觉状态转换,提升视频检索的一致性和连贯性,适用于多种视觉-语言嵌入空间。
FastSTAR: 空间时间令牌修剪用于高效的自回归视频合成
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 FastSTAR通过时空令牌修剪和部分更新机制,实现高效视频生成,在保持质量的同时提升处理速度。
CanvasMAR: 通过Canvas提升遮蔽自回归视频预测
机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) ; School of Intelligence Science and Technology, Peking University, Beijing, China(智能科学与技术学院,北京大学,北京,中国) ; State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(通用人工智能国家重点实验室,北京大学,北京,中国)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 CanvasMAR通过引入canvas机制和运动感知采样顺序,提升视频生成的保真度和效率,实现更高质量的视频生成。
GenHOI:面向对象一致性的手-物体交互方法,采用时间平衡和空间选择性的对象注入
机构 * Department of Computer Vision Technology(VIS), Baidu Inc.(百度公司计算机视觉技术部) ; Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) ; Northwestern Polytechnical University(西北工业大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 GenHOI通过时间平衡和空间选择性的对象注入方法,提升手-物体交互在现实场景中的生成一致性与保真度。
SPARK:通过协同提示音频与重新上下文化知识实现T2V模型的劫持
机构 * State Key Laboratory of Complex \& Critical Software Environment, Beihang University ; College of Science, Mathematics ; Technology, Wenzhou-Kean University ; 360 AI Security Lab ; Faculty of Innovation Engineering, Macau University of Science ; Hong Kong University of Science ; University of Chinese Academy of Sciences
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV
AI总结 SPARK通过模块化提示设计,利用音频与视觉关联模式,实现对T2V模型的高效劫持,提升攻击成功率23%。
FaceCam: 通过尺度感知条件化实现人像视频相机控制
机构 * University of California, Merced(加州大学梅尔塞德斯分校) ; Adobe Research(Adobe研究)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 FaceCam通过尺度感知条件化方法,提升单目人像视频的相机控制能力与视觉质量。
Comments Accepted by CVPR 2026. Project page: https://weijielyu.github.io/FaceCam
通过将多视角重建网络缝合到视频生成器中实现文本到3D
机构 * ETH Zurich(苏黎世联邦理工学院) ; Google(谷歌)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV
AI总结 VIST3A通过将多视角重建网络缝合到视频生成器中,实现文本到3D生成,提升3D场景生成质量。
Comments ICLR 2026 (Oral), Project page: https://gohyojun15.github.io/VIST3A/
任意生成视频插值
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 ArbInterp提出了一种可灵活调整时间戳和长度的视频帧插值框架,通过时间戳感知旋转位置嵌入和外观-运动解耦策略,实现更高效的生成与更流畅的时空过渡。
Comments ICLR 2026
StepVAR: 结构-纹理引导的视觉自回归模型剪枝
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV
AI总结 StepVAR通过结合结构和纹理重要性,提出无需训练的token剪枝框架,实现视觉自回归模型的高效推理加速。
RFDM: 基于残差流扩散模型的高效因果视频编辑
机构 * Samsung AI Center, Cambridge(三星人工智能中心,剑桥)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 RFDM通过残差流扩散模型实现高效因果视频编辑,超越I2I方法并竞争于全时空视频生成模型。
Comments Accepted at CVPR26
立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Bytedance Inc.(字节跳动公司) ; State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) ; School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。
Journal ref TPAMI 2025
UniFuture: 一个面向未来生成与感知的4D驾驶世界模型
机构 * Huazhong University of Science and Technology(华中科技大学) ; Baidu Inc.(百度公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 UniFuture通过统一4D建模提升自动驾驶中的未来生成与几何感知能力。
Comments Accepted by ICRA 2026
Solaris:在Minecraft中构建多玩家视频世界模型
机构 * New York University(纽约大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 Solaris通过多玩家数据系统和分阶段训练方法,在Minecraft中构建了能模拟多视角观测的视频世界模型,提升了多代理交互的建模能力。
Comments Project website: https://solaris-wm.github.io/
基于视频基础模型的世界模拟用于物理AI
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。
通过自适应低通引导改进图像到视频模型中的运动
机构 * KAIST(韩国科学技术院)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV
AI总结 本研究提出自适应低通引导方法,通过调整图像频率内容提升图像到视频生成的动态效果,同时保持图像质量和文本对齐度。
Comments Project page: http://choi403.github.io/ALG
为你叙述:基于多纠缠潜在空间的提示引导音频视觉叙述面部生成
机构 * Machine Intelligence Group, Department of CS&IS, BITS Pilani, Hyderabad Campus, India(机器智能组,计算机科学与信息学系,比斯汉学院海得拉巴校区,印度) ; Georgia Institute of Technology, USA(佐治亚理工学院,美国)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出了一种基于多纠缠潜在空间的音频视觉叙述面部生成方法,通过合成静态图像、语音档案和目标文本来生成逼真的说话面孔。
Comments To appear in the Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Presented at Poster Session 1
无需调优的视频间视觉效果转移
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Snap Research(Snap研究)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV
AI总结 RefVFX通过大规模数据集和自动化流程,实现了无需调优的视频间视觉效果转移,提升了动态时序效果的编辑效果。
Comments Project Page: https://snap-research.github.io/RefVFX/
通过嵌入学习与大语言模型揭示通用多模态检索的关键因素:U-MARVEL
机构 * Tencent PCG(腾讯PCG) ; Nanjing University(南京大学) ; ByteDance(字节跳动)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV
AI总结 U-MARVEL通过嵌入学习与大语言模型揭示通用多模态检索的关键因素,实现超越现有方法的性能。
Comments Accepted to ICLR 2026
Journal ref International Conference on Learning Representations (ICLR), 2026
Hand2World: 通过自由空间手势生成自主回归的视角交互
机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 Hand2World通过自由空间手势生成视角交互,利用自回归框架解决遮挡、相机运动解耦和长视频生成问题,提升视觉生成的质量与稳定性。
ReTracing:通过身体、机器和生成系统进行考古学研究
机构 * Department of Machine Learning(机器学习系) ; Carnegie Mellon University(卡内基梅隆大学) ; SIPA Technology Policy and Innovation(技术政策与创新研究所) ; Columbia University(哥伦比亚大学)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV
AI总结 ReTracing通过AI、人类和机器人互动,探索生成系统如何通过编舞运动反映社会文化偏见。
基于神经高斯力场的学习物理 grounded 4D 动力学
机构 * Institute for AI, Peking University(北京大学人工智能研究院) ; School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) ; School of EECS, Peking University(北京大学电子工程学院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Yuanpei College, Peking University(北京大学元培学院) ; State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) ; Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出神经高斯力场(NGFF),通过结合3D高斯感知与物理动力学建模,从多视角RGB输入生成交互式、物理真实的4D视频,提升视频预测的物理 grounded 性。
Comments 43 pages, ICLR 2026
T2VTree: 以用户为中心的视觉分析用于代理辅助的思维到视频创作
专题命中 视频生成 :video generation(abstract);分类 cs.MM
AI总结 T2VTree通过树形可视化和可编辑代理计划,支持多场景视频创作中的可靠细化、局部比较和实用重用。
Phaedra: 学习高保真离散标记化以用于物理科学
机构 * ETH AI Center(苏黎世联邦理工学院人工智能中心) ; IBM Research Europe(IBM欧洲研究院) ; Seminar for Applied Mathematics, ETH Zurich(苏黎世联邦理工学院应用数学系) ; Swiss Data Science Center, ETH Zurich(瑞士数据科学中心,苏黎世联邦理工学院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 Phaedra通过结合经典形状增益量化和正交分解,改进了科学图像的高保真离散标记化,提升PDE数据的重建和泛化能力。
Comments 57 pages, 27 figures
让拟人化角色互动:面向文本驱动的人-物体交互的可控对话拟人化
机构 * Tsinghua University(清华大学) ; Tencent HY(腾讯)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出InteractAvatar框架,通过双流结构实现文本驱动的人-物体交互生成,解决环境感知与控制质量矛盾,建立GroundedInter基准验证方法有效性。