arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2510.13669 2026-03-09 cs.CV cs.AI cs.LG 57%

CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas

CanvasMAR: 通过Canvas提升遮蔽自回归视频预测

Zian Li, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(智能科学与技术学院,北京大学,北京,中国) State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(通用人工智能国家重点实验室,北京大学,北京,中国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 CanvasMAR通过引入canvas机制和运动感知采样顺序,提升视频生成的保真度和效率,实现更高质量的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06048 2026-03-09 cs.CV 57%

GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injection

GenHOI:面向对象一致性的手-物体交互方法,采用时间平衡和空间选择性的对象注入

Xuan Huang, Mochu Xiang, Zhelun Shen, Jinbo Wu, Chenming Wu, Chen Zhao, Kaisiyuan Wang, Hang Zhou, Shanshan Liu, Haocheng Feng, Wei He, Jingdong Wang

机构 * Department of Computer Vision Technology(VIS), Baidu Inc.(百度公司计算机视觉技术部) Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Northwestern Polytechnical University(西北工业大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 GenHOI通过时间平衡和空间选择性的对象注入方法,提升手-物体交互在现实场景中的生成一致性与保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13127 2026-03-09 cs.CV cs.CR 57%

SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge

SPARK:通过协同提示音频与重新上下文化知识实现T2V模型的劫持

Zonghao Ying, Moyang Chen, Nizhang Li, Zhiqiang Wang, Wenxin Zhang, Quanchen Zou, Zonglei Jing, Aishan Liu, Xianglong Liu

机构 * State Key Laboratory of Complex \& Critical Software Environment, Beihang University College of Science, Mathematics Technology, Wenzhou-Kean University 360 AI Security Lab Faculty of Innovation Engineering, Macau University of Science Hong Kong University of Science University of Chinese Academy of Sciences

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 SPARK通过模块化提示设计,利用音频与视觉关联模式,实现对T2V模型的高效劫持,提升攻击成功率23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05506 2026-03-06 cs.CV 57%

FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning

FaceCam: 通过尺度感知条件化实现人像视频相机控制

Weijie Lyu, Ming-Hsuan Yang, Zhixin Shu

机构 * University of California, Merced(加州大学梅尔塞德斯分校) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 FaceCam通过尺度感知条件化方法,提升单目人像视频的相机控制能力与视觉质量。

Comments Accepted by CVPR 2026. Project page: https://weijielyu.github.io/FaceCam

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13454 2026-03-06 cs.CV 57%

Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator

通过将多视角重建网络缝合到视频生成器中实现文本到3D

Hyojun Go, Dominik Narnhofer, Goutam Bhat, Prune Truong, Federico Tombari, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 VIST3A通过将多视角重建网络缝合到视频生成器中,实现文本到3D生成,提升3D场景生成质量。

Comments ICLR 2026 (Oral), Project page: https://gohyojun15.github.io/VIST3A/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00578 2026-03-04 cs.CV 57%

Arbitrary Generative Video Interpolation

任意生成视频插值

Guozhen Zhang, Haiguang Wang, Chunyu Wang, Yuan Zhou, Qinglin Lu, Limin Wang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ArbInterp提出了一种可灵活调整时间戳和长度的视频帧插值框架,通过时间戳感知旋转位置嵌入和外观-运动解耦策略,实现更高效的生成与更流畅的时空过渡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01757 2026-03-03 cs.CV 57%

StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models

StepVAR: 结构-纹理引导的视觉自回归模型剪枝

Keli Liu, Zhendong Wang, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 StepVAR通过结合结构和纹理重要性,提出无需训练的token剪枝框架,实现视觉自回归模型的高效推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06871 2026-03-03 cs.CV 57%

RFDM: Residual Flow Diffusion Model for Efficient Causal Video Editing

RFDM: 基于残差流扩散模型的高效因果视频编辑

Mohammadreza Salehi, Mehdi Noroozi, Luca Morreale, Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Ramos, Abhinav Mehrotra

机构 * Samsung AI Center, Cambridge(三星人工智能中心,剑桥)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 RFDM通过残差流扩散模型实现高效因果视频编辑,超越I2I方法并竞争于全时空视频生成模型。

Comments Accepted at CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13587 2026-02-27 cs.CV 57%

UniFuture: A 4D Driving World Model for Future Generation and Perception

UniFuture: 一个面向未来生成与感知的4D驾驶世界模型

Dingkang Liang, Dingyuan Zhang, Xin Zhou, Sifan Tu, Tianrui Feng, Xiaofan Li, Yumeng Zhang, Mingyang Du, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 UniFuture通过统一4D建模提升自动驾驶中的未来生成与几何感知能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22208 2026-02-27 cs.CV 57%

Solaris: Building a Multiplayer Video World Model in Minecraft

Solaris:在Minecraft中构建多玩家视频世界模型

Georgy Savva, Oscar Michel, Daohan Lu, Suppakit Waiwitlikhit, Timothy Meehan, Dhairya Mishra, Srivats Poddar, Jack Lu, Saining Xie

机构 * New York University(纽约大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Solaris通过多玩家数据系统和分阶段训练方法,在Minecraft中构建了能模拟多视角观测的视频世界模型,提升了多代理交互的建模能力。

Comments Project website: https://solaris-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 57%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08456 2026-02-25 cs.CV 57%

Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance

通过自适应低通引导改进图像到视频模型中的运动

June Suk Choi, Kyungmin Lee, Sihyun Yu, Yisol Choi, Jinwoo Shin, Kimin Lee

机构 * KAIST(韩国科学技术院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本研究提出自适应低通引导方法,通过调整图像频率内容提升图像到视频生成的动态效果,同时保持图像质量和文本对齐度。

Comments Project page: http://choi403.github.io/ALG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18618 2026-02-24 cs.CV 57%

Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space

为你叙述:基于多纠缠潜在空间的提示引导音频视觉叙述面部生成

Aashish Chandra, Aashutosh A, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, BITS Pilani, Hyderabad Campus, India(机器智能组,计算机科学与信息学系,比斯汉学院海得拉巴校区,印度) Georgia Institute of Technology, USA(佐治亚理工学院,美国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于多纠缠潜在空间的音频视觉叙述面部生成方法,通过合成静态图像、语音档案和目标文本来生成逼真的说话面孔。

Comments To appear in the Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Presented at Poster Session 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07833 2026-02-20 cs.CV 57%

Tuning-free Visual Effect Transfer across Videos

无需调优的视频间视觉效果转移

Maxwell Jones, Rameen Abdal, Or Patashnik, Ruslan Salakhutdinov, Sergey Tulyakov, Jun-Yan Zhu, Kuan-Chieh Jackson Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Snap Research(Snap研究)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 RefVFX通过大规模数据集和自动化流程,实现了无需调优的视频间视觉效果转移,提升了动态时序效果的编辑效果。

Comments Project Page: https://snap-research.github.io/RefVFX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14902 2026-02-17 cs.IR cs.CV 57%

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

通过嵌入学习与大语言模型揭示通用多模态检索的关键因素:U-MARVEL

Xiaojie Li, Chu Li, Shi-Zhe Chen, Xi Chen

机构 * Tencent PCG(腾讯PCG) Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 U-MARVEL通过嵌入学习与大语言模型揭示通用多模态检索的关键因素,实现超越现有方法的性能。

Comments Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09600 2026-02-16 cs.CV 57%

Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures

Hand2World: 通过自由空间手势生成自主回归的视角交互

Yuxi Wang, Wenqi Ouyang, Tianyi Wei, Yi Dong, Zhiqi Shen, Xingang Pan

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Hand2World通过自由空间手势生成视角交互,利用自回归框架解决遮挡、相机运动解耦和长视频生成问题,提升视觉生成的质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11242 2026-02-13 cs.CV 57%

ReTracing: An Archaeological Approach Through Body, Machine, and Generative Systems

ReTracing:通过身体、机器和生成系统进行考古学研究

Yitong Wang, Yue Yao

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学) SIPA Technology Policy and Innovation(技术政策与创新研究所) Columbia University(哥伦比亚大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 ReTracing通过AI、人类和机器人互动,探索生成系统如何通过编舞运动反映社会文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00148 2026-02-13 cs.CV cs.AI 57%

Learning Physics-Grounded 4D Dynamics with Neural Gaussian Force Fields

基于神经高斯力场的学习物理 grounded 4D 动力学

Shiqian Li, Ruihong Shen, Junfeng Ni, Chang Pan, Chi Zhang, Yixin Zhu

机构 * Institute for AI, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) School of EECS, Peking University(北京大学电子工程学院) Department of Automation, Tsinghua University(清华大学自动化系) Yuanpei College, Peking University(北京大学元培学院) State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出神经高斯力场(NGFF),通过结合3D高斯感知与物理动力学建模,从多视角RGB输入生成交互式、物理真实的4D视频,提升视频预测的物理 grounded 性。

Comments 43 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08368 2026-02-10 cs.MM cs.GR cs.HC cs.MA 57%

T2VTree: User-Centered Visual Analytics for Agent-Assisted Thought-to-Video Authoring

T2VTree: 以用户为中心的视觉分析用于代理辅助的思维到视频创作

Zhuoyun Zheng, Yu Dong, Gaorong Liang, Guan Li, Guihua Shan, Shiyu Cheng, Dong Tian, Jianlong Zhou, Jie Liang

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 T2VTree通过树形可视化和可编辑代理计划,支持多场景视频创作中的可靠细化、局部比较和实用重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03915 2026-02-05 cs.CV cs.AI cs.CE cs.LG 57%

Phaedra: Learning High-Fidelity Discrete Tokenization for the Physical Science

Phaedra: 学习高保真离散标记化以用于物理科学

Levi Lingsch, Georgios Kissas, Johannes Jakubik, Siddhartha Mishra

机构 * ETH AI Center(苏黎世联邦理工学院人工智能中心) IBM Research Europe(IBM欧洲研究院) Seminar for Applied Mathematics, ETH Zurich(苏黎世联邦理工学院应用数学系) Swiss Data Science Center, ETH Zurich(瑞士数据科学中心,苏黎世联邦理工学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Phaedra通过结合经典形状增益量化和正交分解,改进了科学图像的高保真离散标记化,提升PDE数据的重建和泛化能力。

Comments 57 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01538 2026-02-04 cs.CV cs.AI cs.CL 57%

Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars

让拟人化角色互动:面向文本驱动的人-物体交互的可控对话拟人化

Youliang Zhang, Zhengguang Zhou, Zhentao Yu, Ziyao Huang, Teng Hu, Sen Liang, Guozhen Zhang, Ziqiao Peng, Shunkai Li, Yi Chen, Zixiang Zhou, Yuan Zhou, Qinglin Lu, Xiu Li

机构 * Tsinghua University(清华大学) Tencent HY(腾讯)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出InteractAvatar框架,通过双流结构实现文本驱动的人-物体交互生成,解决环境感知与控制质量矛盾,建立GroundedInter基准验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21408 2026-02-03 cs.CV 57%

MPF-Net: Exposing High-Fidelity AI-Generated Video Forgeries via Hierarchical Manifold Deviation and Micro-Temporal Fluctuations

MPF-Net:通过分层流形偏差和微时间波动暴露高保真AI生成视频伪造

Xinan He, Kaiqing Lin, Yue Zhou, Jiaming Zhong, Wei Ye, Wenhui Yi, Bing Fan, Feng Ding, Haodong Li, Bo Cao, Bin Li

机构 * Nanchang University(南昌大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室、深圳媒体安全重点实验室) SZU AFS Joint Innovation Center for AI Technology, Shenzhen University(SZU AFS人工智能技术联合创新中心、深圳大学) Huazhong University of Science(华中科技大学) University of North Texas(北卡罗来纳州立大学) The Smart City Research institute of China Electronics Technology Group Corporation, shenzhen(中国电子科技集团有限公司智慧城市研究院,深圳)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MPF-Net通过分层流形偏差和微时间波动检测高保真AI生成视频伪造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10942 2026-02-03 cs.CV 57%

VL-JEPA: Joint Embedding Predictive Architecture for Vision-language

VL-JEPA:面向视觉-语言的联合嵌入预测架构

Delong Chen, Mustafa Shukor, Theo Moutakanni, Willy Chung, Jade Yu, Tejaswi Kasarla, Yejin Bang, Allen Bolourchi, Yann LeCun, Pascale Fung

机构 * Meta FAIR HKUST(香港科技大学) Sorbonne Université(索邦大学) NYU(纽约大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22086 2026-01-30 physics.flu-dyn cs.CV 57%

Learning Transient Convective Heat Transfer with Geometry Aware World Models

利用几何感知的世界模型学习瞬态对流热传递

Onur T. Doganay, Alexander Klawonn, Martin Eigel, Hanno Gottschalk

机构 * Institute of Mathematics, TU Berlin(柏林技术大学数学研究所) Siemens Energy AG(西门子能源有限公司) Weierstrass Institute for Applied Analysis and Stochastics(魏尔斯特拉斯应用分析与概率研究所)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种几何感知的世界模型架构,用于学习瞬态对流热传递,通过双重条件机制和架构适应性提升物理模拟的可控性和精度。

Comments 36 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16522 2026-01-27 cs.CV 57%

Adams Bashforth Moulton Solver for Inversion and Editing in Rectified Flow

Adams-Bashforth-Moulton 解决方案用于 rectified 流中的反向和编辑

Yongjia Ma, Donglin Di, Xuan Liu, Xiaokai Chen, Lei Fan, Tonghua Su, Yue Gao

机构 * Li Auto(利亚 Auto) Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ABM求解器,通过多步预测校正和自适应步长调整提升rectified流模型的求解精度和编辑质量,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20655 2026-01-27 cs.CV 57%

Photography Perspective Composition: Towards Aesthetic Perspective Recommendation

摄影视角构图:迈向审美视角推荐

Lujian Yao, Siming Zheng, Xinbin Yuan, Zhuoxuan Cai, Pu Wu, Jinwei Chen, Bo Li, Peng-Tao Jiang

机构 * vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出摄影视角构图(PPC)方法,通过自动化数据集构建、视频生成和视角质量评估模型,解决视角变换数据稀缺和评估标准模糊的问题,帮助普通用户提升摄影构图能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16982 2026-01-26 cs.CV cs.LG cs.RO 57%

AnyView: Synthesizing Any Novel View in Dynamic Scenes

AnyView: 动态场景中合成任意新视角

Basile Van Hoorick, Dian Chen, Shun Iwase, Pavel Tokmakov, Muhammad Zubair Irshad, Igor Vasiljevic, Swati Gupta, Fangzhou Cheng, Sergey Zakharov, Vitor Campagnolo Guizilini

机构 * Toyota Research Institute(丰田研究院) Amazon Web Services(亚马逊网络服务)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 AnyView通过动态视角合成框架实现任意视角生成,克服了传统方法在高度动态场景中的局限性,提出了新的基准测试并展示了优越的性能。

Comments Project webpage: https://tri-ml.github.io/AnyView/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10072 2026-01-26 cs.CV 57%

ToonifyGB: StyleGAN-based Gaussian Blendshapes for 3D Stylized Head Avatars

ToonifyGB: 基于StyleGAN的高斯混合形状用于3D风格化头身人偶

Rui-Yang Ju, Sheng-Yen Huang, Yi-Ping Hung

机构 * Graduate Institute of Networking and Multimedia(网络与多媒体研究生院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ToonifyGB通过改进的StyleGAN生成风格化视频并结合高斯混合形状,实现高效渲染多样化风格化的3D头身人偶。

Comments 2-Page Version Accepted as a Poster at IEEE VR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14037 2026-01-22 cs.CV 57%

Human detectors are surprisingly powerful reward models

人类检测器出人意料地强大

Kumar Ashutosh, XuDong Wang, Xi Yin, Kristen Grauman, Adam Polyak, Ishan Misra, Rohit Girdhar

机构 * Meta University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出 HuDA 模型,通过简单奖励函数提升视频生成中的人体运动质量,胜率高达 73%。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏