arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

至 收录 109
2511.17492 2026-08-14 cs.CV 版本更新

EvDiff: Event-Based Video Reconstruction using One-Step Diffusion Models

EvDiff:高质视频与事件相机

Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Pani Paudel

机构 * Zhejiang University(浙江大学) INSAIT UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。

Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026

URL PDF HTML 收藏
2605.08784 2026-08-13 cs.CV 版本更新

simpleposter: A simple baseline for product poster generation

simpleposter: 产品海报生成的一个简单基线

Benlei Cui, Fangao Zeng, Weitao Jiang, Yuwen Zhai, Haiwen Hong, Longtao Huang, Hui Xue, Wenxiang Shang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出SimplePoster,一种基于修复的简单框架,实现产品外观忠实保留和精确文本布局控制,实验显示其在主体保留率和文本准确性上优于现有方法。

Comments Accepted to CVPR 2026

URL PDF HTML 收藏
2602.23783 2026-08-13 cs.CV 版本更新

Diffusion Probe: Generated Image Result Prediction Using CNN Probes

扩散探针:利用CNN探针进行生成图像结果预测

Benlei Cui, Bukun Huang, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Jingqun Tang, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, School of Statistics and Data Science, Zhejiang Gongshang University(浙江工商大学统计与数据科学学院共同富裕统计监测与智能治理实验室) Southeast University(东南大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ByteDance Inc.(字节跳动有限公司)

AI总结 本文提出Diffusion Probe框架,通过早期扩散交叉注意力分布预测最终图像质量,提升文本生成图像的效率与质量。

Comments CVPR 2026

URL PDF HTML 收藏
2603.02943 2026-08-13 cs.CV 版本更新

TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration

TC-Padé:轨迹一致的Padé近似用于扩散加速

Benlei Cui, Shaoxuan He, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Jingqun Tang, Zhou Zhao, Haiwen Hong

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学) ByteDance Intelligent Creation(字节跳动智能创作)

AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。

Comments CVPR 2026

URL PDF HTML 收藏
2512.08240 2026-08-12 cs.CV cs.AI 版本更新

Hybrid Token Compression for Vision-Language Models

HybridToken-VLM:用于视觉-语言模型的混合令牌压缩

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Princeton University(普林斯顿大学) Snap Inc(Snap公司)

AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率

Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM

URL PDF HTML 收藏
2510.20512 2026-08-11 cs.CV 版本更新

Adversarial Concept Distillation for One-Step Diffusion Personalization

对抗概念蒸馏用于一步扩散个性化

Yixiong Yang, Tao Wu, Senmao Li, Shiqi Yang, Yaxing Wang, Joost van de Weijer, Kai Wang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) VCIP, CS, Nankai University(南开大学计算机学院视觉计算与智能感知实验室) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目) City University of Hong Kong(香港城市大学)

AI总结 本文提出OPAD框架,结合教师-学生蒸馏与对抗监督,通过多步扩散模型作为教师,一步学生模型联合训练,以实现一步扩散模型的高效个性化。

Comments Accepted to CVPR 2026 Findings

URL PDF HTML 收藏
2411.16758 2026-08-11 cs.CV 版本更新

Motion-Aware Animatable Gaussian Avatars Deblurring

具有运动感知的可动画高斯人像去模糊

Muyao Niu, Yifan Zhan, Qingtian Zhu, Zhuoxiao Li, Wei Wang, Zhihang Zhong, Xiao Sun, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种从模糊视频中直接重建清晰3D人体高斯人像的方法,结合了基于物理的模糊模型和运动模型,以解决运动引起的模糊问题。

Comments Accepted at CVPR 2026, Codes: https://github.com/MyNiuuu/MAD-Avatar

URL PDF HTML 收藏
2603.02270 2026-08-11 cs.CV 版本更新

From Visual to Multimodal: Systematic Ablation of Encoders and Fusion Strategies in Animal Identification

从视觉到多模态:动物识别中编码器和融合策略的系统消融

Vasiliy Kudryavtsev, Kirill Borodin, German Berezin, Kirill Bubenchikov, Grach Mkrtchian, Alexander Ryzhkov

机构 * Faculty of IT, Technical University of Communication(信息科技学院,通信技术大学) AI lab, Avito(人工智能实验室,Avito)

AI总结 本研究提出多模态验证框架,通过合成文本描述提升视觉特征,利用门控融合机制在动物识别中实现84.28%的准确率,比单一模态基线提升11%。

Comments Accepted to the FGVC13 Workshop at CVPR 2026. And published at MDPI Journal of Imaging (see at https://www.mdpi.com/2313-433X/12/1/30)

Journal ref Journal of Imaging (2026) 12, no. 1: 30

URL PDF HTML 收藏
2506.07223 2026-08-11 cs.AI 版本更新

Reflex First, Reflect Later: Latency-Aware Embodied LLM Agents for Dynamic Response

先反射,后反思:面向动态响应的延迟感知具身大语言模型智能体

Yangqing Zheng, Shunqi Mao, Dingxin Zhang, Weidong Cai

机构 * School of Computer Science, The University of Sydney(计算机科学学院,悉尼大学)

AI总结 该研究针对动态环境中具身LLM智能体的推理延迟问题,提出RRARA智能体及相关评估指标,通过时间转换机制与预规划器实现决策质量与响应能力的平衡。

Comments Accepted by the CVPR 2025 Embodied AI Workshop

URL PDF HTML 收藏
2604.10217 2026-08-07 cs.CV 版本更新

Are Pretrained Image Matchers Good Enough for SAR-Optical Satellite Registration?

预训练图像匹配器在SAR-光学卫星配准中表现如何?

Isaac Corley, Alex Stoken, Gabriele Berton

机构 * Taylor Geospatial(泰勒地理空间公司) Independent Researcher(独立研究者)

AI总结 本文评估了24种预训练匹配器在跨模态卫星配准中的表现,发现显式跨模态训练并非必然提升性能,且部署协议对精度影响显著。

Comments CVPR 2026 Image Matching Workshop

URL PDF HTML 收藏
2604.04444 2026-08-07 cs.CV 版本更新

Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection

参数高效语义增强用于提升开放词汇物体检测

Weihao Cao, Runqi Wang, Xiaoyue Duan, Jinchao Zhang, Ang Yang, Liping Jing

机构 * State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学先进轨道交通自主运行全国重点实验室) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, Beijing Jiaotong University(北京交通大学交通数据挖掘与具身智能北京市重点实验室) School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) WeChat AI, China(微信人工智能实验室)

AI总结 本文提出HSA-DINO框架,通过多尺度提示库和语义感知路由提升开放词汇物体检测的域适应性和泛化能力。

Comments Accepted to CVPR 2026

URL PDF HTML 收藏
2602.18831 2026-08-07 cs.CV 版本更新

IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbation

IDperturb: 通过角度扰动增强合成人脸生成的多样性

Fadi Boutros, Eduarda Caldeira, Tahar Chettaoui, Naser Damer

机构 * Fraunhofer IGD(弗劳恩霍夫图像识别研究所) Department of Computer Science, TU Darmstadt(图腾大学计算机科学系)

AI总结 IDperturb通过角度扰动提升合成人脸生成的多样性,从而提高FR模型的性能和泛化能力。

Comments Accepted at CVPR 2026

URL PDF HTML 收藏
2605.29098 2026-08-06 cs.CV 版本更新

Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals

透视箱子:基于雷达信号的非视距三维重建

Jiachen Lu, Hailan Shanbhag, Haitham Al Hassanieh

机构 * École Polytechnique Fédérale de Lausanne(联邦理工学院洛桑校区)

AI总结 提出统一视距与非视距神经几何重建框架GeRaF 2.0,利用外部视距几何约束引导射频信号传播,实现稳定训练和物理一致的重建,在射频几何重建中达到新最优。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

URL PDF HTML 收藏
2502.06606 2026-08-05 cs.CV 版本更新

MaterialFusion: High-Quality, Zero-Shot, and Controllable Material Transfer with Diffusion Models

MaterialFusion:基于扩散模型的高质量零样本可控材质迁移

Kamil Garifullin, Maxim Nikolaev, Andrey Kuznetsov, Aibek Alanov

AI总结 MaterialFusion是基于扩散模型的新型材质迁移框架,可零样本实现高质量可控材质迁移,在质量、可控性等方面优于现有方法,代码公开。

Comments Accepted to CVPR 2025

URL PDF HTML 收藏
2604.00086 2026-08-04 cs.CV cs.AI cs.CL cs.LG 版本更新

Hierarchical Pre-Training of Vision Encoders with Large Language Model

基于大语言模型的视觉编码器分层预训练

Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee

机构 * University of Cincinnati(辛辛那提大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。

Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026

URL PDF HTML 收藏
2601.02457 2026-08-04 cs.CV 版本更新

PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding

PatchAlign3D: 本地特征对齐用于密集3D形状理解

Souhail Hadgi, Bingchen Gong, Ramana Sundararaman, Emery Pierson, Lei Li, Peter Wonka, Maks Ovsjanikov

机构 * École polytechnique(巴黎政治学院) University of Virginia(弗吉尼亚大学) KAUST(王国立阿联酋科技大学)

AI总结 PatchAlign3D通过点云直接生成语言对齐的片段特征,实现高效零样本3D部分分割,优于传统渲染方法。

Comments CVPR 2026. Project website: https://souhail-hadgi.github.io/patchalign3dsite/

URL PDF HTML 收藏
2603.13415 2026-08-03 cs.CV 版本更新

Distance-aware Soft Prompt Guidance for Multimodal Valence-Arousal Estimation

面向距离的软提示学习用于多模态愉悦-唤醒估计

Byeongjin Jung, Chanyeong Park, Sejoon Lim

机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) Department of Automobile and IT Convergence(汽车与IT融合系)

AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。

Comments 8pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301

URL PDF HTML 收藏
2512.05131 2026-08-03 cs.CV cs.AI cs.RO 版本更新

AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理

Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister

机构 * Southern University of Science and Technology(南方科技大学) Harvard University(哈佛大学) California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院)

AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。

Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026

URL PDF HTML 收藏
2511.12449 2026-07-31 cs.CV cs.AI cs.IR cs.LG 版本更新

MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding

MOON2.0:动态模态平衡多模态表示学习用于电商产品理解

Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。

Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures

URL PDF HTML 收藏
2506.21076 2026-07-31 cs.CV 版本更新

PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

PoseMaster: 一个统一的3D原生框架用于风格化姿态生成

Hongyu Yan, Kunming Luo, Weiyu Li, Kaiyi Zhang, Yixun Liang, Jingwei Huang, Chunchao Guo, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文脉)

AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。

Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster

URL PDF HTML 收藏
2503.15293 2026-07-31 cs.CV 版本更新

Test-Time Backdoor Detection for Object Detection Models

目标检测模型的测试时后门检测

Hangtao Zhang, Yichen Wang, Shihui Yan, Chenyu Zhu, Ziqi Zhou, Linshan Hou, Shengshan Hu, Minghui Li, Yanjun Zhang, Leo Yu Zhang

AI总结 针对目标检测模型的后门攻击挑战,提出测试时后门检测方法TRACE,利用变换一致性实现黑盒通用检测,AUROC较最优防御提升30%且可抵抗自适应攻击。

Comments Accepted to CVPR 2025. Code is available at https://github.com/Rookie143/Trace

URL PDF HTML 收藏
2603.27176 2026-07-29 cs.CV 版本更新

MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence

MEDIC-AD:迈向医疗视觉-语言模型的临床智能

Woohyeon Park, Jaeik Kim, Sunghwan Steve Cho, Pa Hong, Wookyoung Jeong, Yoojin Nam, Namjoon Kim, Ginny Y. Wong, Ka Chun Cheung, Jaeyoung Do

机构 * AIDAS Laboratory, Seoul National University(首尔大学AIDAS实验室) Samsung Changwon Hospital(三星昌原医院) Samsung Medical Center(三星医疗中心) NVIDIA, Santa Clara, USA(英伟达(美国圣克拉拉))

AI总结 MEDIC-AD通过分阶段框架提升医疗视觉-语言模型在病变检测、症状跟踪和视觉可解释性方面的性能,实现临床应用中的最优表现。

Journal ref CVPR 2026

URL PDF HTML 收藏
2604.10359 2026-07-28 cs.CV cs.AI 版本更新

Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinex

Multinex:通过多先验反光模型实现轻量级低光照图像增强

Alexandru Brateanu, Tingting Mu, Codruta Ancuti, Cosmin Ancuti

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) ETcTI, University Politehnica Timisoara(蒂米șoara工业大学ETcTI) West University of Timisoara(蒂米șoara西大学)

AI总结 本文提出Multinex,一种轻量级低光照图像增强框架,通过多先验反光模型实现光照和颜色校正,显著降低计算成本并提升性能。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

URL PDF HTML 收藏
2604.15670 2026-07-27 cs.CV 版本更新

PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

PixDLM:一种用于无人机推理分割的双路径多模态语言模型

Shuyan Ke, Yifan Mei, Changli Wu, Yonghan Zheng, Jiayi Ji, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。

Comments Accepted to CVPR 2026 (highlight)

URL PDF HTML 收藏
2605.22069 2026-07-23 cs.CV cs.LG 版本更新

TWINGS: Thin Plate Splines Warp-aligned Initialization for Sparse-View Gaussian Splatting

TWINGS: 基于薄板样条翘曲对齐的稀疏视图高斯泼溅初始化

Hyeseong Kim, Geonhui Son, Deukhee Lee, Dosik Hwang

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院)

AI总结 提出TWINGS框架,利用薄板样条(TPS)对齐反投影点与三角化控制点,为3D高斯泼溅提供几何精确的初始化,从而在稀疏视图下提升场景重建的细节保留和颜色保真度。

Comments Accepted at CVPR 2026, Project page: https://sandokim.github.io/twings/

URL PDF HTML 收藏
2602.19863 2026-07-22 cs.CV 版本更新

Brewing Stronger Features: Dual-Teacher Distillation for Multispectral Earth Observation

酿造更强的特征:多光谱地球观测的双教师蒸馏

Filip Wolf, Blaž Rolih, Luka Čehovin Zajc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅纳大学计算机与信息科学学院)

AI总结 本文提出双教师对比蒸馏框架,用于多光谱地球观测,通过结合多光谱和光学教师,实现跨模态表示学习,提升多光谱和光学数据的性能。

Comments Accepted to CVPR 2026 as Highlight

URL PDF HTML 收藏
2510.08532 2026-07-22 cs.CV cs.AI 版本更新

Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing

连续上下文:基于指令的图像编辑的连续强度控制

Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang

机构 * Snap Research Tel Aviv University(特拉维夫大学) IISc Bangalore(班加罗尔IISc)

AI总结 研究基于指令的图像编辑中编辑强度控制问题,提出连续上下文模型,通过扩展先进模型并引入标量编辑强度,训练轻量级投影网络,合成多样数据集,实现对多种图像编辑操作的编辑强度统一细粒度控制。

Comments Project Page: https://snap-research.github.io/kontinuouskontext/, Accepted at CVPR 2026

URL PDF HTML 收藏
2508.05157 2026-07-22 cs.LG 版本更新

Onboarding Without Forgetting: Hypernetwork Personalization with Data-Free Replay for Personalized Federated Learning

不忘旧知:用于个性化联邦学习的无数据重放超网络个性化

Thinh Nguyen, Le Huy Khiem, Van-Tuan Tran, Khoa D Doan, Nitesh V Chawla, Kok-Seng Wong

机构 * VinUni-Illinois Smart Health Center(VinUni-Illinois智能健康中心) College of Engineering & Computer Science(工程与计算机科学学院) University of Notre Dame(诺特丹大学) Technische Universität Berlin(柏林技术大学)

AI总结 研究联邦学习中新客户端分批加入场景,提出pFedDSH方法,结合中央超网络、二进制掩码和无数据重放,平衡新旧客户端利益,在不暴露数据情况下传播改进,实验证明该方法能保持现有客户端稳定性,维持新客户端通信及适应成本不变。

Comments CVPR 2026 Findings

URL PDF HTML 收藏
2601.17950 2026-07-21 cs.CV 版本更新

UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders

UPLiFT:高效像素密集特征上采样与局部关注者

Matthew Walmer, Saksham Suri, Anirud Aggarwal, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Meta

AI总结 UPLiFT通过高效局部关注者操作符实现低成本的像素密集特征上采样,优于现有方法。

Comments Accepted to CVPR 2026 as conference paper. Website: see https://www.cs.umd.edu/~mwalmer/uplift/. Code and Models: see https://github.com/mwalmer-umd/UPLiFT

URL PDF HTML 收藏
2510.19789 2026-07-21 cs.CV 版本更新

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-X:通用多模态全身运动生成

Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

AI总结 介绍用于全身人类运动生成的OmniMotion-X框架,利用自回归扩散变换器,提出参考运动等方法,构建数据集并采用新训练策略,超越现有方法,在多模态任务中表现出色,可交互式生成逼真连贯可控的长时间运动。

Comments Accepted to CVPR 2026 Findings

URL PDF HTML 收藏