arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2420 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2420 篇

2608.23410 2026-08-25 cs.CV cs.LG 新提交 57%

Photorealistic Novel View Synthesis of Human Faces using Next-Scale Transformers

基于Next-Scale Transformer的人脸真实感新视角合成

Federico Stella, Fei Jiang, Zhongshi Jiang, Zohar Barzelay, Emanuel Garbin, Amin Jourabloo, Liuhao Ge

机构 * École polytechnique fédérale de Lausanne(洛桑联邦理工学院) Meta

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究将next-scale自回归范式适配人脸新视角合成,结合Transformer模型实现高保真多视角人脸3D模型生成,较扩散模型需更少专用训练数据,提升了感知与跨视角一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23206 2026-08-25 cs.CV 新提交 57%

Learning Spherical Occupancy Profiles for Multi-View 3D Reconstruction and Generation

用于多视图三维重建与生成的球形占用轮廓学习

YiHsuan Tsai

机构 * Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出将逐光线球形占用轮廓作为统一中间表示,训练判别式解码器与生成式流水线,在多视图三维重建任务中取得良好效果,且可迁移至真实照片场景。

Comments 12 pages,5 figures,5 tables. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23070 2026-08-25 cs.AI cs.CV 新提交 57%

From Generation to Simulation: How Far Are World Models from Being True Simulators?

从生成到模拟:世界模型距离真正的模拟器还有多远?

Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(军事科学院系统工程研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究通过系统评估200篇相关成果,分析了潜在动力学等3条技术路线的世界模型在传统模拟器8项能力上的表现,指出其在状态反馈等方面的缺陷并提出6个研究方向。

Comments 42 pages, 23 figures, 2 tables. Project page: this https URL (https://github.com/AtongWang/world-model-simulators)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22299 2026-08-25 cs.CV 新提交 57%

Targeted Iterative Filtering

定向迭代滤波

Freddie Åström, Michael Felsberg, George Baravdish, Claes Lundström

机构 * Linköping University(林雪平大学) Center for Medical Image Science and Visualization(医学影像科学与可视化中心) Sectra AB(赛特拉公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对不同应用领域对图像去噪的差异化要求,提出源自应用确定值空间线性扩散的新型非线性扩散方案,其性能优于现有同类技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21967 2026-08-25 cs.CV 新提交 57%

Trustworthy Visual Quality Inspection under Data Scarcity in Manufacturing

数据稀缺场景下制造业的可信视觉质量检测

Panagiotis Sapoutzoglou, Jessy Ribaira, Martin Kanounnikoff, Bas Tijsma, Christian Geiß, Maria Pateraki

机构 * National Technical University of Athens(雅典国立技术大学) German Aerospace Center (DLR)(德国航空航天中心) Philips(飞利浦) University of Bonn(波恩大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对制造业数据稀缺导致的视觉检测可信性不足问题,该研究结合扩散模型生成合成缺陷样本与贝叶斯分类器的不确定性感知决策,构建分阶段流水线,初步结果显示可降低部署可信检测模型的成本。

Comments Accepted at International Conference on the Economics of Grids, Clouds, Systems, and Services (GECON) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21786 2026-08-25 cs.CV 新提交 57%

HP-UniIF: Hierarchical Prompt Learning for Unified Image Fusion

HP-UniIF:用于统一图像融合的分层提示学习

Xingxin Xu, Siqi Zhao, Xin Li, Xinjie Yao, Yiming Sun, Pengfei Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 HP-UniIF是一种基于分层条件调制策略的统一视觉框架,利用扩散先验实现异构图像融合、视觉恢复与下游感知的协同,在多任务实验中表现出优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20621 2026-08-24 cs.CV 新提交 57%

RECOUNT: Reference-guided Counting with Synthetic Visual Exemplars

RECOUNT:基于合成视觉示例的参考引导计数

Adriano D'Alessandro, Ali Mahdavi-Amiri, Ghassan Hamarneh

机构 * Simon Fraser University(西蒙菲莎大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RECOUNT是基于合成视觉示例的图像引导零样本计数即插即用框架,通过扩散模型扩展参考图像生成示例库,在两个基准上实现最优零样本计数准确率,大幅降低计数误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20534 2026-08-24 cs.CV 新提交 57%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20561 2026-08-24 eess.IV cs.AI cs.CV cs.LG physics.med-ph 新提交 57%

Consistency Models for Fast MRI Reconstruction Using Regularization by Denoising

基于去噪正则化的快速MRI重建一致性模型

Merve Gülle, Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出CM-RED方法,将一致性模型整合到去噪正则化框架中,仅用4次网络函数评估,在fastMRI数据集上实现优于现有方法的快速高质量MRI重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20335 2026-08-21 cs.CV 新提交 57%

4DAnyone: Create Anyone in 4D from a Casual Monocular Video

4DAnyone:从随意的单目视频中创建4D虚拟人物

Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Robbyant Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 4DAnyone是一种从单目视频重建4D人体的框架,通过RCP和TCR解决多视图一致性问题,在相关数据集上优于现有方法且泛化性好。

Comments Project page: https://4danyone.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19965 2026-08-21 cs.CV cs.LG q-bio.QM 新提交 57%

Flow Matching Meets 3D Curvilinear Structure Segmentation in Medical Imaging

流匹配在医学影像三维曲线结构分割中的应用

Sidi Mohamed Sid'El Moctar, Nicolas Vitry, Hélène Bouvrais

机构 * CNRS(法国国家科学研究中心) Univ. Rennes(雷恩大学) Institute of Genetics and Development of Rennes (IGDR)(雷恩遗传与发育研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于流匹配的3D-CurvSegFlow模型,用于三维医学图像的曲线结构分割,在三个不同公开数据集上的表现优于通用及血管专用方法,为医学图像分析提供高效泛化的新方向。

Comments International Workshop on Machine Learning in Medical Imaging (MLMI 2026) @ MICCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19900 2026-08-21 cs.CV 新提交 57%

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures

AvatarDynamizer:通过生成式动态纹理从静态化身到动态人类化身

Guoxing Sun, Heming Zhu, Linjie Lyu, Pascal Fua, Christian Theobalt, Marc Habermann

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) EPFL(洛桑联邦理工学院) VIA Research Center(VIA研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AvatarDynamizer是一种生成式方法,可将现成静态3D化身转为可控多视角一致4D化身,通过纹理空间动态嵌入实现真实表面动态,在视觉保真度上优于通用方法。

Comments Project page: https://vcai.mpi-inf.mpg.de/projects/AvatarDynamizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20112 2026-08-21 eess.IV cs.CV physics.med-ph 新提交 57%

Flow Matching-Based PET Image Reconstruction

基于流匹配的正电子发射断层扫描(PET)图像重建

Fumio Hashimoto, Ziqian Huang, Tatsuya Yokota, Kuang Gong

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出两种基于流匹配的PET图像重建方法,经[$^{\text{18}}\text{F}$]FDG脑部PET数据集实验,其在不同剂量水平下的偏差-方差权衡优于其他参考方法,展现出流匹配作为定量PET重建生成先验的潜力。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19036 2026-08-20 cs.CV 新提交 57%

USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes

USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示

Li-Heng Chen, Haokai Pang, Chengye Su, Jiarun Liu, Qifeng Chen, Ziqian Ni, Jianxin Huang, Shi-Sheng Huang, Hongbo Fu, Sheng Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18907 2026-08-20 cs.CV cs.AI 新提交 57%

Learning-State-Aware Dynamic Generative Data Augmentation on Small-Scale Datasets

面向小规模数据集的学习状态感知动态生成式数据增强

Ting Xiang, Chenxi Deng, Jinhui Zhao, Bingting Jiang, Ke Zhang, Changjian Chen, Zhuo Tang

机构 * Hunan University(湖南大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对小规模图像分类数据稀缺问题,提出LSADA方法,通过构建样本学习状态映射增强强度,采用解耦增强与扩散融合策略,在9个数据集上较SOTA动态GDA方法取得平均2.5%-4.5%的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18523 2026-08-20 cs.CV cs.AI 新提交 57%

Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection

用于通用AI生成图像检测的先验条件高斯判别模型

Shashank Kotyan, Makoto Shing, Yuki Imajuku, Rujikorn Charakorn, Tarin Clanuwat

机构 * Sakana AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对AI生成图像检测在多因素变化下失效的问题,提出先验条件高斯判别梯方法,在Percept-Lens数据集上验证其性能,推动相关报告与基线的优化。

Comments Accepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18516 2026-08-20 cs.CV cs.AI 新提交 57%

OptiModNet: A UNet-Transformer Hybrid with Grouped-Query and Channel Attention for Optic Disc and Cup Segmentation

OptiModNet:用于视盘和视杯分割的结合分组查询与通道注意力的UNet-Transformer混合模型

Soumili Ghosh, Debapriya Roy, Aryan Das, Bikash Santra

机构 * IEM Saltlake(IEM盐湖校区) Techno Main Salt Lake(Techno主盐湖校区) VIT Bhopal University(博帕尔维洛尔理工大学) IIT Jodhpur(焦特布尔印度理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出OptiModNet,一款用于视盘和视杯分割的轻量混合架构,结合分组查询与通道注意力及聚合金字塔损失,在REFUGE2数据集上实现超现有方法2.5%的最优性能,且仅需3.73 GFLOPs和1.93M参数,兼顾高性能与低计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18035 2026-08-19 cs.CV 新提交 57%

Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving

用于端到端自动驾驶的即插即用交通元素感知

Zongzheng Zhang, Jijun Wang, Saining Zhang, Shuo Wang, Yiru Wang, Hai Yang, Yang Chen, Yuwen Heng, Hao Sun, Anqing Jiang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Bosch Corporate Research(博世企业研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究首次系统探究端到端自动驾驶的交通元素感知,通过补充标注构建统一基础设施,以即插即用方式集成信号,在多范式多数据集上提升性能,在NAVSIM-v2上达到新SOTA。

Comments Accepted by ECCV 2026; Project Page: https://zzongzheng0918.github.io/TE-Aware-E2E-AD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17420 2026-08-19 cs.CV 新提交 57%

SPVC: Structured and Panoptic Video Fixing for Cross-Dataset Driving Scene Rendering

SPVC:面向跨数据集驾驶场景渲染的结构化全景视频修复

Gen Li, Shu Han, Yun Xi Qiao, Hua Chen, Xuyang Dai, Bohan Li, Hao Zhao, Chaojian Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Great Wall Motor Company Limited(长城汽车股份有限公司) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SPVC框架,通过结构化、全景、视频及跨数据集修复原则,训练两阶段可控视频扩散模型,解决驾驶场景渲染的伪影问题,实现跨数据集的高效修复。

Comments Project page: https://li00147.github.io/SPVC-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17095 2026-08-19 cs.CV 新提交 57%

Inference-Time Attention Steering for Vision-Language-Action Driving Models

面向视觉-语言-动作驾驶模型的推理时注意力引导

Darshan Nagendra Prasad, Lars Ullrich, Knut Graichen

机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对VLA驾驶模型无法在推理时重定向注意力的问题,在Qwen3-VL主干上添加预softmax注意力偏差,实验验证了其对轨迹的引导效果及层相关特性。

Comments Attention Steering, Vision-Language-Action, AutonomousDriving, Inference-Time Intervention

Journal ref European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15734 2026-08-18 eess.AS cs.MM cs.SD 新提交 57%

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

CineDub:将端到端视频配音扩展至带连贯音效的多说话人对话场景

Yusheng Dai, Kangdi Wang, Baolong Gao, Yuxuan Jiang, Weiqiang Wang, Qiuhong Ke, Jianfei Cai

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本研究提出基于扩散模型的统一架构CineDub,无需人脸裁剪或说话人分割即可实现精准多说话人对话配音,还引入两项训练策略并发布两个野外基准,在相关任务中取得最优性能。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14758 2026-08-18 eess.IV cs.AI cs.CV 新提交 57%

Synthesizing Post-Acetazolamide Cerebral Blood Flow Maps from Baseline MRI in Moyamoya Using 3D Generative AI

利用3D生成AI从烟雾病患者的基线MRI合成乙酰唑胺给药后脑血流量图

Julia Huang, Camila Gonzalez, Rydham Goyal, Aja Zou, Sasha Alexander, Michael Moseley, Moss Y. Zhao, Gary K. Steinberg

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出CAE3D模型,可从烟雾病患者基线MRI合成乙酰唑胺后脑血流量图,在多指标上优于对比方法,为ACZ禁忌患者的血流动力学评估提供可行方案。

Comments 25 pages. Accepted at Machine Learning for Healthcare (MLHC 2026). To appear in Proceedings of Machine Learning Research (PMLR), volume 340

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16457 2026-08-18 cs.CV cs.AI 新提交 57%

Contrastive Energy Fields for Inference-Time Procedure Planning in Instructional Videos

用于教学视频中推理时流程规划的对比能量场(CEFITO)

Mohamed Afham, Christoph Reich, Oliver Hahn, Daniel Cremers, Stefan Roth

机构 * TU Darmstadt(达姆施塔特工业大学) TU Munich(慕尼黑工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有流程规划方法缺乏任务逻辑约束的问题,提出CEFITO方法,将流程规划构建为任务约束优化问题,在两个基准上取得最先进准确率。

Comments To appear at GCPR 2026 (oral paper). Project page: https://visinf.github.io/cefito

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16380 2026-08-18 cs.CV cs.AI 新提交 57%

Synthetic Data Augmentation for Satellite-Based Analysis of Battle-Damaged Agricultural Fields in Ukraine

用于乌克兰战区受损农田卫星分析的合成数据增强方法

Marta Sumyk, Oleksandr Kosovan, Iryna Voitsitska

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对乌克兰受损农田卫星分析的标注数据稀缺问题,采用类别条件GAN与DDPM生成合成农田样本,结合真实数据训练视觉Transformer,使分类性能显著提升,验证了合成卫星图像在数据稀缺地理空间应用的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16354 2026-08-18 cs.AI cs.CV 新提交 57%

DriveCache: Action-Aware Caching for Driving World Model Inference

DriveCache:面向驾驶世界模型推理的动作感知缓存

Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。

Comments 9 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15690 2026-08-18 cs.SD cs.AI cs.LG cs.MM 新提交 57%

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

为文本-音频-视频模型添加带单个零初始化层的语音克隆功能

Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15555 2026-08-18 cs.CV cs.LG 新提交 57%

RigidBench: Evaluating Rigid-Body Physics in Video Generation Models

RigidBench:评估视频生成模型中的刚体物理效果

Swarnim Jain, Shangzhe Wu

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出基于模拟器的RigidBench基准,评估视频生成模型的刚体物理效果,分析8个模型的表现,用5000个训练视频微调Wan 2.2 TI2V-5B并揭示其表征物体位置的机制。

Comments 30 pages, including appendices. Code: https://github.com/swarnim-j/RigidBench. Dataset: https://doi.org/10.5281/zenodo.21649156

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15298 2026-08-18 cs.CV 新提交 57%

Image Denoising via the Adaptive Rank-Cluster Filter

基于自适应秩聚类滤波器的图像去噪方法

Dmitry Pozdnyakov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出自适应秩聚类滤波器,经Otsu聚类、模糊融合处理像素强度,在混合噪声场景下对图像去噪的鲁棒性优于多种基线滤波算法。

Comments 18 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15296 2026-08-18 cs.CV 新提交 57%

FMReward: Aligning and Evaluating Audio-Driven 3D Facial Animation with Human Preferences

FMReward:基于人类偏好的音频驱动三维面部动画对齐与评估框架

Sijing Wu, Yunhao Li, Zhilin Gao, Huiyu Duan, Yucheng Zhu, Guangtao Zhai, Patrick Le Callet

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) USC-SJTU Institute of Cultural and Creative Industry, Shanghai Jiao Tong University(上海交通大学 USC-文化创意产业学院) Institut Universitaire de France (IUF)(法国大学研究院) University of Nantes(南特大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文构建首个音频驱动三维面部动画人类偏好数据集FMPair,提出FMReward奖励模型与FMFL微调算法,可更好对齐人类偏好,提升该类动画的感知质量。

Comments Accepted for publication in IEEE TVCG, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15141 2026-08-18 cs.CV 新提交 57%

HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation

HOIMask:面向用于人机交互生成的生成式掩码建模

Yihong Ji, Jinsong Zhang, He Hu, Hongbo Xu

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Fuzhou University(福州大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 HOIMask作为首个用于离散空间HOI运动建模的生成式掩码框架,通过HOI VQ编码、Transformer架构及接触感知重构引导,生成的HOI运动优于现有扩散方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏