arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4228 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4228 篇

2604.04406 2026-04-07 cs.CV 57%

3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image

3D-Fixer:从单张图像生成3D场景的粗到细就地补全

Ze-Xin Yin, Liu Liu, Xinjie Wang, Wei Sui, Zhizhong Su, Jian Yang, Jin Xie

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Horizon Robotics(地平线机器人) D-Robotics

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出3D-Fixer,通过粗到细的生成方案解决单张图像生成3D场景的布局和3D资产恢复问题,结合双分支条件网络和Occlusion-Robust Feature Alignment策略,提升生成精度和效率,同时引入ARSG-110K数据集提升训练效果。

Comments 17 pages, 10 figures, CVPR 2026, project page: https://zx-yin.github.io/3dfixer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01554 2026-04-07 cs.LG cs.AI cs.CV 57%

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18716 2026-04-07 cs.CV 57%

SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation

SketchDeco:无需训练的潜在空间构图用于精确草图着色

Chaitat Utintu, Yi-Zhe Song

机构 * SketchX, CVSSP, University of Surrey(萨里大学CVSSP实验室SketchX团队)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchDeco通过无需训练的潜在空间构图方法,实现精确草图着色,结合专业设计需求与直观区域控制,利用简单掩码和颜色调色板实现空间和色彩精确指定,无需手动分配或文本提示模糊性。

Comments Accepted in CVPR 2026. Project page available at https://chaitron.github.io/SketchDeco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03315 2026-04-07 cs.CV cs.AI 57%

StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics

StoryBlender: 具有时空动态的跨镜头一致且可编辑的3D分镜

Bingliang Li, Zhenhong Sun, Jiaming Bian, Yuehao Wu, Yifu Wang, Hongdong Li, Yatao Bian, Huadong Mo, Daoyi Dong

机构 * Independent Researcher(独立研究员) Australia National University(澳大利亚国立大学) Central South University(中南大学) University of New South Wales(新南威尔士大学) Vertex Lab(Vertex实验室) National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 StoryBlender通过三阶段流程实现跨镜头一致性和可编辑性,结合语义空间接地、资产材料化和时空动态,提升3D分镜生成的连续性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03305 2026-04-07 cs.CV 57%

HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

HVG-3D: 联接真实与仿真领域用于3D条件手-物体交互视频合成

Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen Cui, Lap-Pui Chau, Yi Wang

机构 * Dept. of EEE, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院虚拟现实技术与系统国家重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HVG-3D提出一种统一框架,通过显式3D表示条件生成3D-aware手-物体交互视频,结合3D ControlNet与扩散架构,实现高保真度与时空可控性。

Comments Project page: https://hvg3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02828 2026-04-06 cs.CV cs.AI 57%

NavCrafter: Exploring 3D Scenes from a Single Image

NavCrafter:从单张图像探索3D场景

Hongbo Duan, Peiyu Zhuang, Yi Liu, Zhengyang Zhang, Yuxin Zhang, Pengting Luo, Fangming Liu, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院人工智能与机器人中心) Peng Cheng Laboratory(鹏城实验室) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Central Media Technology Institute, Huawei Incorporated Company(华为技术有限公司中央媒体技术研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 NavCrafter通过合成新颖视角视频序列,实现从单张图像生成灵活的3D场景,采用视频扩散模型和几何感知扩展策略,提升可控多视角合成与3D重建精度。

Comments 8 pages accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02799 2026-04-06 cs.CV 57%

UNICA: A Unified Neural Framework for Controllable 3D Avatars

UNICA:一种统一的神经框架用于可控的3D人形 avatars

Jiahe Zhu, Xinyao Wang, Yiyu Zhuang, Yanwen Wang, Jing Tian, Yao Yao, Hao Zhu

机构 * Nanjing University(南京大学) State Key Laboratory of Novel Software Technology(计算机软件新技术国家重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UNICA通过动作条件扩散模型和点转换器生成可控的3D人形,实现无需骨骼的统一生成框架,支持自由视角渲染和动态衣物处理。

Comments Opensource code: https://github.com/zjh21/UNICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01765 2026-04-06 cs.CV 57%

Efficient Test-Time Optimization for Depth Completion via Low-Rank Decoder Adaptation

通过低秩解码器适应实现高效的深度完成测试时优化

Minseok Seo, Wonjun Lee, Jaehyuk Jang, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种轻量级测试时适应方法,通过更新低维子空间实现高效零样本深度完成,提升准确率与效率的平衡。

Comments 17 pages, 7 figures [We achieved a new Pareto frontier in test-time depth completion.]

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19454 2026-04-06 cs.RO cs.AI cs.CV cs.LG 57%

ROPA: Synthetic Robot Pose Generation for RGB-D Bimanual Data Augmentation

ROPA: 合成机器人姿态生成用于RGB-D双臂数据增强

Jason Chen, I-Chun Arthur Liu, Gaurav Sukhatme, Daniel Seita

机构 * University of Southern California(南加州大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ROPA,通过微调Stable Diffusion生成RGB-D双臂任务的合成数据,提升机器人双臂操控的鲁棒性与数据增强效率。

Comments Accepted to the International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02222 2026-04-03 cs.CV 57%

SCALE: Semantic- and Confidence-Aware Conditional Variational Autoencoder for Zero-shot Skeleton-based Action Recognition

SCALE:语义和置信度感知的条件变分自编码器用于零样本骨骼动作识别

Soroush Oraki, Feng Ding, Jie Liang

机构 * School of Engineering Science, Simon Fraser University(西蒙菲莎大学工程科学学院) School of Information Science and Technology, Eastern Institute of Technology(东方理工信息科学与技术学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SCALE通过语义和置信度感知的条件变分自编码器,解决零样本骨骼动作识别中的语义混淆和细粒度动态问题,提升未见过类的识别性能。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14674 2026-04-03 cs.CV cs.LG 57%

LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

LaVR:基于大规模4D重建模型的场景潜在条件生成视频轨迹重绘

Mingyang Xie, Numair Khan, Tianfu Wang, Naina Dhingra, Seonghyeon Nam, Haitao Yang, Zhuo Hui, Christopher Metzler, Andrea Vedaldi, Hamed Pirsiavash, Lei Luo

机构 * Meta University of Maryland(马里兰大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LaVR模型,通过利用大规模4D重建模型的潜在空间中的隐式几何知识,解决视频重绘中几何未条件化模型的空间感知不足和几何条件化模型对深度不准确的依赖问题,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06499 2026-04-03 cs.CV cs.AI 57%

ExGes: Expressive Human Motion Retrieval and Modulation for Audio-Driven Gesture Synthesis

ExGes:基于音频驱动的 gesture 合成中的 expressive 人类运动检索与调节

Xukun Zhou, Fengxin Li, Ming Chen, Yan Zhou, Pengfei Wan, Di Zhang, Yeying Jin, Zhaoxin Fan, Hongyan Liu, Jun He

机构 * Renmin University(中国人民大学) Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ExGes框架,通过运动库构建、运动检索模块和精度控制模块,提升音频驱动手势合成的表达性和与音频语义的一致性,实验表明其在Fréchet Gesture Distance和运动多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV 57%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08210 2026-04-02 cs.CV 57%

Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA

Video2LoRA:通过每参考视频LoRA实现统一的语义控制视频生成

Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu

机构 * Dalian University of Technology(大连理工大学) HKUST(香港科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Video2LoRA框架,通过轻量级超网络预测个性化LoRA权重,实现灵活高效的语义控制视频生成,模型重量小于150MB,具备良好的零样本泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15031 2026-04-02 cs.CV 57%

EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing

EditCtrl: 解耦的局部和全局控制用于实时生成视频编辑

Yehonathan Litman, Shikun Liu, Dario Seyb, Nicholas Milef, Yang Zhou, Carl Marshall, Shubham Tulsiani, Caleb Leak

机构 * Meta Reality Labs(Meta现实实验室) Carnegie Mellon University(卡内基梅隆大学) Meta AI

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出EditCtrl,通过局部和全局控制模块实现高效视频修复,提升编辑质量和计算效率,支持多区域编辑和内容传播。

Comments Project page: https://yehonathanlitman.github.io/edit_ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02226 2026-04-02 cs.CV cs.AI cs.LG 57%

TempoControl: Temporal Attention Guidance for Text-to-Video Models

TempoControl: 文本到视频模型中的时间注意力引导

Shira Schiber, Ofir Lindenbaum, Idan Schwartz

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TempoControl,通过新颖的优化方法实现文本到视频模型的时间对齐,无需重新训练,支持时间重排、动作时机控制和音频对齐等应用。

Comments Accepted CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29570 2026-04-01 cs.CV cs.AI 57%

Generating Key Postures of Bharatanatyam Adavus with Pose Estimation

通过姿态估计生成巴赫提亚姆阿达夫的关键姿态

Jagadish Kashinath Kamble, Jayanta Mukhopadhyay, Debaditya Roy, Partha Pratim Das

机构 * Indian Institute of Technology(印度理工学院) Ashoka University(阿育王大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种结合姿态估计模块的生成框架,通过关键点损失和姿态一致性约束,提升巴赫提亚姆阿达夫关键姿态的生成精度与文化真实性。

Comments Published in ICVGIP, 2025

Journal ref In Proceedings of the Indian Conference on Computer Vision, Graphics and Image Processing (ICVGIP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28605 2026-03-31 cs.CV cs.CY cs.LG 57%

Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

Unsafe2Safe: 可控图像匿名化以保障下游效用

Mih Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Unsafe2Safe通过多模态引导的扩散编辑实现图像隐私保护,减少敏感信息并保持下游任务性能。

Comments Accepted at CVPR 2026 and CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27915 2026-03-31 cs.CV 57%

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

FlashSign:无需姿态的高效手语视频生成

Liuzhou Zhang, Zeyu Zhang, Biao Wu, Luyao Tang, Zirui Song, Hongyang He, Renda Han, Guangzhen Yao, Huacan Wang, Ronghao Chen, Xiuying Chen, Guan Huang, Zheng Zhu

机构 * HUST(华中科技大学) GigaAI UTS(悉尼科技大学) HKU(香港大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Warwick(华威大学) TJU(天津大学) NNU(南京师范大学) UCAS(中国科学院大学) UTHealth Houston(德克萨斯大学休斯顿健康科学中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出无需姿态表示的高效手语视频生成框架,通过扩散模型直接映射自然语言文本到手语视频,引入可训练滑动瓷砖注意力机制提升推理效率,实现3.07倍的生成速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV 57%

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27666 2026-03-31 cs.CV 57%

Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers

门控条件注入无需多模态注意:迈向可控的线性注意变换器

Yuhe Liu, Zhenxiong Tan, Yujia Hu, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于线性注意架构的可控扩散模型,解决现有方法在多类型条件输入灵活性和收敛速度上的不足,通过统一门控条件模块实现高效可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27513 2026-03-31 cs.CV cs.AI 57%

Understanding Semantic Perturbations on In-Processing Generative Image Watermarks

理解生成图像水印在处理过程中的语义扰动

Anirudh Nakra, Min Wu

机构 * University of Maryland, College Park, MD, USA(马里兰大学帕克分校)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 研究探讨了生成图像水印在处理过程中对语义扰动的鲁棒性,提出多阶段框架进行系统压力测试,发现语义编辑会显著降低水印检测能力,揭示当前水印评估存在的关键缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27206 2026-03-31 cs.CV 57%

Make It Up: Fake Images, Real Gains in Generalized Few-shot Semantic Segmentation

让它补上:假图像,真实增益在通用少样本语义分割中

Guohuan Xie, Xin He, Dingying Fan, Le Zhang, Ming-Ming Cheng, Yun Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Syn4Seg框架,通过生成增强方法提升通用少样本语义分割的新型类别覆盖和伪标签质量,实验显示在PASCAL-5i和COCO-20i上实现了1-shot和5-shot设置下的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV 57%

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22054 2026-03-31 cs.CV 57%

FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation

FontCrafter: 基于元素驱动的高保真艺术字体创作与视觉上下文生成

Wuyang Luo, Chengkai Tan, Chang Ge, Binye Hong, Su Yang, Yongjiu Ma

机构 * Dalian University of Technology(大连理工大学) Shanghai Key Laboratory of Intelligent Information Processing, Fudan University(复旦大学上海市智能信息处理重点实验室)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出FontCrafter框架,通过元素驱动方法生成艺术字体,结合上下文生成策略和轻量级CMA模块,实现高保真纹理与结构重建及灵活风格控制。

Comments To appear in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05422 2026-03-31 cs.CV 57%

ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

ParaUni: 通过强化驱动的分层并行信息交互增强统一多模态模型的生成

Jiangtong Tan, Lin Liu, Jie Huanng, Xiaopeng Zhang, Qi Tian, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部类脑智能感知与认知重点实验室) Huawei Inc.(华为技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ParaUni通过并行提取多层视觉语言模型特征并结合强化学习动态调整机制,提升统一多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 57%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25985 2026-03-30 cs.CV 57%

JRM: Joint Reconstruction Model for Multiple Objects without Alignment

JRM:无对齐的多物体联合重建模型

Qirui Wu, Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Richard Newcombe, Angel X. Chang, Jakob Engel, Henry Howard-Jenkins

机构 * Meta Reality Labs Research(Meta现实实验室) Simon Fraser University(西蒙菲莎大学)

专题命中 可控生成 :personalized generation(abstract);分类 cs.CV

AI总结 本文提出JRM模型,通过将物体重建视为个性化生成任务,利用重复信号提升重建质量,无需显式对齐,增强鲁棒性并自然处理非刚性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25892 2026-03-30 cs.CV 57%

THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond

THFM:一种用于4D人体感知及更广泛领域的统一视频基础模型

Letian Wang, Andrei Zanfir, Eduard Gabriel Bazavan, Misha Andriluka, Cristian Sminchisescu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 THFM是一种统一的视频基础模型,能够同时处理密集任务和稀疏任务,其基于预训练的文本到视频扩散模型,并通过可学习的标记增强稀疏预测能力,且在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25728 2026-03-27 cs.CV cs.AI 57%

PixelSmile: Toward Fine-Grained Facial Expression Editing

PixelSmile:迈向细粒度面部表情编辑

Jiabin Hua, Hengyuan Xu, Aojie Li, Wei Cheng, Gang Yu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) StepFun(阶跃星辰)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PixelSmile框架,通过全对称联合训练解耦表情语义,结合强度监督与对比学习实现更清晰可辨的表情生成,提升线性表达控制精度与稳定性,验证了其在连续可控细粒度表情编辑中的有效性。

Comments 21 Pages; Project Page: https://ammmob.github.io/PixelSmile/ Code: https://github.com/Ammmob/PixelSmile

详情

展开后加载摘要…

URL PDF HTML 收藏