arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-15 至 2025-12-15 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2512.11720 2025-12-15 cs.CV 83%

Reframing Music-Driven 2D Dance Pose Generation as Multi-Channel Image Generation

将音乐驱动的2D舞蹈姿态生成重新框架化为多通道图像生成

Yan Zhang, Han Zou, Lincong Feng, Cong Xie, Ruiqi Yu, Zhenpeng Zhan

机构 * Global Business Unit, Baidu Inc(百度公司全球业务部)

专题命中 可控生成 :image generation(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 将音乐驱动的2D舞蹈姿态生成重新框架化为多通道图像生成,通过时间共享索引和参考姿态条件策略提升生成质量与一致性

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00996 2025-12-15 cs.CV 79%

Temporal In-Context Fine-Tuning with Temporal Reasoning for Versatile Control of Video Diffusion Models

具有时间推理的上下文微调用于视频扩散模型的多功能控制

Kinam Kim, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究中心)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 TIC-FT通过时间推理实现视频扩散模型的多功能控制,无需架构修改,仅需少量样本即可实现高质量视频生成。

Comments project page: https://kinam0252.github.io/TIC-FT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06215 2025-12-15 cs.CV 70%

Fine-grained Defocus Blur Control for Generative Image Models

细粒度模糊模糊控制用于生成图像模型

Ayush Shrivastava, Connelly Barnes, Xuaner Zhang, Lingzhi Zhang, Andrew Owens, Sohrab Amirghodsi, Eli Shechtman

机构 * University of Michigan(密歇根大学) Adobe Research(Adobe研究)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于EXIF数据的文本到图像扩散模型,通过生成可控的镜头模糊效果,实现细粒度的模糊控制,提升图像生成的可控性与真实性。

Comments Project link: https://www.ayshrv.com/defocus-blur-gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11645 2025-12-15 cs.CV 57%

FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint

FactorPortrait: 通过解耦的表情、姿态和视角实现可控的肖像动画

Jiapeng Tang, Kai Li, Chengxiang Yin, Liuhao Ge, Fei Jiang, Jiu Xu, Matthias Nießner, Christian Häne, Timur Bagautdinov, Egor Zakharov, Peihong Guo

机构 * Meta Reality Labs(Meta现实实验室) Technical University of Munich(慕尼黑技术大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FactorPortrait通过解耦表情、姿态和视角实现可控肖像动画,利用预训练编码器和3D网格跟踪生成逼真动态效果。

Comments Project page: https://tangjiapeng.github.io/FactorPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09585 2025-12-15 cs.SD cs.MM 57%

Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation

视频中的音乐:语义、时间与节奏对齐用于视频到音乐生成

Xinyi Tong, Yiran Zhu, Jishang Chen, Chunru Zhan, Tianle Wang, Sirui Zhang, Nian Liu, Tiezheng Ge, Duo Xu, Xin Jin, Feng Yu, Song-Chun Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

AI总结 VeM通过语义、时间和节奏对齐,生成高质量视频到音乐,提升视听沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05029 2025-12-15 cs.CV 57%

Estimating Object Physical Properties from RGB-D Vision and Depth Robot Sensors Using Deep Learning

基于RGB-D视觉和深度机器人传感器利用深度学习估计物体物理特性

Ricardo Cardoso, Plinio Moreno

机构 * Ricardo Pedreiras Cardoso Plinio Moreno

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出结合深度图像和RGB图像的数据,利用深度学习方法估计物体质量,通过合成数据集提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏