arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-01 至 2026-01-01 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4 篇

2501.05710 2026-01-01 cs.CV 79%

EmotiCrafter: Text-to-Emotional-Image Generation based on Valence-Arousal Model

EmotiCrafter:基于愉悦-唤醒模型的文本到情感图像生成

Shengqi Dang, Yi He, Long Ling, Ziqing Qian, Nanxuan Zhao, Nan Cao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Adobe Research(Adobe研究院)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 EmotiCrafter基于Valence-Arousal模型,通过文本提示和情感值生成情感丰富的图像,提升情感表达的准确性和可控性。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23361 2026-01-01 cs.CV 72%

OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions

OmniVCus: 基于多模态控制条件的前馈主体驱动视频定制

Yuanhao Cai, He Zhang, Xi Chen, Jinbo Xing, Yiwei Hu, Yuqian Zhou, Kai Zhang, Zhifei Zhang, Soo Ye Kim, Tianyu Wang, Yulun Zhang, Xiaokang Yang, Zhe Lin, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract,comments);image editing(abstract);分类 cs.CV

AI总结 OmniVCus通过多模态控制条件和改进的嵌入机制实现高效的多主体视频定制。

Comments NeurIPS 2025; A data construction pipeline and a diffusion Transformer framework for controllable subject-driven video customization

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25075 2026-01-01 cs.CV cs.AI cs.RO 57%

SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time

SpaceTimePilot: 动态场景在时空上的生成渲染

Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y. Wang, Joan Lasenby, Chun-Hao Huang

机构 * University of Cambridge(剑桥大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SpaceTimePilot通过解耦空间和时间实现动态场景的可控生成渲染,结合时序扭曲训练和CamxTime数据集提升时间控制精度。

Comments Project page: https://zheninghuang.github.io/Space-Time-Pilot/ Code: https://github.com/ZheningHuang/spacetimepilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03119 2026-01-01 cs.CV 57%

Controllable Human-centric Keyframe Interpolation with Generative Prior

可控的人本关键帧插值与生成先验

Zujin Guo, Size Wu, Zhongang Cai, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PoseFuse3D-KI框架,通过整合3D人体指导信号提升关键帧插值的可控性和保真度,实验表明其在PSNR和LPIPS指标上均优于现有方法。

Comments Project Page: https://gseancdat.github.io/projects/PoseFuse3D_KI

详情

展开后加载摘要…

URL PDF HTML 收藏