arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-10-08 至 2025-10-08 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4 篇

2510.05722 2025-10-08 cs.CV 70%

Data Factory with Minimal Human Effort Using VLMs

Jiaojiao Ye, Jiaxing Zhong, Qian Xie, Yuzhou Zhou, Niki Trigoni, Andrew Markham

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06060 2025-10-08 cs.MM cs.AI cs.CV 62%

Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information

Christian Marinoni, Riccardo Fosco Gramaccioni, Eleonora Grassucci, Danilo Comminiello

机构 * Sapienza University of Rome, Italy(罗马大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05829 2025-10-08 cs.SD cs.CV cs.LG cs.MM eess.AS 62%

FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders

Riccardo Fosco Gramaccioni, Christian Marinoni, Eleonora Grassucci, Giordano Cicchetti, Aurelio Uncini, Danilo Comminiello

机构 * Dept. Information Engineering, Electronics and Telecommunications (DIET), Sapienza University of Rome(信息工程、电子与电信系(DIET),罗马萨皮恩扎大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments Acepted at IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20297 2025-10-08 cs.RO 50%

mindmap: Spatial Memory in Deep Feature Maps for 3D Action Policies

Remo Steiner, Alexander Millane, David Tingdahl, Clemens Volk, Vikram Ramasamy, Xinjie Yao, Peter Du, Soha Pouya, Shiwei Sheng

机构 * NVIDIA(英伟达) Zurich Switzerland(苏黎世瑞士) Santa Clara California(圣克拉拉加州)

专题命中 可控生成 :diffusion(abstract)

Comments Accepted to CoRL 2025 Workshop RemembeRL

详情

展开后加载摘要…

URL PDF HTML 收藏