arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-09-30 至 2025-09-30 共收录 13 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2509.23760 2025-09-30 cs.CV 85%

UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception

Xinyang Song, Libin Wang, Weining Wang, Shaozhen Liu, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * Ant Group(蚂蚁集团)

专题命中 可控生成 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22720 2025-09-30 cs.CV cs.AI cs.LG 83%

LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning

Zezhong Fan, Xiaohan Li, Luyi Ma, Kai Zhao, Liang Peng, Topojoy Biswas, Evren Korpeoglu, Kaushiki Nag, Kannan Achan

机构 * Personalization Team, Walmart Global Tech(Walmart全球科技个性化团队)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments NeurIPS 2025 Workshop on SPACE in Vision, Language, and Embodied AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24652 2025-09-30 cs.CV 70%

Learning Object-Centric Representations Based on Slots in Real World Scenarios

Adil Kaan Akan

机构 * Computer Science and Engineering(计算机科学与工程)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments PhD Thesis, overlap with arXiv:2507.20855 and arXiv:2501.15878

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24288 2025-09-30 cs.CV 70%

ASIA: Adaptive 3D Segmentation using Few Image Annotations

Sai Raj Kishore Perla, Aditya Vora, Sauradip Nag, Ali Mahdavi-Amiri, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments SIGGRAPH Asia, 2025. Project Page: https://sairajk.github.io/asia/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08366 2025-09-30 cs.GR cs.CV 62%

In-2-4D: Inbetweening from Two Single-View Images to 4D Generation

Sauradip Nag, Daniel Cohen-Or, Hao Zhang, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH ASIA 2025; Project page at https://in-2-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24823 2025-09-30 cs.CR cs.AI cs.CV cs.LG 57%

Of-SemWat: High-payload text embedding for semantic watermarking of AI-generated images with arbitrary size

Benedetta Tondi, Andrea Costanzo, Mauro Barni

机构 * University of Siena(锡耶纳大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23911 2025-09-30 cs.CV 57%

MoReact: Generating Reactive Motion from Textual Descriptions

Xiyan Xu, Sirui Xu, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23736 2025-09-30 cs.CV cs.AI 57%

HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation

Cong Chen, Ziyuan Huang, Cheng Zou, Muzhi Zhu, Kaixiang Ji, Jiajia Liu, Jingdong Chen, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University of Technology(浙江工业大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23708 2025-09-30 cs.CV cs.AI 57%

CrimEdit: Controllable Editing for Counterfactual Object Removal, Insertion, and Movement

Boseong Jeon, Junghyuk Lee, Jimin Park, Kwanyoung Kim, Jingi Jung, Sangwon Lee, Hyunbo Shim

机构 * Samsung Research(三星研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12341 2025-09-30 cs.CV cs.AI 57%

Semantic Discrepancy-aware Detector for Image Forgery Identification

Ziye Wang, Minghang Yu, Chunyan Xu, Zhen Cui

机构 * Nanjing University of Science and Technology(南京理工大学) Beijing Normal University(北京师范大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13838 2025-09-30 eess.SP cs.CV cs.IT eess.IV math.IT 57%

Generative Video Semantic Communication via Multimodal Semantic Fusion with Large Model

Hang Yin, Li Qiao, Yu Ma, Shuo Sun, Kan Li, Zhen Gao, Dusit Niyato

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23837 2025-09-30 eess.SY cs.SY 50%

Toward a Robust Biomimetic Hybrid Battery: Bridging Biology, Electrochemistry and Data-Driven Control

Raheel Ali, Rayid Ali

专题命中 可控生成 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23590 2025-09-30 eess.IV eess.SP 50%

Foundation Model-Based Adaptive Semantic Image Transmission for Dynamic Wireless Environments

Fangyu Liu, Peiwen Jiang, Wenjin Wang, Chao-Kai Wen, Shi Jin, Jun Zhang

专题命中 可控生成 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏