arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-08-12 至 2025-08-12 共收录 108 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2505.23186 2025-08-12 cs.CV 79%

HiGarment: Cross-modal Harmony Based Diffusion Model for Flat Sketch to Realistic Garment Image

Junyi Guo, Jingxuan Zhang, Fangyu Wu, Huanda Lu, Qiufeng Wang, Wenmian Yang, Eng Gee Lim, Dongming Lu

机构 * Xi’an Jiaotong Liverpool University(西安交通大学利物浦大学) NingboTech University(宁波科技学院) Beijing Normal University(北京师范大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07135 2025-08-12 cs.HC 78%

Canvas3D: Empowering Precise Spatial Control for Image Generation with Constraints from a 3D Virtual Canvas

Runlin Duan, Yuzhao Chen, Rahul Jain, Yichen Hu, Jingyu Shi, Karthik Ramani

专题命中 可控生成 :image generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06551 2025-08-12 cs.CV 70%

Slice or the Whole Pie? Utility Control for AI Models

Ye Tao

机构 * Ye Tao

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08086 2025-08-12 cs.CV cs.GR 62%

Matrix-3D: Omnidirectional Explorable 3D World Generation

Zhongqi Yang, Wenhang Ge, Yuqi Li, Jiaqi Chen, Haoyuan Li, Mengyin An, Fei Kang, Hua Xue, Baixin Xu, Yuyang Yin, Eric Li, Yang Liu, Yikai Wang, Hao-Xiang Guo, Yahui Zhou

机构 * Skywork AI Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16868 2025-08-12 cs.IT cs.AI cs.CV math.IT 57%

Codebook-enabled Generative End-to-end Semantic Communication Powered by Transformer

Peigen Ye, Yaping Sun, Shumin Yao, Hao Chen, Xiaodong Xu, Shuguang Cui

机构 * The Shenzhen Campus of Sun Yat-sen University, Sun Yat-sen University, Shenzhen, China(中山大学深圳校区,中山大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) SSE, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学深圳校区,香港中文大学,深圳,中国) Beijing University of Posts(北京邮电大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments IEEE INFOCOM PerAI6G 2024(accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 1 篇

2508.07811 2025-08-12 cs.CV 79%

DiTVR: Zero-Shot Diffusion Transformer for Video Restoration

Sicheng Gao, Nancy Mehta, Zongwei Wu, Radu Timofte

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 6 篇

2508.07603 2025-08-12 cs.CV 79%

LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation

Wenhui Song, Hanhui Li, Jiehui Huang, Panwen Hu, Yuhao Cheng, Long Chen, Yiqiang Yan, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hong Kong University of Science and Technology(香港科学与技术大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) Lenovo Research(联想研究)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05148 2025-08-12 cs.CV cs.AI cs.LG 79%

LoRA.rar: Learning to Merge LoRAs via Hypernetworks for Subject-Style Conditioned Image Generation

Donald Shenaj, Ondrej Bohdal, Mete Ozay, Pietro Zanuttigh, Umberto Michieli

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://donaldssh.github.io/LoRA.rar

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08220 2025-08-12 cs.CV 74%

Learning User Preferences for Image Generation Model

Wenyi Mo, Ying Ba, Tianyu Zhang, Yalong Bai, Biye Li

专题命中 个性化与一致性 :image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08248 2025-08-12 cs.CV 57%

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Shuyuan Tu, Yueming Pan, Yinming Huang, Xintong Han, Zhen Xing, Qi Dai, Chong Luo, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Hunyuan, Tencent Inc.(腾讯 Hunyuan 实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07298 2025-08-12 cs.CV 57%

SynMatch: Rethinking Consistency in Medical Image Segmentation with Sparse Annotations

Zhiqiang Shen, Peng Cao, Xiaoli Liu, Jinzhu Yang, Osmar R. Zaiane

专题命中 个性化与一致性 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15173 2025-08-12 cs.IR cs.AI cs.ET 50%

Recommendation with Generative Models

Yashar Deldjoo, Zhankui He, Julian McAuley, Anton Korikov, Scott Sanner, Arnau Ramisa, Rene Vidal, Maheswaran Sathiamoorthy, Atoosa Kasrizadeh, Silvia Milano, Francesco Ricci

专题命中 个性化与一致性 :image generation(abstract)

Comments This submission is a full-length book, expanding significantly on two chapters previously submitted (arXiv:2409.10993v1, arXiv:2408.10946v1). It includes additional chapters, context, analysis, and content, providing a comprehensive presentation of the subject. We have ensured it is appropriately presented as a new, distinct work. arXiv admin note: substantial text overlap with arXiv:2409.10993

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2412.17632 2025-08-12 cs.AI cs.CV cs.MM 62%

D-Judge: How Far Are We? Assessing the Discrepancies Between AI-synthesized and Natural Images through Multimodal Guidance

Renyang Liu, Ziyu Lyu, Wei Zhou, See-Kiong Ng

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学信息科学与技术学院(深圳校区)) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of Modern Engineering and the Engineering Research Center of Cyberspace, Yunnan University(云南大学现代工程学院及空天信息工程研究中心)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07905 2025-08-12 cs.CV 57%

Generative Video Matting

Yongtao Ge, Kangyang Xie, Guangkai Xu, Mingyu Liu, Li Ke, Longtao Huang, Hui Xue, Hao Chen, Chunhua Shen

机构 * The University of Adelaide(阿德莱德大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

Journal ref SIGGRAPH Conference Papers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2407.20756 2025-08-12 cs.CV cs.CL 57%

SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models

Zheng Liu, Hao Liang, Bozhou Li, Wentao Xiong, Chong Chen, Conghui He, Wentao Zhang, Bin Cui

机构 * Peking University Beijing China Huawei Technologies Ltd. Beijing China Shanghai AI Laboratory Shanghai China Peking University Center for Machine Learning Research Beijing China Peking University School of Computer Science \& Key Lab of High Confidence Software Technologies (MOE) Beijing China Peking University Huawei Technologies Ltd. Shanghai AI Laboratory

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06833 2025-08-12 nlin.PS cs.NA math.NA 50%

Efficient data-driven regression for reduced-order modeling of spatial pattern formation

Alessandro Alla, Rudy Geelen, Hannah Lu

专题命中 效率与蒸馏 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 2 篇

2508.07755 2025-08-12 cs.CV 79%

Comparison Reveals Commonality: Customized Image Generation through Contrastive Inversion

Minseo Kim, Minchan Kwon, Dongyeun Lee, Yunho Jeon, Junmo Kim

机构 * Korea Institute of Science and Technology(韩国科学技术院) Hanbat National University(汉拔国立大学)

专题命中 其他图像生成 :image generation(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2025 workshop (AI4CC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07031 2025-08-12 eess.IV cs.AI cs.CV 57%

Trustworthy Medical Imaging with Large Language Models: A Study of Hallucinations Across Modalities

Anindya Bijoy Das, Shahnewaz Karim Sakib, Shibbir Ahmed

机构 * The University of Akron(阿克隆大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校) Texas State University(德克萨斯州立大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏