arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3489 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3489 篇

2509.22635 2025-09-29 cs.CV cs.LG 70%

Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance

Luc Boudier, Loris Manganelli, Eleftherios Tsonis, Nicolas Dufour, Vicky Kalogeiton

机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等师范学院,IP巴黎,法国国家科学研究中心) LIGM École des Ponts, IP Paris, CNRS, UGE DIPSY(LIGM 巴黎综合理工学院,IP巴黎,法国国家科学研究中心,UGE DIPSY)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments BMVC 2025. Project page: https://www.lix.polytechnique.fr/vista/projects/2025_bmvc_dipsy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21995 2025-09-29 cs.CV 70%

FailureAtlas:Mapping the Failure Landscape of T2I Models via Active Exploration

Muxi Chen, Zhaohua Zhang, Chenchen Zhao, Mingyang Chen, Wenyu Jiang, Tianwen Jiang, Jianhuan Zhuo, Yu Tang, Qiuyong Xiao, Jihong Zhang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯) Nanjing University(南京大学) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15270 2025-09-22 cs.CV cs.AI 70%

PRISM: Phase-enhanced Radial-based Image Signature Mapping framework for fingerprinting AI-generated images

Emanuele Ricco, Elia Onofri, Lorenzo Cima, Stefano Cresci, Roberto Di Pietro

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16174 2025-09-19 cs.CV 70%

Erased or Dormant? Rethinking Concept Erasure Through Reversibility

Ping Liu, Chi Zhang

机构 * Department of Computer Science University of Nevada Reno(计算机科学系内华达大学拉斯维加斯分校) Department of Mathematics National University of Singapore(数学系新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Dr. Chi Zhang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06130 2025-09-11 cs.CV cs.CL 70%

Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models

Ce Zhang, Zifu Wan, Zhehan Kan, Martin Q. Ma, Simon Stepputtis, Deva Ramanan, Russ Salakhutdinov, Louis-Philippe Morency, Katia Sycara, Yaqi Xie

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by ICLR 2025. Project page: https://zhangce01.github.io/DeGF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21254 2025-09-01 cs.CV 70%

Reverse Imaging for Wide-spectrum Generalization of Cardiac MRI Segmentation

Yidong Zhao, Peter Kellman, Hui Xue, Tongyun Yang, Yi Zhang, Yuchi Han, Orlando Simonetti, Qian Tao

机构 * Department of Imaging Physics, Delft University of Technology, Delft, The Netherlands(影像物理系,代尔夫特理工大学,代尔夫特,荷兰) National Heart Lung and Blood Institute, National Institutes of Health, Bethesda, Maryland, USA(国家心肺血液研究所,美国国立卫生研究院,贝塞斯达,马里兰州,美国) Microsoft Research(微软研究院) Cardiovascular Division, The Ohio State University Wexner Medical Center, Columbus, Ohio, USA(心血管科,俄亥俄州立大学韦克斯纳医学中心,哥伦布,俄亥俄州,美国)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20881 2025-08-29 cs.CV 70%

Understanding and evaluating computer vision models through the lens of counterfactuals

Pushkar Shukla

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12698 2025-08-26 eess.IV cs.CV 70%

Pixel Perfect MegaMed: A Megapixel-Scale Vision-Language Foundation Model for Generating High Resolution Medical Images

Zahra TehraniNasab, Hujun Ni, Amar Kumar, Tal Arbel

机构 * McGill University(麦吉尔大学) MILA-Quebec AI Institute(魁北克AI研究所)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15774 2025-08-22 cs.CV 70%

CineScale: Free Lunch in High-Resolution Cinematic Visual Generation

Haonan Qiu, Ning Yu, Ziqi Huang, Paul Debevec, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) Netflix Eyeline Studios

专题命中 文生图 :image generation(abstract);diffusion(abstract);分类 cs.CV

Comments CineScale is an extended work of FreeScale (ICCV 2025). Project Page: https://eyeline-labs.github.io/CineScale/, Code Repo: https://github.com/Eyeline-Labs/CineScale

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21839 2025-08-12 cs.CV cs.CL 70%

GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles

Mengyi Shan, Brian Curless, Ira Kemelmacher-Shlizerman, Steve Seitz

机构 * University of Washington(华盛顿大学)

专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03535 2025-08-06 cs.CV 70%

CoEmoGen: Towards Semantically-Coherent and Scalable Emotional Image Content Generation

Kaishen Yuan, Yuting Zhang, Shang Gao, Yijie Zhu, Wenshuo Chen, Yutao Yue

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23010 2025-08-01 cs.LG cs.AI cs.CV cs.SD eess.AS 70%

Investigating the Invertibility of Multimodal Latent Spaces: Limitations of Optimization-Based Methods

Siwoo Park

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22617 2025-07-31 cs.CR cs.CV 70%

Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions

Yiting Qu, Ziqing Yang, Yihan Ma, Michael Backes, Savvas Zannettou, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心) TU Delft(代尔夫特理工大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20782 2025-07-29 cs.CV cs.AI 70%

Investigation of Accuracy and Bias in Face Recognition Trained with Synthetic Data

Pavel Korshunov, Ketan Kotwal, Christophe Ecabert, Vidit Vidit, Amir Mohammadi, Sebastien Marcel

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted for publication in IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08789 2025-07-29 cs.CV 70%

Generative AI in Agriculture: Creating Image Datasets Using DALL.E's Advanced Large Language Model Capabilities

Ranjan Sapkota, Manoj Karkee

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08629 2025-07-23 cs.CV cs.LG 70%

FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models

Vladimir Kulikov, Matan Kleiner, Inbar Huberman-Spiegelglas, Tomer Michaeli

机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICCV 2025. Project's webpage at https://matankleiner.github.io/flowedit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08622 2025-07-22 cs.AI cs.CL cs.CV 70%

Visually Guided Decoding: Gradient-Free Hard Prompt Inversion with Language Models

Donghoon Kim, Minji Bae, Kyuhong Shim, Byonghyo Shim

机构 * Seoul National University(首尔国立大学) Sungkyunkwan University(庆熙大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICLR 2025 (Official Code: https://github.com/DonghoonKim-1938/VGD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12431 2025-07-22 cs.CV cs.AI 70%

FlexiTex: Enhancing Texture Generation via Visual Guidance

DaDong Jiang, Xianghui Yang, Zibo Zhao, Sheng Zhang, Jiaao Yu, Zeqiang Lai, Shaoxiong Yang, Chunchao Guo, Xiaobo Zhou, Zhihui Ke

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2025, Project Page: https://patrickddj.github.io/FlexiTex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13739 2025-07-21 cs.CV cs.AI 70%

Can Synthetic Images Conquer Forgetting? Beyond Unexplored Doubts in Few-Shot Class-Incremental Learning

Junsu Kim, Yunhoe Ku, Seungryul Baek

机构 * UNIST(全南国立科学技术大学) DeepBrain AI NVIDIA Foundation Models LAB, MODULABS(NVIDIA基础模型实验室,MODULABS)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 6th CLVISION ICCV Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04106 2025-07-18 cs.CV cs.AI 70%

MRGen: Segmentation Data Engine for Underrepresented MRI Modalities

Haoning Wu, Ziheng Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by ICCV 2025; Project Page: https://haoningwu3639.github.io/MRGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12236 2025-07-17 cs.CV 70%

Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models

Felix Nützel, Mischa Dombrowski, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗赖堡-亚历山大大学埃尔兰根-纽伦堡) Imperial College London(伦敦帝国理工学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 20 pages, 6 figures. To appear in Proc. MIDL 2025 (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10855 2025-07-16 cs.CV 70%

Sparse Fine-Tuning of Transformers for Generative Tasks

Wei Chen, Jingxi Yu, Zichen Miao, Qiang Qiu

专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments Accepted by International Conference on Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08039 2025-07-14 cs.CV cs.AI cs.LG 70%

Towards Evaluating Robustness of Prompt Adherence in Text to Image Models

Sujith Vemishetty, Advitiya Arora, Anupama Sharma

机构 * Synechron

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04218 2025-07-08 cs.CV 70%

DreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design

Xiwei Hu, Haokun Chen, Zhongqi Qi, Hui Zhang, Dexiang Hong, Jie Shao, Xinglong Wu

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室) Fudan University(复旦大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09721 2025-07-08 cs.LG cs.CV 70%

Finetuning CLIP to Reason about Pairwise Differences

Dylan Sam, Devin Willmott, Joao D. Semedo, J. Zico Kolter

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20672 2025-07-03 cs.CV 70%

BizGen: Advancing Article-level Visual Text Rendering for Infographics Generation

Yuyang Peng, Shishi Xiao, Keming Wu, Qisheng Liao, Bohan Chen, Kevin Lin, Danqing Huang, Ji Li, Yuhui Yuan

机构 * Tsinghua University(清华大学) Brown University(布朗大学) University of Liverpool(利物浦大学) Microsoft Research Asia(微软亚洲研究院) Microsoft(微软公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by CVPR 2025. Project Page: https://bizgen-msra.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17726 2025-06-26 cs.CV cs.CL 70%

VICCA: Visual Interpretation and Comprehension of Chest X-ray Anomalies in Generated Report Without Human Feedback

Sayeh Gholipour Picha, Dawood Al Chanti, Alice Caplier

机构 * Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔研究所) GIPSA-lab(GIPSA实验室)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Journal ref Machine Learning with Applications, Volume 21, 2025, 100684, ISSN 2666-8270

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10575 2025-06-13 cs.CV 70%

Text to Image for Multi-Label Image Recognition with Joint Prompt-Adapter Learning

Chun-Mei Feng, Kai Yu, Xinxing Xu, Salman Khan, Rick Siow Mong Goh, Wangmeng Zuo, Yong Liu

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局) University of Minnesota(明尼苏达大学) Microsoft Research Asia Singapore(微软亚洲研究院新加坡分部) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) Australian National University(澳大利亚国立大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Journal ref TPAMI-2024-04-1021

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04606 2025-06-12 cs.CV 70%

Enhancing Low-Cost Video Editing with Lightweight Adaptors and Temporal-Aware Inversion

Yangfan He, Sida Li, Jianhui Wang, Kun Li, Xinyuan Song, Xinhang Yuan, Keqin Li, Kuan Lu, Menghao Huo, Jingqun Tang, Yi Xin, Jiaqi Chen, Miao Zhang, Xueqian Wang

机构 * University of Minnesota—Twin Cities(明尼苏达大学-双城分校) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) Xiamen University(厦门大学) Emory University(埃默里大学) Washington University, Saint Louis(圣路易斯华盛顿大学) Cornell University(康奈尔大学) Nanjing University(南京大学) Santa Clara University(圣克拉拉大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05843 2025-06-09 cs.CV 70%

FontAdapter: Instant Font Adaptation in Visual Text Generation

Myungkyu Koo, Subin Kim, Sangkyung Kwak, Jaehyun Nam, Seojin Kim, Jinwoo Shin

机构 * KAIST(韩国科学技术院) General Robotics(通用机器人) Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project page: https://fontadapter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏