arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86761 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3489 篇

2504.07089 2025-06-03 cs.CV cs.CL 70%

OmniCaptioner: One Captioner to Rule Them All

Yiting Lu, Jiakang Yuan, Zhen Li, Shitian Zhao, Qi Qin, Xinyue Li, Le Zhuo, Licheng Wen, Dongyang Liu, Yuewen Cao, Xiangchao Yan, Xin Li, Tianshuo Peng, Shufei Zhang, Botian Shi, Tao Chen, Zhibo Chen, Lei Bai, Peng Gao, Bo Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments More visualizations on Homepage: https://alpha-innovator.github.io/OmniCaptioner-project-page and Official code: https://github.com/Alpha-Innovator/OmniCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19398 2025-05-30 cs.CV 70%

Erasing Concepts, Steering Generations: A Comprehensive Survey of Concept Suppression

Yiwei Xie, Ping Liu, Zheng Zhang

机构 * Huazhong University of Science and Technology, China(华中科技大学) University of Nevada, Reno(内华达大学拉斯维加斯分校)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14135 2025-05-29 cs.CV 70%

Hunyuan-Game: Industrial-grade Intelligent Game Creation Model

Ruihuang Li, Caijin Zhou, Shoujian Zheng, Jianxiang Lu, Jiabin Huang, Comi Chen, Junshu Tang, Guangzheng Xu, Jiale Tao, Hongmei Wang, Donghao Li, Wenqing Yu, Senbo Wang, Zhimin Li, Yetshuan Shi, Haoyu Yang, Yukun Wang, Wenxun Dai, Jiaqi Li, Linqing Wang, Qixun Wang, Zhiyong Xu, Yingfang Zhang, Jiangfeng Xiong, Weijie Kong, Chao Zhang, Hongxin Zhang, Qiaoling Zheng, Weiting Guo, Xinchi Deng, Yixuan Li, Renjia Wei, Yulin Jian, Duojun Huang, Xuhua Ren, Junkun Yuan, Zhengguang Zhou, Jiaxiang Cheng, Bing Ma, Shirui Huang, Jiawang Bai, Chao Li, Sihuan Lin, Yifu Sun, Yuan Zhou, Joey Wang, Qin Lin, Tianxiang Zheng, Jingmiao Yu, Jihong Zhang, Caesar Zhong, Di Wang, Yuhong Liu, Linus, Jie Jiang, Longhuang Wu, Shuai Shao, Qinglin Lu

机构 * Tencent(腾讯)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18434 2025-05-27 cs.CV cs.AI 70%

TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP

Yuliang Cai, Jesse Thomason, Mohammad Rostami

机构 * University of Southern California(南加州大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19722 2025-05-20 cs.LG cs.AI cs.CV 70%

JetFormer: An Autoregressive Generative Model of Raw Images and Text

Michael Tschannen, André Susano Pinto, Alexander Kolesnikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ICLR 2025. Code available at https://github.com/google-research/big_vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12322 2025-05-20 cs.LG cs.CV 70%

Model alignment using inter-modal bridges

Ali Gholamzadeh, Noor Sajid

机构 * MPI for Biological Cybernetics & University of Tübingen(生物感知研究所及图宾根大学) Kempner Institute, Harvard University(凯普纳研究所及哈佛大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03859 2025-05-08 cs.CY cs.AI cs.CV 70%

Deepfakes on Demand: the rise of accessible non-consensual deepfake image generators

Will Hawkins, Chris Russell, Brent Mittelstadt

机构 * Oxford Internet Institute(牛津互联网研究所) University of Oxford(牛津大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 13 pages

Journal ref FAccT '25: Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19894 2025-04-29 cs.CV 70%

CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition

Quynh Phung, Long Mai, Fabian David Caba Heilbron, Feng Liu, Jia-Bin Huang, Cusuh Ham

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Adobe Research(Adobe研究院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments link website: https://cinevers.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17804 2025-04-28 cs.CV 70%

Spectral Dictionary Learning for Generative Image Modeling

Andrew Kiruluta

机构 * Department of Computer Science UC Berkeley, CA(计算机科学系加州大学伯克利分校)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01019 2025-04-22 cs.CV cs.AI 70%

MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations

Ziyang Zhang, Yang Yu, Yucheng Chen, Xulei Yang, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) ECE, Northwestern University(电子工程系,西北大学) Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究所(I2R),A*STAR,新加坡) Lee Kong Chian School of Medicine, Nanyang Technological University(Lee Kong Chian医学院,南洋理工大学)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments To be pubilshed in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14216 2025-04-22 cs.CV 70%

DreamDistribution: Learning Prompt Distribution for Diverse In-distribution Generation

Brian Nlong Zhao, Yuhang Xiao, Jiashu Xu, Xinyang Jiang, Yifan Yang, Dongsheng Li, Laurent Itti, Vibhav Vineet, Yunhao Ge

机构 * University of Southern California(南加州大学) Harvard University(哈佛大学) Microsoft Research Asia(微软亚洲研究院) Microsoft Research Redmond(微软红mond研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11520 2025-04-21 cs.CV cs.AI 70%

EditSplat: Multi-View Fusion and Attention-Guided Optimization for View-Consistent 3D Scene Editing with 3D Gaussian Splatting

Dong In Lee, Hyeongcheol Park, Jiyoung Seo, Eunbyung Park, Hyunje Park, Ha Dam Baek, Sangheon Shin, Sangmin Kim, Sangpil Kim

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12018 2025-04-17 cs.CV 70%

Instruction-augmented Multimodal Alignment for Image-Text and Element Matching

Xinli Yue, JianHui Sun, Junda Lu, Liangchao Yao, Fan Xia, Tianyi Wang, Fengyun Rao, Jing Lyu, Yuetang Deng

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to CVPR 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09328 2025-04-15 cs.CV cs.LG 70%

Text To 3D Object Generation For Scalable Room Assembly

Sonia Laguna, Alberto Garcia-Garcia, Marie-Julie Rakotosaona, Stylianos Moschoglou, Leonhard Helminger, Sergio Orts-Escolano

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Published at the ICLR 2025 Workshop on Synthetic Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00990 2025-04-15 cs.CV 70%

VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models

Hong Chen, Xin Wang, Guanning Zeng, Yipeng Zhang, Yuwei Zhou, Feilin Han, Yaofei Wu, Wenwu Zhu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06666 2025-04-10 cs.CV 70%

Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception

Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02879 2025-04-07 cs.GR 70%

Robust AI-Synthesized Image Detection via Multi-feature Frequency-aware Learning

Hongfei Cai, Chi Liu, Sheng Shen, Youyang Qu, Peng Gui

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01916 2025-04-03 cs.CV cs.AI cs.CL 70%

FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs

Mothilal Asokan, Kebin Wu, Fatima Albreiki

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10034 2025-03-31 cs.CV 70%

TULIP: Token-length Upgraded CLIP

Ivona Najdenkoska, Mohammad Mahdi Derakhshani, Yuki M. Asano, Nanne van Noord, Marcel Worring, Cees G. M. Snoek

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19373 2025-03-26 cs.CV cs.AI 70%

DeClotH: Decomposable 3D Cloth and Human Body Reconstruction from a Single Image

Hyeongjin Nam, Donghwan Kim, Jeongtaek Oh, Kyoung Mu Lee

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Published at CVPR 2025, 17 pages including the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19011 2025-03-26 cs.CV 70%

RomanTex: Decoupling 3D-aware Rotary Positional Embedded Multi-Attention Network for Texture Synthesis

Yifei Feng, Mingxin Yang, Shuhui Yang, Sheng Zhang, Jiaao Yu, Zibo Zhao, Yuhong Liu, Jie Jiang, Chunchao Guo

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18948 2025-03-25 cs.CV 70%

Equivariant Image Modeling

Ruixiao Dong, Mengde Xu, Zigang Geng, Li Li, Han Hu, Shuyang Gu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16394 2025-03-21 cs.CV cs.AI cs.CL cs.RO 70%

Do Visual Imaginations Improve Vision-and-Language Navigation Agents?

Akhil Perincherry, Jacob Krantz, Stefan Lee

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17592 2025-03-20 cs.CV 70%

VideoDirector: Precise Video Editing via Text-to-Video Models

Yukun Wang, Longguang Wang, Zhiyuan Ma, Qibin Hu, Kai Xu, Yulan Guo

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07658 2025-03-18 cs.CV cs.AI cs.LG 70%

TraSCE: Trajectory Steering for Concept Erasure

Anubhav Jain, Yuya Kobayashi, Takashi Shibuya, Yuhta Takida, Nasir Memon, Julian Togelius, Yuki Mitsufuji

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10697 2025-03-17 cs.CV cs.AI eess.IV 70%

Zero-Shot Subject-Centric Generation for Creative Application Using Entropy Fusion

Kaifeng Zou, Xiaoyi Feng, Peng Wang, Tao Huang, Zizhou Huang, Zhang Haihang, Yuntao Zou, Dagang Li

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 8 pages, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17532 2025-03-17 cs.CV 70%

ClassDiffusion: More Aligned Personalization Tuning with Explicit Class Guidance

Jiannan Huang, Jun Hao Liew, Hanshu Yan, Yuyang Yin, Yao Zhao, Humphrey Shi, Yunchao Wei

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR2025, Code is available at https://github.com/Rbrq03/ClassDiffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09662 2025-03-14 cs.CV 70%

CoRe^2: Collect, Reflect and Refine to Generate Better and Faster

Shitong Shao, Zikai Zhou, Dian Xie, Yuetong Fang, Tian Ye, Lichen Bai, Zeke Xie

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09122 2025-03-13 cs.CV 70%

Training Data Provenance Verification: Did Your Model Use Synthetic Data from My Generative Model for Training?

Yuechen Xie, Jie Song, Huiqiong Wang, Mingli Song

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08650 2025-03-12 cs.CV 70%

MF-VITON: High-Fidelity Mask-Free Virtual Try-On with Minimal Input

Zhenchen Wan, Yanwu xu, Dongting Hu, Weilun Cheng, Tianxi Chen, Zhaoqing Wang, Feng Liu, Tongliang Liu, Mingming Gong

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments The project page is available at: https://zhenchenwan.github.io/MF-VITON/

详情

展开后加载摘要…

URL PDF HTML 收藏