arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86761 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3489 篇

2404.04363 2024-12-19 cs.CV 70%

Idea23D: Collaborative LMM Agents Enable 3D Model Generation from Interleaved Multimodal Inputs

Junhao Chen, Xiang Li, Xiaojun Ye, Chao Li, Zhaoxin Fan, Hao Zhao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by COLING 2025 (The 31st International Conference on Computational Linguistics) Project Page: https://idea23d.github.io/ Code: https://github.com/yisuanwang/Idea23D

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08580 2024-12-16 cs.CV 70%

LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations

Zejian Li, Chenye Meng, Yize Li, Ling Yang, Shengyuan Zhang, Jiarui Ma, Jiayi Li, Guang Yang, Changyuan Yang, Zhiyuan Yang, Jinxiong Chang, Lingyun Sun

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08859 2024-12-13 cs.CV 70%

ViUniT: Visual Unit Tests for More Robust Visual Programming

Artemis Panagopoulou, Honglu Zhou, Silvio Savarese, Caiming Xiong, Chris Callison-Burch, Mark Yatskar, Juan Carlos Niebles

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08111 2024-12-12 cs.CV cs.CL cs.LG 70%

Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models

Sri Harsha Dumpala, David Arps, Sageev Oore, Laura Kallmeyer, Hassan Sajjad

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17189 2024-12-02 cs.CV 70%

PhysMotion: Physics-Grounded Dynamics From a Single Image

Xiyang Tan, Ying Jiang, Xuan Li, Zeshun Zong, Tianyi Xie, Yin Yang, Chenfanfu Jiang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://supertan0204.github.io/physmotion_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11643 2024-11-26 cs.CV 70%

CustAny: Customizing Anything from A Single Example

Lingjie Kong, Kai Wu, Xiaobin Hu, Wenhui Han, Jinlong Peng, Chengming Xu, Donghao Luo, Mengtian Li, Jiangning Zhang, Chengjie Wang, Yanwei Fu

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15245 2024-11-26 cs.CV 70%

AnyText2: Visual Text Generation and Editing With Customizable Attributes

Yuxiang Tuo, Yifeng Geng, Liefeng Bo

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01002 2024-11-22 cs.CV cs.AI 70%

AI-generated faces influence gender stereotypes and racial homogenization

Nouar AlDahoul, Talal Rahwan, Yasir Zaki

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 47 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18068 2024-11-19 cs.CV 70%

SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model

Bin Cao, Jianhao Yuan, Yexin Liu, Jian Li, Shuyang Sun, Jing Liu, Bo Zhao

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08642 2024-11-14 cs.CV cs.AI 70%

Towards More Accurate Fake Detection on Images Generated from Advanced Generative and Neural Rendering Models

Chengdong Dong, Vijayakumar Bhagavatula, Zhenyu Zhou, Ajay Kumar

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments 13 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07708 2024-11-13 cs.CV 70%

Emotion Classification of Children Expressions

Sanchayan Vivekananthan

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07472 2024-11-13 cs.CV 70%

Semi-Truths: A Large-Scale Dataset of AI-Augmented Images for Evaluating Robustness of AI-Generated Image detectors

Anisha Pal, Julia Kruk, Mansi Phute, Manognya Bhattaram, Diyi Yang, Duen Horng Chau, Judy Hoffman

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2024 Track Datasets & Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09633 2024-11-07 cs.CV 70%

In-Context Translation: Towards Unifying Image Recognition, Processing, and Generation

Han Xue, Qianru Sun, Li Song, Wenjun Zhang, Zhiwu Huang

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07593 2024-10-30 cs.CV cs.AI 70%

A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks

Hoin Jung, Taeuk Jang, Xiaoqian Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2024 (Spotlight), the Thirty-Eighth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02793 2024-10-30 cs.CV cs.CL 70%

ImageInWords: Unlocking Hyper-Detailed Image Descriptions

Roopal Garg, Andrea Burns, Burcu Karagol Ayan, Yonatan Bitton, Ceslee Montgomery, Yasumasa Onoe, Andrew Bunner, Ranjay Krishna, Jason Baldridge, Radu Soricut

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Webpage (https://google.github.io/imageinwords), GitHub (https://github.com/google/imageinwords), HuggingFace (https://huggingface.co/datasets/google/imageinwords)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20279 2024-10-24 cs.CV cs.AI eess.IV 70%

CV-VAE: A Compatible Video VAE for Latent Generative Video Models

Sijie Zhao, Yong Zhang, Xiaodong Cun, Shaoshu Yang, Muyao Niu, Xiaoyu Li, Wenbo Hu, Ying Shan

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Project Page: https://ailab-cvc.github.io/cvvae/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13861 2024-10-22 cs.CV 70%

PUMA: Empowering Unified MLLM with Multi-granular Visual Generation

Rongyao Fang, Chengqi Duan, Kun Wang, Hao Li, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Hongsheng Li, Xihui Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: https://rongyaofang.github.io/puma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13823 2024-10-18 cs.CV 70%

Deep Generative Models Unveil Patterns in Medical Images Through Vision-Language Conditioning

Xiaodan Xing, Junzhi Ning, Yang Nan, Guang Yang

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by AIM-FM Workshop of NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03209 2024-10-10 cs.CV 70%

iSeg: An Iterative Refinement-based Framework for Training-free Segmentation

Lin Sun, Jiale Cao, Jin Xie, Fahad Shahbaz Khan, Yanwei Pang

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

Comments Project Page: https://linsun449.github.io/iSeg/ Code: https://github.com/linsun449/iseg.code

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14206 2024-10-10 cs.CV 70%

LG-VQ: Language-Guided Codebook Learning

Guotao Liang, Baoquan Zhang, Yaowei Wang, Xutao Li, Yunming Ye, Huaibin Wang, Chuyao Luo, Kola Ye, linfeng Luo

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04701 2024-10-10 cs.CV cs.AI 70%

ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes

Hashmat Shadab Malik, Muhammad Huzaifa, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Journal ref Asian Conference on Computer Vision - 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18282 2024-10-02 eess.IV cs.CV physics.med-ph 70%

Synthesizing beta-amyloid PET images from T1-weighted Structural MRI: A Preliminary Study

Qing Lyu, Jin Young Kim, Jeongchul Kim, Christopher T Whitlow

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12024 2024-09-19 cs.CV 70%

LEMON: Localized Editing with Mesh Optimization and Neural Shaders

Furkan Mert Algan, Umut Yazgan, Driton Salihu, Cem Eteke, Eckehard Steinbach

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10578 2024-09-18 cs.CR cs.AI cs.CV cs.LG 70%

GLEAN: Generative Learning for Eliminating Adversarial Noise

Justin Lyu Kim, Kyoungwan Woo

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01256 2024-09-17 cs.CV cs.CL 70%

VideoStudio: Generating Consistent-Content and Multi-Scene Videos

Fuchen Long, Zhaofan Qiu, Ting Yao, Tao Mei

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ECCV 2024. Source code is available at https://github.com/FuchenUSTC/VideoStudio

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05162 2024-09-10 cs.CV cs.LG 70%

Can OOD Object Detectors Learn from Foundation Models?

Jiahui Liu, Xin Wen, Shizhen Zhao, Yingxian Chen, Xiaojuan Qi

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 19 pages, 4 figures

Journal ref European Conference on Computer Vision (ECCV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01835 2024-09-10 cs.CV cs.CL 70%

Towards Generative Class Prompt Learning for Fine-grained Visual Recognition

Soumitri Chattopadhyay, Sanket Biswas, Emanuele Vivoli, Josep Lladós

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted in BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12352 2024-08-26 cs.CV 70%

GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections

Shiyue Zhang, Zheng Chong, Xujie Zhang, Hanhui Li, Yuhao Cheng, Yiqiang Yan, Xiaodan Liang

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05019 2024-08-12 cs.CV 70%

Instruction Tuning-free Visual Token Complement for Multimodal LLMs

Dongsheng Wang, Jiequan Cui, Miaoge Li, Wang Lin, Bo Chen, Hanwang Zhang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by ECCV2024 (20pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15378 2024-07-23 cs.CV 70%

Long-CLIP: Unlocking the Long-Text Capability of CLIP

Beichen Zhang, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Jiaqi Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ECCV 2024. All codes and models are publicly available at https://github.com/beichenzbc/Long-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏