arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86714 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3486 篇

2505.21780 2025-06-25 cs.CV 57%

Compositional Scene Understanding through Inverse Generative Modeling

Yanbo Wang, Justin Dauwels, Yilun Du

机构 * Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments ICML 2025, Webpage: https://energy-based-model.github.io/compositional-inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12273 2025-06-25 cs.CV 57%

Beyond Reconstruction: A Physics Based Neural Deferred Shader for Photo-realistic Rendering

Zhuo He, Paul Henderson, Nicolas Pugeault

机构 * School of Computing Science, University of Glasgow(计算科学学院,格拉斯哥大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11748 2025-06-24 cs.CV 57%

ILIAS: Instance-Level Image retrieval At Scale

Giorgos Kordopatis-Zilos, Vladan Stojnić, Anna Manko, Pavel Šuma, Nikolaos-Antonios Ypsilantis, Nikos Efthymiadis, Zakaria Laskar, Jiří Matas, Ondřej Chum, Giorgos Tolias

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19637 2025-06-24 cs.CV 57%

ReNeg: Learning Negative Embedding with Reward Guidance

Xiaomin Li, Yixuan Liu, Takashi Isobe, Xu Jia, Qinpeng Cui, Dong Zhou, Dong Li, You He, Huchuan Lu, Zhongdao Wang, Emad Barsoum

机构 * Advanced Micro Devices Inc.(先进微器件公司) Dalian University of Technology(大连理工大学) Tsinghua University(清华大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Code: https://github.com/AMD-AIG-AIMA/ReNeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02357 2025-06-17 cs.CV 57%

Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content

Zicheng Zhang, Tengchuan Kou, Shushi Wang, Chunyi Li, Wei Sun, Wei Wang, Xiaoyu Li, Zongyu Wang, Xuezhi Cao, Xiongkuo Min, Xiaohong Liu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments CVPR 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10365 2025-06-17 cs.CV cs.AI 57%

Robust image representations with counterfactual contrastive learning

Mélanie Roschewitz, Fabio De Sousa Ribeiro, Tian Xia, Galvin Khara, Ben Glocker

机构 * Imperial College London(伦敦帝国理工学院) Kheiron Medical Technologies(Kheiron医疗技术公司)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Code available at https://github.com/biomedia-mira/counterfactual-contrastive/

Journal ref Medical Image Analysis, Volume 105, October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03988 2025-06-10 cs.CV cs.LG 57%

RAID: A Dataset for Testing the Adversarial Robustness of AI-Generated Image Detectors

Hicham Eddoubi, Jonas Ricker, Federico Cocchi, Lorenzo Baraldi, Angelo Sotgiu, Maura Pintor, Marcella Cornia, Lorenzo Baraldi, Asja Fischer, Rita Cucchiara, Battista Biggio

机构 * University of Cagliari(卡利里大学) Ruhr University Bochum(波恩鲁尔大学) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) Sapienza University of Rome(罗马萨皮恩扎大学) CINI(CINI研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19285 2025-06-09 cs.CV 57%

On the Importance of Text Preprocessing for Multimodal Representation Learning and Pathology Report Generation

Ruben T. Lucassen, Tijn van de Luijtgaarden, Sander P. J. Moonemans, Gerben E. Breimer, Willeke A. M. Blokx, Mitko Veta

机构 * Dept. of Pathology, University Medical Center Utrecht(病理学系,乌得勒支大学医学中心) Dept. of Biomedical Engineering, Eindhoven University of Technology(生物医学工程系,埃因霍温理工大学) Dept. of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05113 2025-06-09 cs.CV cs.AI cs.LG 57%

LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models

Lukas Helff, Felix Friedrich, Manuel Brack, Kristian Kersting, Patrick Schramowski

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments In Proceedings of the 42st International Conference on Machine Learning (ICML 2025), Project page at https://ml-research.github.io/human-centered-genai/projects/llavaguard/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05313 2025-06-06 cs.CV 57%

MARBLE: Material Recomposition and Blending in CLIP-Space

Ta-Ying Cheng, Prafull Sharma, Mark Boss, Varun Jampani

机构 * University of Oxford(牛津大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stability AI

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03998 2025-06-04 cs.CV eess.IV 57%

PHISWID: Physics-Inspired Underwater Image Dataset Synthesized from RGB-D Images

Reina Kaneko, Takumi Ueda, Hiroshi Higashi, Yuichi Tanaka

机构 * Graduate School of Engineering, The University of Osaka(大阪大学工学研究科) Graduate School of BASE, Tokyo University of Agriculture and Technology(东京大学农业技术大学院大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01853 2025-06-03 cs.CV 57%

ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding

Junliang Ye, Zhengyi Wang, Ruowen Zhao, Shenghao Xie, Jun Zhu

机构 * Tsinghua University(清华大学) Peking University(北京大学) ShengShu(盛舒)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project page: https://github.com/JAMESYJL/ShapeLLM-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01379 2025-06-03 cs.CV 57%

RadarSplat: Radar Gaussian Splatting for High-Fidelity Data Synthesis and 3D Reconstruction of Autonomous Driving Scenes

Pou-Chun Kung, Skanda Harisha, Ram Vasudevan, Aline Eid, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24441 2025-06-02 cs.CV 57%

SORCE: Small Object Retrieval in Complex Environments

Chunxu Liu, Chi Xie, Xiaxu Chen, Wei Li, Feng Zhu, Rui Zhao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Sensetime Research(商汤科技研究院) Tongji University(同济大学) Beijing Institute of Technology(北京理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project Page: https://github.com/MCG-NJU/SORCE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23977 2025-06-02 cs.CV cs.AI cs.LG 57%

VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL

Yichen Feng, Zhangchen Xu, Fengqing Jiang, Yuetai Li, Bhaskar Ramasubramanian, Luyao Niu, Bill Yuchen Lin, Radha Poovendran

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Project page at https://visualsphinx.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22613 2025-05-29 cs.CV cs.AI cs.CL 57%

RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction

Yuchi Wang, Yishuo Cai, Shuhuai Ren, Sihan Yang, Linli Yao, Yuanxin Liu, Yuanxing Zhang, Pengfei Wan, Xu Sun

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments code: https://github.com/wangyuchi369/RICO

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21647 2025-05-29 cs.CV cs.LG 57%

QuARI: Query Adaptive Retrieval Improvement

Eric Xing, Abby Stylianou, Robert Pless, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Saint Louis University(圣路易斯大学) The George Washington University(乔治华盛顿大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14664 2025-05-29 cs.CV cs.AI cs.HC cs.LG 57%

AKRMap: Adaptive Kernel Regression for Trustworthy Visualization of Cross-Modal Embeddings

Yilin Ye, Junchao Huang, Xingchen Zeng, Jiazhi Xia, Wei Zeng

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19952 2025-05-27 cs.CV cs.IR 57%

Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval

Rong-Cheng Tu, Wenhao Sun, Hanzhe You, Yingjie Wang, Jiaxing Huang, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) School of Information Science and Technology, University of Science and Technology of China, Hefei, China(中国科学技术大学信息科学与技术学院) Sun Yat-sen University Shenzhen Campus, School of Cyber Science and Technology, Shenzhen, China(中山大学深圳校区计算机科学与技术学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19707 2025-05-27 cs.CV cs.IR 57%

MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval

Rong-Cheng Tu, Zhao Jin, Jingyi Liao, Xiao Luo, Yingjie Wang, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Department of Computer Science, University of California, Los Angeles, USA(加州大学洛杉矶分校计算机科学系) Sun Yat-sen University Shenzhen Campus, School of Cyber Science and Technology, Shenzhen, China(中山大学深圳校区信息科学与技术学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00176 2025-05-22 cs.CV 57%

Opt-In Art: Learning Art Styles Only from Few Examples

Hui Ren, Joanna Materzynska, Rohit Gandikota, David Bau, Antonio Torralba

机构 * ShanghaiTech University(上海科技大学) MIT(麻省理工学院) Northeastern University(东北大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16515 2025-05-21 cs.CV cs.AI cs.IR 57%

Automatic Synthetic Data and Fine-grained Adaptive Feature Alignment for Composed Person Retrieval

Delong Liu, Haiwen Li, Zhaohui Hou, Zhicheng Zhao, Fei Su, Yuan Dong

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) SenseTime(商汤科技) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Intereactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05505 2025-05-21 cs.LG cs.CR cs.CV stat.ML 57%

Differentially Private Synthetic Data via APIs 3: Using Simulators Instead of Foundation Model

Zinan Lin, Tadas Baltrusaitis, Wenyu Wang, Sergey Yekhanin

机构 * Microsoft Research Redmond(微软研究院红mond分部) Microsoft Cambridge(微软剑桥分部)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Published in: (1) ICLR 2025 Workshop on Data Problems, (2) ICLR 2025 Workshop on Synthetic Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16401 2025-05-20 cs.CV cs.LG 57%

Understanding the Effect of using Semantically Meaningful Tokens for Visual Representation Learning

Neha Kalibhat, Priyatham Kattakinda, Sumit Nawathe, Arman Zarei, Nikita Seleznev, Samuel Sharpe, Senthil Kumar, Soheil Feizi

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Published at CVPR Workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13123 2025-05-20 cs.CV cs.AI 57%

Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training

Xinsong Zhang, Yarong Zeng, Xinting Huang, Hu Hu, Runquan Xie, Han Hu, Zhanhui Kang

机构 * Tencent(腾讯)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11121 2025-05-19 cs.CV 57%

Redundancy-Aware Pretraining of Vision-Language Foundation Models in Remote Sensing

Mathis Jürgen Adler, Leonard Hackel, Gencer Sumbul, Begüm Demir

机构 * TU Berlin(柏林技术大学) BIFOLD(BIFOLD机构) EPFL(苏黎世联邦理工学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025. Our code is available at https://git.tu-berlin.de/rsim/redundacy-aware-rs-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06467 2025-05-13 cs.CV cs.HC 57%

PromptIQ: Who Cares About Prompts? Let System Handle It -- A Component-Aware Framework for T2I Generation

Nisan Chhetri, Arpan Sainju

机构 * North Carolina State University(北卡罗来纳州立大学) Middle Tennessee State University(中田纳西州立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05505 2025-05-12 cs.CV eess.IV 57%

Apply Hierarchical-Chain-of-Generation to Complex Attributes Text-to-3D Generation

Yiming Qin, Zhu Xu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project page here: https://hierarchical-chain-of-generation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03242 2025-05-07 cs.CV cs.AI 57%

Seeing the Abstract: Translating the Abstract Language for Vision Language Models

Davide Talon, Federico Girella, Ziyue Liu, Marco Cristani, Yiming Wang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted to CVPR25. Project page: https://davidetalon.github.io/fashionact-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01838 2025-05-06 cs.CV 57%

MVHumanNet++: A Large-scale Dataset of Multi-view Daily Dressing Human Captures with Richer Annotations for 3D Human Digitization

Chenghong Li, Hongjie Liao, Yihao Zhi, Xihe Yang, Zhengwentai Sun, Jiahao Chang, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Future Network of Intelligence Institute, CUHK-Shenzhen(智能网络研究院,CUHK-深圳)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments project page: https://kevinlee09.github.io/research/MVHumanNet++/. arXiv admin note: substantial text overlap with arXiv:2312.02963

详情

展开后加载摘要…

URL PDF HTML 收藏