arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86714 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3486 篇

2506.08010 2025-10-28 cs.CV cs.AI 57%

Vision Transformers Don't Need Trained Registers

Nick Jiang, Amil Dravid, Alexei Efros, Yossi Gandelsman

机构 * UC Berkeley(伯克利大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Project page and code: https://avdravid.github.io/test-time-registers. Accepted to NeurIPS '25 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20639 2025-10-24 cs.CV 57%

Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging

Ibrahim Ethem Hamamci, Sezgin Er, Suprosanna Shit, Hadrien Reynaud, Dong Yang, Pengfei Guo, Marc Edgar, Daguang Xu, Bernhard Kainz, Bjoern Menze

机构 * University of Zurich(苏黎世大学) NVIDIA Imperial College London(伦敦帝国理工学院) FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15682 2025-10-21 cs.CV 57%

ELIP: Enhanced Visual-Language Foundation Models for Image Retrieval

Guanqi Zhan, Yuanpei Liu, Kai Han, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学视觉几何组) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted by CBMI 2025 (IEEE International Conference on Content-Based Multimedia Indexing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15240 2025-10-20 cs.CV 57%

The Face of Persuasion: Analyzing Bias and Generating Culture-Aware Ads

Aysan Aghazadeh, Adriana Kovashka

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09823 2025-10-15 cs.CV 57%

KonfAI: A Modular and Fully Configurable Framework for Deep Learning in Medical Imaging

Valentin Boussot, Jean-Louis Dillenseger

机构 * INSERM, LTSI - UMR 1099 University of Rennes(法国里昂大学INSERM LTSI - UMR 1099)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments https://github.com/vboussot/KonfAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12260 2025-10-15 cs.CV cs.LG eess.IV 57%

AngularFuse: A Closer Look at Angle-based Perception for Spatial-Sensitive Multi-Modality Image Fusion

Xiaopeng Liu, Yupei Lin, Sen Zhang, Xiao Wang, Yukai Shi, Liang Lin

机构 * School of Information Engineering, Guangdong University of Technology(广东技术大学信息工程学院) TikTok, ByteDance Inc(字节跳动) School of Computer Science, Anhui University(安徽大学计算机科学学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments For the first time, angle-based perception was introduced into the multi-modality image fusion task

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15877 2025-10-15 cs.CV cs.CL cs.LG 57%

Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval

Siting Li, Xiang Gao, Simon Shaolei Du

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2025; 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05970 2025-10-14 cs.CV 57%

Automatic Synthesis of High-Quality Triplet Data for Composed Image Retrieval

Haiwen Li, Delong Liu, Zhaohui Hou, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments This paper was originally submitted to ACM MM 2025 on April 12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08951 2025-10-13 eess.IV cs.CV 57%

FS-RWKV: Leveraging Frequency Spatial-Aware RWKV for 3T-to-7T MRI Translation

Yingtie Lei, Zimeng Li, Chi-Man Pun, Yupeng Liu, Xuhang Chen

机构 * Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院) School of Electronic and Communication Engineering, Shenzhen Polytechnic University(深圳职业技术学院电子与通信工程学院) Department of Cardiology, Guangdong Provincial People’s Hospital (Guangdong Academy of Medical Sciences), Southern Medical University, Guangzhou, China(广东省人民医院心内科(广东省医学科学院)) Guangdong Cardiovascular Institute, Guangdong Provincial People’s Hospital, Guangdong Academy of Medical Sciences, Guangzhou, China(广东省心血管病研究院,广东省人民医院,广东省医学科学院,广州,中国)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Accepted by BIBM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10575 2025-10-07 cs.CV 57%

A Survey of Defenses Against AI-Generated Visual Media: Detection,Disruption, and Authentication

Jingyi Deng, Chenhao Lin, Zhengyu Zhao, Shuai Liu, Zhe Peng, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) Interdisciplinary Research Center of Frontier science and technology, Xi'an Jiaotong University(西安交通大学前沿科学与技术交叉研究中心) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Department of Industrial and Systems Engineering, Hong Kong Polytechnic University(香港理工大学工业与系统工程系) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25122 2025-09-30 cs.CV 57%

Triangle Splatting+: Differentiable Rendering with Opaque Triangles

Jan Held, Renaud Vandeghen, Sanghyun Son, Daniel Rebain, Matheus Gadelha, Yi Zhou, Ming C. Lin, Marc Van Droogenbroeck, Andrea Tagliasacchi

机构 * University of Liège(利根大学) Simon Fraser University(西蒙弗雷泽大学) University of Maryland(马里兰大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Adobe Research(Adobe研究)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments 9 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23555 2025-09-30 cs.CV 57%

From Fields to Splats: A Cross-Domain Survey of Real-Time Neural Scene Representations

Javed Ahmad, Penggang Gao, Donatien Delehelle, Mennuti Canio, Nikhil Deshpande, Jesús Ortiz, Darwin G. Caldwell, Yonas Teodros Tefera

机构 * Advanced Robotics, Istituto Italiano di Tecnologia (IIT)(先进机器人技术,意大利技术研究院) Istituto Nazionale per l’Assicurazione contro gli Infortuni sul Lavoro (INAIL)(国家职业伤害保险研究所) School of Computer Science, University of Nottingham(计算机科学学院,诺丁汉大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22940 2025-09-30 cs.CL cs.CV 57%

LLMs Behind the Scenes: Enabling Narrative Scene Illustration

Melissa Roemmele, John Joon Young Chung, Taewook Kim, Yuqian Sun, Alex Calderwood, Max Kreminski

机构 * Midjourney Northwestern University(西北大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18699 2025-09-30 cs.CV 57%

AGSwap: Overcoming Category Boundaries in Object Fusion via Adaptive Group Swapping

Zedong Zhang, Ying Tai, Jianjun Qian, Jian Yang, Jun Li

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22394 2025-09-29 eess.IV cs.AI cs.CV 57%

Deep Learning-Based Cross-Anatomy CT Synthesis Using Adapted nnResU-Net with Anatomical Feature Prioritized Loss

Javier Sequeiro González, Arthur Longuefosse, Miguel Díaz Benito, Álvaro García Martín, Fabien Baldacci

机构 * Univ. Bordeaux, CNRS, LaBRI, UMR 5800, F-33400 Talence, France(波尔多大学,法国国家科学研究中心,LaBRI研究院,UMR 5800) Universidad Autónoma de Madrid, Madrid, 28049, Spain(马德里自治大学,西班牙) Pazmany Peter Catholic University, Budapest, 1083, Hungary(佩斯大学,匈牙利) RIKEN Center for Integrative Medical Sciences, Medical Data Deep Learning Team, Tokyo, Japan(日本再生医学科学中心,医学数据深度学习团队)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21997 2025-09-29 cs.CV 57%

Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21473 2025-09-29 cs.LG cs.AI cs.CL cs.CV stat.ML 57%

Are Hallucinations Bad Estimations?

Hude Liu, Jerry Yao-Chieh Hu, Jennifer Yuntong Zhang, Zhao Song, Han Liu

机构 * Center for Foundation Models and Generative AI, Northwestern University(基础模型与生成式人工智能中心,西北大学) Department of Computer Science, Northwestern University(计算机科学系,西北大学) Ensemble AI Engineering Science, University of Toronto(工程科学,多伦多大学) University of California, Berkeley(加州大学伯克利分校) Department of Statistics and Data Science, Northwestern University(统计与数据科学系,西北大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Code is available at https://github.com/MAGICS-LAB/hallucination

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21466 2025-09-29 cs.CV cs.AI cs.CL 57%

Gender Stereotypes in Professional Roles Among Saudis: An Analytical Study of AI-Generated Images Using Language Models

Khaloud S. AlKhalifah, Malak Mashaabi, Hend Al-Khalifa

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20171 2025-09-25 cs.CV 57%

Optical Ocean Recipes: Creating Realistic Datasets to Facilitate Underwater Vision Research

Patricia Schöntag, David Nakath, Judith Fischer, Rüdiger Röttgers, Kevin Köser

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments 26 pages, 9 figures, submitted to IEEE Journal of Ocean Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19203 2025-09-24 cs.CV 57%

Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions

Ioanna Ntinou, Alexandros Xenos, Yassine Ouali, Adrian Bulat, Georgios Tzimiropoulos

机构 * Queen Mary University of London(伦敦女王大学) Samsung AI Centre(三星人工智能中心) Technical University of Iași(伊阿苏技术大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10328 2025-09-23 eess.IV cs.CV 57%

Anatomical feature-prioritized loss for enhanced MR to CT translation

Arthur Longuefosse, Baudouin Denis de Senneville, Gael Dournes, Ilyes Benlala, Pascal Desbarats, Fabien Baldacci

机构 * Univ. Bordeaux, CNRS, Bordeaux INP, LaBRI, UMR 5800, 33400 Talence, France(波尔多大学) Univ. Bordeaux, CNRS, Bordeaux INP, IMB, UMR 5251, 33400 Talence, France(波尔多大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Journal ref 2025 Phys. Med. Biol. 70 145012

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12667 2025-09-23 cs.CV 57%

Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking

Zihan Su, Xuerui Qiu, Hongbin Xu, Tangyu Jiang, Junhao Zhuang, Chun Yuan, Ming Li, Shengfeng He, Fei Richard Yu

机构 * Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) South China University of Technology(华南理工大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Singapore Management University(新加坡管理学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Safa-Sora is accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15391 2025-09-22 cs.CV 57%

RaceGAN: A Framework for Preserving Individuality while Converting Racial Information for Image-to-Image Translation

Mst Tasnim Pervin, George Bebis, Fang Jiang, Alireza Tavakkoli

机构 * 1 2 4 Department of Computer Science \& Engineering, 3 Department of Psychology, University of Nevada, Reno, USA Email: 1 , 2 , 3 , 4

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Journal ref ICMLA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14746 2025-09-19 cs.CV cs.IR 57%

Chain-of-Thought Re-ranking for Image Retrieval Tasks

Shangrong Wu, Yanghong Zhou, Yang Chen, Feng Zhang, P. Y. Mok

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03486 2025-09-12 cs.CR cs.CV cs.SI 57%

UnsafeBench: Benchmarking Image Safety Classifiers on Real-World and AI-Generated Images

Yiting Qu, Xinyue Shen, Yixin Wu, Michael Backes, Savvas Zannettou, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心) TU Delft(代尔夫特理工大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments To Appear in the ACM Conference on Computer and Communications Security (CCS), October 13, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08818 2025-09-11 cs.CV 57%

GeneVA: A Dataset of Human Annotations for Generative Text to Video Artifacts

Jenna Kang, Maria Silva, Patsorn Sangkloy, Kenneth Chen, Niall Williams, Qi Sun

机构 * New York University(纽约大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07963 2025-09-09 cs.AI cs.CL cs.CV 57%

SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards

Jixiang Hong, Yiran Zhang, Guanzhong Wang, Yi Liu, Ji-Rong Wen, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) School of Computer Science(计算机科学学院) Baidu Inc.(百度公司) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04298 2025-09-05 cs.CV 57%

Noisy Label Refinement with Semantically Reliable Synthetic Images

Yingxuan Li, Jiafeng Mao, Yusuke Matsui

机构 * The University of Tokyo(东京大学) CyberAgent, Inc.(CyberAgent公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted to ICIP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00752 2025-09-03 cs.CV 57%

Multi-Level CLS Token Fusion for Contrastive Learning in Endoscopy Image Classification

Y Hop Nguyen, Doan Anh Phan Huu, Trung Thai Tran, Nhat Nam Mai, Van Toi Giap, Thao Thi Phuong Dao, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Thong Nhat Hospital(通纳特医院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00549 2025-09-03 cs.CV 57%

A Modality-agnostic Multi-task Foundation Model for Human Brain Imaging

Peirong Liu, Oula Puonti, Xiaoling Hu, Karthik Gopinath, Annabel Sorby-Adams, Daniel C. Alexander, W. Taylor Kimberly, Juan E. Iglesias

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏