arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86714 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3486 篇

2601.12946 2026-02-03 cs.CY cs.AI cs.CL cs.CV cs.LG 57%

AI-generated data contamination erodes pathological variability and diagnostic reliability

AI生成的数据污染侵蚀病理变异性与诊断可靠性

Hongyu He, Shaowen Xiang, Ye Zhang, Yingtao Zhu, Jin Zhang, Hao Deng, Emily Alsentzer, Yun Liu, Qingyu Chen, Kun-Hsing Yu, Andrew Marshall, Tingting Chen, Srinivas Anumasa, Daniel Ebner, Dean Ho, Kee Yuan Ngiam, Ching-Yu Cheng, Dianbo Liu

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 AI生成的数据污染导致病理变异性下降和诊断可靠性降低,需政策强制的人类监督以防止医疗数据生态系统的退化。

Comments *Corresponding author: Dianbo Liu (dianbo@nus.edu.sg)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04236 2026-02-03 cs.CV 57%

Scaling Sequence-to-Sequence Generative Neural Rendering

序列到序列生成神经渲染的扩展

Shikun Liu, Kam Woh Ng, Wonbong Jang, Jiadong Guo, Junlin Han, Haozhe Liu, Yiannis Douratsos, Juan C. Pérez, Zijian Zhou, Chi Phung, Tao Xiang, Juan-Manuel Pérez-Rúa

机构 * Meta AI

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 Kaleido通过统一的解码器-only rectified flow transformer实现了序列到序列生成神经渲染的扩展,能够在无显式3D表示的情况下生成多视角视图,并在多个视图设置中达到与场景优化方法相当的性能。

Comments Published at ICLR 2026. Project Page: https://shikun.io/projects/kaleido

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00221 2026-02-03 eess.IV cs.CV 57%

Benchmarking Vanilla GAN, DCGAN, and WGAN Architectures for MRI Reconstruction: A Quantitative Analysis

对MRI重建中Vanilla GAN、DCGAN和WGAN架构进行基准测试:一项定量分析

Humaira Mehwish, Hina Shakir, Muneeba Rashid, Asarim Aamir, Reema Qaiser Khan

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本研究通过定量分析比较了Vanilla GAN、DCGAN和WGAN在MRI重建中的性能,发现DCGAN和WGAN在图像质量和准确性方面表现更优。

Comments 20 pages

Journal ref Edelweiss Applied Science and Technology January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17706 2026-01-27 cs.CL cs.CV 57%

A Computational Approach to Visual Metonymy

一种视觉隐喻的计算方法

Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种基于符号学理论的计算方法,通过构建ViMET数据集评估多模态语言模型在理解视觉隐喻方面的认知推理能力,并揭示了机器在处理间接视觉参考上的局限性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15888 2026-01-23 cs.CV cs.AI 57%

Understanding the Transfer Limits of Vision Foundation Models

理解视觉基础模型的迁移限制

Shiqi Huang, Yipei Wang, Natasha Thorley, Alexander Ng, Shaheer Saeed, Mark Emberton, Shonit Punwani, Veeru Kasivisvanathan, Dean Barratt, Daniel Alexander, Yipeng Hu

机构 * University College London(伦敦大学学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究了视觉基础模型在迁移时的限制,发现预训练目标与下游任务需求的匹配程度影响迁移性能,提出通过改进预训练目标以提升模型效果。

Comments accepted in ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15859 2026-01-23 cs.LG cs.CV 57%

Uncertainty-guided Generation of Dark-field Radiographs

不确定性引导的暗场放射图像生成

Lina Felsner, Henriette Bast, Tina Dorosti, Florian Schaff, Franz Pfeiffer, Daniela Pfeiffer, Julia Schnabel

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于不确定性引导的生成对抗网络,从标准衰减X光片生成暗场图像,提升图像生成的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08790 2026-01-14 cs.CV 57%

Aggregating Diverse Cue Experts for AI-Generated Image Detection

聚合多样化线索专家用于AI生成图像检测

Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出MCAN框架,通过整合多种互补线索提升AI生成图像检测的泛化能力,实验显示在GenImage数据集上性能优于现有方法。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06642 2026-01-13 cs.CV cs.AI 57%

Boosting Overlapping Organoid Instance Segmentation Using Pseudo-Label Unmixing and Synthesis-Assisted Learning

通过伪标签解混和合成辅助学习提升重叠类器官实例分割

Gui Huang, Kangyuan Zheng, Xuan Cai, Jiaqi Wang, Jianjia Zhang, Kaida Ning, Wenbo Wei, Yujuan Zhu, Jiong Zhang, Mengting Liu

机构 * School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Peng Cheng Laboratory(鹏城实验室) The First Affiliated Hospital of Shenzhen University, Shenzhen Second People's Hospital(深圳大学第一附属医院、深圳第二人民医院) The Research Center of Clinical Medicine, Affiliated Hospital of Nantong University, Medical School of Nantong University(临床医学研究中心、南通大学附属医院、南通大学医学院) Cixi Institute of Biomedical Engineering, Ningbo Institute of Materials Technology and Engineering, Chinese Academy of Sciences(慈溪生物医学工程研究所、宁波材料技术与工程研究所、中国科学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出通过伪标签解混和合成辅助学习提升类器官实例分割,解决重叠问题,实现高效率的标注数据利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05399 2026-01-12 cs.CV cs.AI cs.IR 57%

Multi-task Cross-modal Learning for Chest X-ray Image Retrieval

多任务跨模态学习用于胸部X射线图像检索

Zhaohui Liang, Sivaramakrishnan Rajaraman, Niccolo Marini, Zhiyun Xue, Sameer Antani

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出多任务学习框架,通过改进BiomedCLIP模型,提升胸部X射线图像与文本的跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03193 2026-01-09 cs.CV cs.AI 57%

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision

UniCorn:通过自生成监督实现自我改进的统一多模态模型

Ruiyan Han, Zhen Fang, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) FDU(复旦大学) ECNU(华东师范大学) CUHK(香港中文大学) NJU(南京大学) SUDA(上海大学)

专题命中 文生图 :image generation(abstract);分类 cs.CV

AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23453 2025-12-30 cs.CV cs.AI 57%

CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models

CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04809 2025-12-30 cs.CV cs.LG 57%

Investigation of the Impact of Synthetic Training Data in the Industrial Application of Terminal Strip Object Detection

终端条目目标检测在工业应用中的合成训练数据影响研究

Nico Baumgart, Markus Lange-Hegermann, Mike Mücke

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究了终端条目目标检测中合成训练数据的影响,通过合成图像与真实数据结合,验证了DINO模型在复杂工业环境中的高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19680 2025-12-23 cs.CV 57%

VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

VA-$π$: 变分策略对齐用于像素感知自回归生成

Xinyao Liao, Qiyuan He, Kai Xu, Xiaoye Qu, Yicong Li, Wei Wei, Angela Yao

机构 * Huazhong University of Science & Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。

Comments 21 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19300 2025-12-23 cs.CV 57%

RMLer: Synthesizing Novel Objects across Diverse Categories via Reinforcement Mixing Learning

RMLer: 通过强化混合学习跨多样类别合成新物体

Jun Li, Zikun Chen, Haibo Chen, Shuo Chen, Jian Yang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 RMLer通过强化混合学习框架,有效解决跨类别文本到图像生成中的概念混合问题,提升合成物体的连贯性和保真度。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25387 2025-12-16 cs.CV 57%

Instance-Level Composed Image Retrieval

实例级组合图像检索

Bill Psomas, George Retsinas, Nikos Efthymiadis, Panagiotis Filntisis, Yannis Avrithis, Petros Maragos, Ondrej Chum, Giorgos Tolias

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 BASIC通过无训练方法利用预训练视觉-语言模型,在实例级组合图像检索中实现了新的状态。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18331 2025-12-10 cs.CV 57%

End-to-End Fine-Tuning of 3D Texture Generation using Differentiable Rewards

使用可微奖励对3D纹理生成进行端到端微调

AmirHossein Zamani, Tianhao Xie, Amir G. Aghdam, Tiberiu Popa, Eugene Belilovsky

机构 * Mila – Quebec AI Institute(魁北克AI研究所) Concordia University(康科迪亚大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种端到端的可微框架,通过可微奖励函数优化3D纹理生成,提升对3D结构的理解和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24387 2025-12-05 cs.CV 57%

CoCoIns: Consistent Subject Generation via Contrastive Instantiated Concepts

CoCoIns: 通过对比实例概念实现一致主体生成

Lee Hsin-Ying, Kelvin C. K. Chan, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CoCoIns通过对比学习实现一致主体生成,提升多生成内容的一致性与灵活性。

Comments TMLR 2025. Project page: https://contrastive-concept-instantiation.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17793 2025-12-05 cs.CV cs.AI 57%

SYNTHIA: Novel Concept Design with Affordance Composition

SYNTHIA:基于功能连贯性的新型概念设计

Hyeonjeong Ha, Xiaomeng Jin, Jeonghwan Kim, Jiateng Liu, Zhenhailong Wang, Khanh Duy Nguyen, Ansel Blume, Nanyun Peng, Kai-Wei Chang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 SYNTHIA通过分层概念本体和课程学习方案,实现基于功能连贯性的新颖设计生成。

Comments ACL 2025 Main, Code is available https://github.com/HyeonjeongHa/SYNTHIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03534 2025-12-04 cs.CV cs.AI 57%

Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generation

重新思考推理时的提示设计以实现文本到视觉生成的扩展

Subin Kim, Sangwoo Mo, Mamshad Nayeem Rizve, Yiran Xu, Difan Liu, Jinwoo Shin, Tobias Hinz

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 PRIS通过自适应修改提示以实现文本到视觉生成的推理时扩展,提高生成质量并解决提示固定导致的质量停滞问题。

Comments Visualizations are available at the website: https://subin-kim-cv.github.io/PRIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22943 2025-12-01 cs.CL cs.CV 57%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01008 2025-12-01 cs.CV cs.AI 57%

IntrinsiX: High-Quality PBR Generation using Image Priors

IntrinsiX: 基于图像先验的高质量PBR生成

Peter Kocsis, Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 IntrinsiX通过图像先验生成高质量PBR图像,提升内容创作中的重新照明和纹理生成能力。

Comments Project page: https://peter-kocsis.github.io/IntrinsiX/ Video: https://youtu.be/b0wVA44R93Y

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13575 2025-11-18 cs.CV cs.AI 57%

Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification

Linhan Zhou, Shuang Li, Neng Dong, Yonghang Tai, Yafei Zhang, Huafeng Li

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 9 pages, 4 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12331 2025-11-18 cs.CV 57%

SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models

Sepehr Kazemi Ranjbar, Kumail Alhamoud, Marzyeh Ghassemi

机构 * MIT(麻省理工学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17482 2025-11-13 cs.LG cs.AI cs.CV cs.HC 57%

What's Producible May Not Be Reachable: Measuring the Steerability of Generative Models

Keyon Vafa, Sarah Bentley, Jon Kleinberg, Sendhil Mullainathan

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) Cornell University(康奈尔大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01184 2025-11-07 cs.CV cs.LG 57%

Bridging Generative and Discriminative Noisy-Label Learning via Direction-Agnostic EM Formulation

Fengbei Liu, Chong Wang, Yuanhong Chen, Yuyuan Liu, Gustavo Carneiro

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) Department of Radiology, Stanford University(斯坦福大学放射科) Oxford University(牛津大学) Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(视觉、语音和信号处理中心(CVSSP)、塞维利亚大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00159 2025-11-04 cs.CV 57%

SonarSplat: Novel View Synthesis of Imaging Sonar via Gaussian Splatting

Advaith V. Sethuraman, Max Rucker, Onur Bagoren, Pou-Chun Kung, Nibarkavi N. B. Amutha, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01163 2025-11-04 cs.CV 57%

ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation

Yongyuan Liang, Wei Chow, Feng Li, Ziqiao Ma, Xiyao Wang, Jiageng Mao, Jiuhai Chen, Jiatao Gu, Yue Wang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Pennsylvania(宾夕法尼亚大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Michigan(密歇根大学) University of Southern California(南加州大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments Project Page: https://roverbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24278 2025-10-29 cs.CV cs.AI 57%

Training-free Source Attribution of AI-generated Images via Resynthesis

Pietro Bongini, Valentina Molinari, Andrea Costanzo, Benedetta Tondi, Mauro Barni

机构 * University of Siena, Department of Information Engineering and Mathematics(锡耶纳大学信息工程与数学系) IMT School(IMT学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 14 pages, 4 figures, 1 table, accepted at "The 17th IEEE INTERNATIONAL WORKSHOP ON INFORMATION FORENSICS AND SECURITY (WIFS2025)", Perth, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07555 2025-10-28 cs.CV cs.AI 57%

Synthesize Privacy-Preserving High-Resolution Images via Private Textual Intermediaries

Haoxiang Wang, Zinan Lin, Da Yu, Huishuai Zhang

机构 * Peking University(北京大学) Microsoft Research(微软研究院) Google Research(谷歌研究院) Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09744 2025-10-28 cs.CV 57%

RealCustom++: Representing Images as Real Textual Word for Real-Time Customization

Zhendong Mao, Mengqi Huang, Fei Ding, Mingcong Liu, Qian He, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance Inc(字节跳动公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 18 pages

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏