arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-18 至 2025-11-18 共收录 133 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2511.13002 2025-11-18 cs.CV 88%

Infinite-Story: A Training-Free Consistent Text-to-Image Generation

Jihun Park, Kyoungmin Lee, Jongmin Gim, Hyeonseo Jo, Minseok Oh, Wonhyeok Choi, Kyumin Hwang, Jaeyeul Kim, Minwoo Choi, Sunghoon Im

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Comments 18pages, 13 figures, AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16862 2025-11-18 cs.CV 85%

Conditional Panoramic Image Generation via Masked Autoregressive Modeling

Chaoyang Wang, Xiangtai Li, Lu Qi, Xiaofan Lin, Jinbin Bai, Qianyu Zhou, Yunhai Tong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Insta360 Research(Insta360研究院) National University of Singapore(新加坡国立大学) The University of Tokyo(东京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11780 2025-11-18 cs.CV cs.AI 85%

Image-POSER: Reflective RL for Multi-Expert Image Generation and Editing

Hossein Mohebbi, Mohammed Abdulrahman, Yanting Miao, Pascal Poupart, Suraj Kothawade

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) Google(谷歌)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10089 2025-11-18 cs.LG cs.AI 78%

T2IBias: Uncovering Societal Bias Encoded in the Latent Space of Text-to-Image Generative Models

Abu Sufian, Cosimo Distante, Marco Leo, Hanan Salam

机构 * National Research Council of Italy - Institute of Applied Sciences

专题命中 文生图 :text-to-image(title,abstract)

Comments This manuscript has been accepted for presentation in the First Interdisciplinary Workshop on Responsible AI for Value Creation. Dec 1, Copenhagen. The final version will be submitted for inclusion in a Springer LNCS Volume. (The paper is 15 pages with 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13713 2025-11-18 cs.CV 77%

Free-Form Scene Editor: Enabling Multi-Round Object Manipulation like in a 3D Engine

Xincheng Shuai, Zhenyuan Qin, Henghui Ding, Dacheng Tao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments AAAI 2026, Project Page: https://henghuiding.com/FFSE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12956 2025-11-18 cs.CV cs.CR 70%

T2I-Based Physical-World Appearance Attack against Traffic Sign Recognition Systems in Autonomous Driving

Chen Ma, Ningfei Wang, Junhao Zheng, Qing Guo, Qian Wang, Qi Alfred Chen, Chao Shen

机构 * Xi’an Jiaotong University(西安交通大学) University of California, Irvine(加州大学 Irvine 分校) Nankai University(南开大学) Wuhan University(武汉大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12002 2025-11-18 cs.LG cs.CV 70%

Selecting Fine-Tuning Examples by Quizzing VLMs

Tenghao Ji, Eytan Adar

机构 * University of Michigan(密歇根大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13575 2025-11-18 cs.CV cs.AI 57%

Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification

Linhan Zhou, Shuang Li, Neng Dong, Yonghang Tai, Yafei Zhang, Huafeng Li

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments 9 pages, 4 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12331 2025-11-18 cs.CV 57%

SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models

Sepehr Kazemi Ranjbar, Kumail Alhamoud, Marzyeh Ghassemi

机构 * MIT(麻省理工学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2511.12151 2025-11-18 cs.CV 83%

FIA-Edit: Frequency-Interactive Attention for Efficient and High-Fidelity Inversion-Free Text-Guided Image Editing

Kaixiang Yang, Boyang Shen, Xin Li, Yuchen Dai, Yuxuan Luo, Yueran Ma, Wei Fang, Qiang Li, Zhiwei Wang

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12267 2025-11-18 cs.CV 57%

ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks

Ruixun Liu, Bowen Fu, Jiayi Song, Kaiyu Li, Wanchen Li, Lanxuan Xue, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) China Telecom Shaanxi Branch(中国电信陕西分公司)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07938 2025-11-18 cs.LG cs.CV stat.ME 57%

CAD-VAE: Leveraging Correlation-Aware Latents for Comprehensive Fair Disentanglement

Chenrui Ma, Xi Xiao, Tianyang Wang, Xiao Wang, Yanning Shen

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12174 2025-11-18 cs.LG 50%

TSGDiff: Rethinking Synthetic Time Series Generation from a Pure Graph Perspective

Lifeng Shen, Xuyang Li, Lele Long

专题命中 图像编辑 :diffusion(abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 87 篇

2408.00998 2025-11-18 cs.CV cs.AI 87%

FBSDiff: Plug-and-Play Frequency Band Substitution of Diffusion Features for Highly Controllable Text-Driven Image Translation

Xiang Gao, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Accepted conference paper of ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05772 2025-11-18 cs.CV 83%

MAISI-v2: Accelerated 3D High-Resolution Medical Image Synthesis with Rectified Flow and Region-specific Contrastive Loss

Can Zhao, Pengfei Guo, Dong Yang, Yucheng Tang, Yufan He, Benjamin Simon, Mason Belue, Stephanie Harmon, Baris Turkbey, Daguang Xu

专题命中 扩散模型 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06157 2025-11-18 cs.CV 83%

3D-free meets 3D priors: Novel View Synthesis from a Single Image with Pretrained Diffusion Guidance

Taewon Kang, Divya Kothandaraman, Dinesh Manocha, Ming C. Lin

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted to The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26), AAAI 2026 Workshop on AI for Environmental Science (AI4ES). Due to arXiv's 1,920-character limit, the abstract here is shortened. Please refer to the paper (View PDF) to read the full abstract. 14 pages, 13 figures, v5: AAAI-26 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03457 2025-11-18 cs.GR cs.CV cs.SD eess.AS 81%

READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation

Haotian Wang, Yuzhe Weng, Jun Du, Haoran Xu, Xiaoyan Wu, Shan He, Bing Yin, Cong Liu, Jianqing Gao, Qingfeng Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Comments Project page: https://readportrait.github.io/READ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12280 2025-11-18 cs.CV cs.CL cs.LG 80%

D$^{3}$ToM: Decider-Guided Dynamic Token Merging for Accelerating Diffusion MLLMs

Shuochen Chang, Xiaofeng Zhang, Qingyang Liu, Li Niu

机构 * Project leader(项目负责人)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by AAAI Conference on Artificial Intelligence (AAAI) 2026. Code available at https://github.com/bcmi/D3ToM-Diffusion-MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13121 2025-11-18 cs.CV 79%

CloseUpShot: Close-up Novel View Synthesis from Sparse-views via Point-conditioned Diffusion Model

Yuqi Zhang, Guanying Chen, Jiaxing Chen, Chuanyu Fu, Chuan Huang, Shuguang Cui

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院(FNii-深圳)) Chinese University of Hong Kong at Shenzhen (CUHKSZ)(香港中文大学(深圳)) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Project Link: https://zyqz97.github.io/CloseUpShot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12757 2025-11-18 cs.CV cs.AI 79%

Which Way from B to A: The role of embedding geometry in image interpolation for Stable Diffusion

Nicholas Karris, Luke Durell, Javier Flores, Tegan Emerson

机构 * Department of Mathematics University of California, San Diego(数学系 加州大学圣地亚哥分校) National Security Directorate Pacific Northwest National Laboratory(国家安全局 西部国家实验室) Earth and Biological Sciences Directorate Pacific Northwest National Laboratory(地球与生命科学局 西部国家实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12428 2025-11-18 cs.CV 79%

RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning

Jingqi Xu, Jingxi Lu, Chenghao Li, Sreetama Sarkar, Souvik Kundu, Peter A. Beerel

机构 * University of Southern California(南加州大学) Intel Labs(英特尔实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12304 2025-11-18 cs.CV 79%

LiDAR-GS++:Improving LiDAR Gaussian Reconstruction via Diffusion Priors

Qifeng Chen, Jiarun Liu, Rengan Xie, Tao Tang, Sicong Du, Yiru Zhao, Yuchi Huo, Sheng Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14741 2025-11-18 cs.CV cs.AI 79%

DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models

Simone Carnemolla, Matteo Pennisi, Sarinda Samarasinghe, Giovanni Bellitto, Simone Palazzo, Daniela Giordano, Mubarak Shah, Concetto Spampinato

机构 * University of Catania(卡塔尼亚大学) University of Central Florida(中央佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11334 2025-11-18 cs.CV 79%

GANDiff FR: Hybrid GAN Diffusion Synthesis for Causal Bias Attribution in Face Recognition

Md Asgor Hossain Reaj, Rajan Das Gupta, Md Yeasin Rahat, Nafiz Fahad, Md Jawadul Hasan, Tze Hui Liew

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00652 2025-11-18 cs.CV cs.CR 79%

Video Signature: Implicit Watermarking for Video Diffusion Models

Yu Huang, Junhao Chen, Shuliang Liu, Hanqian Li, Jungang Li, Qi Zheng, Aiwei Liu, Yi R. Fung, Xuming Hu

机构 * AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能 thrust) Hong Kong University of Science and Technology(香港科学与技术大学) School of Software, BNRist, Tsinghua University(清华大学软件学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11777 2025-11-18 cs.CV 79%

Self-NPO: Data-Free Diffusion Model Enhancement via Truncated Diffusion Fine-Tuning

Fu-Yun Wang, Keqiang Sun, Yao Teng, Xihui Liu, Jiale Yuan, Jiaming Song, Hongsheng Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21385 2025-11-18 cs.CV 79%

Physics-Guided Image Dehazing Diffusion

Shijun Zhou, Xing Xie, Baojie Fan, Jiandong Tian

机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人与智能系统国家重点实验室) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Nanjing University of Posts and Telecommunications(南京邮电大学自动化系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17347 2025-11-18 cs.CV 79%

Dereflection Any Image with Diffusion Priors and Diversified Data

Jichen Hu, Chen Yang, Zanwei Zhou, Jiemin Fang, Xiaokang Yang, Qi Tian, Wei Shen

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12015 2025-11-18 cs.CV 79%

QDM: Quadtree-Based Region-Adaptive Sparse Diffusion Models for Efficient Image Super-Resolution

Donglin Yang, Paul Vicol, Xiaojuan Qi, Renjie Liao, Xiaofan Zhang

机构 * The University of Hong Kong(香港大学) Google DeepMind(谷歌DeepMind) The University of British Columbia(不列颠哥伦比亚大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00620 2025-11-18 cs.CV 79%

Lane Graph Extraction from Aerial Imagery via Lane Segmentation Refinement with Diffusion Models

Antonio Ruiz, Andrew Melnik, Nicolo Savioli, Dong Wang, Yanfeng Zhang, Helge Ritter

机构 * Riemann Lab , Huawei(里曼实验室,华为) Center for Cognitive Interaction Technology (CITEC), Faculty of Technology, Bielefeld University(认知交互技术中心(CITEC),技术学院,比勒菲尔德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Journal ref Remote Sensing, 17(16), 2845

详情

展开后加载摘要…

URL PDF HTML 收藏