arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-09-30 至 2025-09-30 共收录 173 信号源:cs.CV, cs.GR, cs.MM

1. 图像修复 3 篇

2509.23082 2025-09-30 cs.CV 79%

Follow-Your-Preference: Towards Preference-Aligned Image Inpainting

Yutao Shen, Junkun Yuan, Toru Aonishi, Hideki Nakayama, Yue Ma

机构 * The University of Tokyo(东京大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

Comments 16 pages,9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19838 2025-09-30 cs.CV 57%

SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution

Liangbin Xie, Yu Li, Shian Du, Menghan Xia, Xintao Wang, Fanghua Yu, Ziyan Chen, Pengfei Wan, Jiantao Zhou, Chao Dong

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学物联网智能城市国家重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Tsinghua University(清华大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24924 2025-09-30 eess.AS 50%

SAGA-SR: Semantically and Acoustically Guided Audio Super-Resolution

Jaekwon Im, Juhan Nam

专题命中 图像修复 :diffusion(abstract)

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 个性化与一致性 8 篇

2506.06802 2025-09-30 cs.CV 88%

Training-Free Diffusion Framework for Stylized Image Generation with Identity Preservation

Mohammad Ali Rezaei, Helia Hajikazem, Saeed Khanehgir, Mahdi Javanmardi

机构 * Computer Vision Group, Part AI Research Center(部分人工智能研究中心计算机视觉组) Department of Computer Engineering, Amirkabir University of Technology(阿米卡比尔技术大学计算机工程系)

专题命中 个性化与一致性 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04421 2025-09-30 cs.CV cs.AI cs.LG 79%

Disentangling Regional Primitives for Image Generation

Zhengting Chen, Lei Cheng, Lianghui Ding, Liang Lin, Quanshi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23924 2025-09-30 cs.CL cs.AI 78%

Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step

Jingyi Yang, Guanxu Chen, Xuhao Hu, Jing Shao

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 个性化与一致性 :diffusion(title,abstract)

Comments 10 pages, 4 figures, 7 tables. Code: https://github.com/yjyddq/EOSER-ASS-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25058 2025-09-30 cs.GR cs.CV 62%

CharGen: Fast and Fluent Portrait Modification

Jan-Niklas Dihlmann, Arnela Killguss, Hendrik P. A. Lensch

机构 * University of Tübingen Germany(图宾根大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Project page: https://chargen.jdihlmann.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25172 2025-09-30 cs.CV cs.LG 57%

Personalized Vision via Visual In-Context Learning

Yuxin Jiang, Yuchao Gu, Yiren Song, Ivor Tsang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) A*STAR, Singapore(新加坡科技研究局)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments Project page: https://yuxinn-j.github.io/projects/PICO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24878 2025-09-30 cs.CV cs.RO 57%

ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation

Jiuhong Xiao, Roshan Nayak, Ning Zhang, Daniel Tortei, Giuseppe Loianno

机构 * New York University(纽约大学) Technology Innovation Institute(技术创新研究所) University of California, Berkeley(加州大学伯克利分校)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

Comments 23 pages including the checklist and appendix. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23878 2025-09-30 cs.SD cs.AI cs.MM eess.AS 57%

Disentangling Score Content and Performance Style for Joint Piano Rendering and Transcription

Wei Zeng, Junchuan Zhao, Ye Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10678 2025-09-30 cs.GR 57%

T2Bs: Text-to-Character Blendshapes via Video Generation

Jiahao Luo, Chaoyang Wang, Michael Vasilkovsky, Vladislav Shakhrai, Di Liu, Peiye Zhuang, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee, James Davis, Jian Wang

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像生成评测 4 篇

2509.24427 2025-09-30 cs.CV 57%

UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark

Ailing Zhang, Lina Lei, Dehong Kong, Zhixin Wang, Jiaqi Xu, Fenglong Song, Chun-Le Guo, Chang Liu, Fan Li, Jie Chen

机构 * Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Nankai University(南开大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Tsinghua University(清华大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09881 2025-09-30 cs.CV 57%

Counterfactual Visual Explanation via Causally-Guided Adversarial Steering

Yiran Qiao, Disheng Liu, Yiren Lu, Yu Yin, Mengnan Du, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15963 2025-09-30 cs.CV cs.CL 57%

OViP: Online Vision-Language Preference Learning for VLM Hallucination

Shujun Liu, Siyuan Wang, Zejun Li, Jianxiang Wang, Cheng Zeng, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) ByteDance(字节跳动)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12795 2025-09-30 cs.AI cs.LG 50%

FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization

Shibo Hong, Jiahao Ying, Haiyuan Liang, Mengdi Zhang, Jun Kuang, Jiazheng Zhang, Yixin Cao

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) Meituan Group(美团集团) School of Computer Science, Singapore Management University(新加坡管理学院)

专题命中 图像生成评测 :image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 8 篇

2503.09641 2025-09-30 cs.GR 85%

SANA-Sprint: One-Step Diffusion with Continuous-Time Consistency Distillation

Junsong Chen, Shuchen Xue, Yuyang Zhao, Jincheng Yu, Sayak Paul, Junyu Chen, Han Cai, Song Han, Enze Xie

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.GR

Comments 22 pages, 11 figures, 8 tables, In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24416 2025-09-30 cs.CV cs.AI 83%

CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers

Kai Liu, Shaoqiu Zhang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures. Code is released at https://github.com/Kai-Liu001/CLQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25161 2025-09-30 cs.CV 74%

Rolling Forcing: Autoregressive Long Video Diffusion in Real Time

Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

Comments Project page: https://kunhao-liu.github.io/Rolling_Forcing_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25182 2025-09-30 cs.CV cs.AI 57%

DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder

Junyu Chen, Wenkun He, Yuchao Gu, Yuyang Zhao, Jincheng Yu, Junsong Chen, Dongyun Zou, Yujun Lin, Zhekai Zhang, Muyang Li, Haocheng Xi, Ligeng Zhu, Enze Xie, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Tech Report. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24142 2025-09-30 cs.CV 57%

Asymmetric VAE for One-Step Video Super-Resolution Acceleration

Jianze Li, Yong Guo, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10774 2025-09-30 cs.CV cs.AI cs.LG 57%

BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation

Youping Gu, Xiaolong Li, Yuhao Hu, Minqi Chen, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Central Media Technology Institute, Huawei Technologies(华为技术有限公司中央媒体技术研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10188 2025-09-30 cs.LG cs.AI 50%

Efficient Generative Model Training via Embedded Representation Warmup

Deyuan Liu, Peng Sun, Xufeng Li, Tao Lin

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 效率与蒸馏 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00611 2025-09-30 cs.DC 50%

StarTrail: Concentric Ring Sequence Parallelism for Efficient Near-Infinite-Context Transformer Model Training

Ziming Liu, Shaoyu Wang, Shenggan Cheng, Zhongkai Zhao, Kai Wang, Xuanlei Zhao, James Demmel, Yang You

专题命中 效率与蒸馏 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏