arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1207 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1207 篇

2309.09537 2025-01-16 cs.SI cs.AI 78%

Towards a performance characteristic curve for model evaluation: an application in information diffusion prediction

Wenjin Xie, Xiaomeng Wang, Radosław Michalski, Tao Jia

专题命中 图像生成评测 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13989 2024-12-19 cs.CL 78%

What makes a good metric? Evaluating automatic metrics for text-to-image consistency

Candace Ross, Melissa Hall, Adriana Romero Soriano, Adina Williams

专题命中 图像生成评测 :text-to-image(title,abstract)

Comments Accepted and presented at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11867 2024-10-25 q-bio.NC 78%

A psychophysical evaluation of techniques for Mooney image generation

Lars C. Reining, Thomas S. A. Wallis

专题命中 图像生成评测 :image generation(title,abstract)

Journal ref PeerJ 12:e18059 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00105 2024-09-05 cs.CL cs.AI cs.LG 78%

Negation Blindness in Large Language Models: Unveiling the NO Syndrome in Image Generation

Mohammad Nadeem, Shahab Saquib Sohail, Erik Cambria, Björn W. Schuller, Amir Hussain

专题命中 图像生成评测 :image generation(title,abstract)

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09956 2024-07-18 cs.SD cs.AI cs.CL eess.AS 78%

Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization

Navonil Majumder, Chia-Yu Hung, Deepanway Ghosal, Wei-Ning Hsu, Rada Mihalcea, Soujanya Poria

专题命中 图像生成评测 :diffusion(title,abstract)

Comments Accepted at ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03560 2024-06-07 physics.med-ph 78%

Anatomy-based quality metric of diffusion-weighted MRI data for accurate derivation of muscle fiber orientation

Nadya Shusharina, Xiaofeng Liu, Evangelia Kaza, Miranda Lam, Stephan Maier, Jonghye Woo

专题命中 图像生成评测 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11989 2023-02-24 cs.SD cs.CL eess.AS 78%

Metric-oriented Speech Enhancement using Diffusion Probabilistic Model

Chen Chen, Yuchen Hu, Weiwei Weng, Eng Siong Chng

专题命中 图像生成评测 :diffusion(title,abstract)

Comments Accepted by ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.06816 2020-12-15 cs.SI cs.NI 78%

Evaluation and Comparison of Diffusion Models with Motif Features

Fangqi Li

专题命中 图像生成评测 :diffusion(title,abstract)

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.00271 2020-07-23 stat.ML cs.LG 78%

Generative Modeling by Inclusive Neural Random Fields with Applications in Image Generation and Anomaly Detection

Yunfu Song, Zhijian Ou

专题命中 图像生成评测 :image generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19341 2026-08-11 cs.CV 版本更新 77%

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

ExpertVerse:知识密集型视觉合成中专家级推理的通用基准

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Jiaxuan Luo, Xuetao Feng, Xiaoyong Zhu

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08841 2026-06-09 cs.AI cs.CV 新提交 77%

ZIPP:Zero-shot Image Personalization from Personas

ZIPP:基于人物画像的零样本图像个性化生成

Harini SI, Somesh Singh, Yaman Kumar Singla, David Doermann, Rajiv Ratn Shah

机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究(MDSR)) IIIT-Delhi(德里印度理工学院) SUNY at Buffalo(纽约州立大学布法罗分校)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出ZIPP方法,利用自然语言人物画像通过LLM改写提示词实现零样本图像个性化生成,无需用户数据或微调;引入ZIPBench基准,在多个评测中取得13-20%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08063 2026-05-26 cs.CV cs.AI 77%

Flow-OPD: On-Policy Distillation for Flow Matching Models

Flow-OPD:面向流匹配模型的在线策略蒸馏

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 图像生成评测 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 提出Flow-OPD框架,通过两阶段对齐策略(单奖励GRPO微调专家+流式冷启动与在线策略蒸馏)解决流匹配模型在多任务对齐中的奖励稀疏和梯度干扰问题,并引入流形锚点正则化抑制美学退化,在GenEval和OCR指标上显著提升。

Comments Project Page: https://costaliya.github.io/Flow-OPD/ , Code: https://github.com/CostaliyA/Flow-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07210 2026-04-09 cs.CV 77%

VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis

VersaVogue: 视觉专家协作与偏好对齐的统一时尚合成

Jian Yu, Fei Shen, Cong Wang, Yi Xin, Si Shen, Xiaoyu Du, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Nanjing Forestry University(南京林业大学)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出VersaVogue框架,通过 trait-routing attention 模块和自动化多视角偏好优化管道,实现多条件可控的时尚合成,提升视觉真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12575 2026-04-07 cs.CV cs.AI 77%

BalancedDPO: Adaptive Multi-Metric Alignment

BalancedDPO:适应性多指标对齐

Dipesh Tamboli, Souradip Chakraborty, Aditya Malusare, Biplab Banerjee, Amrit Singh Bedi, Vaneet Aggarwal

机构 * Purdue University(普渡大学) University of Maryland(马里兰大学) Indian Institute of Technology Bombay(印度理工学院孟买分校) University of Central Florida(中佛罗里达大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 BalancedDPO通过多指标共识和动态参考模型更新,在DPO框架中实现多指标偏好对齐,提升模型在不同评估标准下的稳定性与性能。

Comments Transactions on Machine Learning Research, Apr 2026

Journal ref Transactions on Machine Learning Research, Apr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20629 2026-03-17 cs.CV cs.AI cs.LG 77%

MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models

MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿

Chieh-Yun Chen, Zhonghao Wang, Qi Chen, Zhifan Ye, Min Shi, Yue Zhao, Yinan Zhao, Hui Qu, Wei-An Lin, Yiru Shen, Ajinkya Kale, Irfan Essa, Humphrey Shi

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。

Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23023 2025-10-28 cs.CV cs.CL 77%

UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization

Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology(计算机技术研究所)

专题命中 图像生成评测 :text-to-image(abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04712 2025-10-07 cs.CV cs.LG 77%

SEE-DPO: Self Entropy Enhanced Direct Preference Optimization

Shivanshu Shekhar, Shreyas Singh, Tong Zhang

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fractal AI Research(Fractal AI研究院)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18985 2025-09-16 cs.LG cs.CL cs.CV 77%

STRICT: Stress Test of Rendering Images Containing Text

Tianyu Zhang, Xinyu Wang, Lu Li, Zhenghan Tai, Jijun Chi, Jingrui Tian, Hailin He, Suyuchen Wang

机构 * Mila, University of Montreal(蒙特利尔大学Mila) McGill University(麦吉尔大学) University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) University of California, Los Angeles(加州大学洛杉矶分校) Southwestern University of Finance and Economics(西南财经大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04485 2024-11-12 cs.AI cs.CV 77%

GenAI Arena: An Open Evaluation Platform for Generative Models

Dongfu Jiang, Max Ku, Tianle Li, Yuansheng Ni, Shizhuo Sun, Rongqi Fan, Wenhu Chen

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments 9 pages,7 figures

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01545 2024-11-05 cs.CV 77%

Towards Small Object Editing: A Benchmark Dataset and A Training-Free Approach

Qihe Pan, Zhen Zhao, Zicheng Wang, Sifan Long, Yiming Wu, Wei Ji, Haoran Liang, Ronghua Liang

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments 9 pages, 8 figures, Accepted by ACMMM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11904 2024-10-16 cs.CV cs.AI 77%

Finding the Subjective Truth: Collecting 2 Million Votes for Comprehensive Gen-AI Model Evaluation

Dimitrios Christodoulou, Mads Kuhlmann-Jørgensen

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12579 2024-07-18 cs.CV cs.AI 77%

The Fabrication of Reality and Fantasy: Scene Generation with LLM-Assisted Prompt Interpretation

Yi Yao, Chan-Feng Hsu, Jhe-Hao Lin, Hongxia Xie, Terence Lin, Yi-Ning Huang, Hong-Han Shuai, Wen-Huang Cheng

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15504 2024-02-26 cs.CV cs.AI 77%

Gen4Gen: Generative Data Pipeline for Generative Multi-Concept Composition

Chun-Hsiao Yeh, Ta-Ying Cheng, He-Yen Hsieh, Chuan-En Lin, Yi Ma, Andrew Markham, Niki Trigoni, H. T. Kung, Yubei Chen

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments Preprint; Project Page: https://danielchyeh.github.io/Gen4Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26860 2026-07-30 cs.LG 新提交 75%

Amortized Moment Matching for Visual Generation

用于视觉生成的摊销矩匹配

Wenze Liu, Xintao Wang, Pengfei Wan, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技影幻团队)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 该研究提出摊销矩匹配方法,构建AMFD损失,用于视觉生成,在ImageNet、GenEval等基准上性能优于FD基线及FLUX.2 4B模型,实现高效高维数据生成。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08525 2026-06-16 cs.CV 新提交 74%

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米汽车)

专题命中 图像生成评测 :generative vision(title);分类 cs.CV

AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05214 2026-06-16 eess.IV cs.AI cs.CV 74%

CoRPA: Adversarial Image Generation for Chest X-rays Using Concept Vector Perturbations and Generative Models

CoRPA: 基于概念向量扰动和生成模型的胸部X光图像对抗生成

Amy Rafferty, Rishi Ramaesh, Ajitha Rajan

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) NHS Lothian(NHS洛锡安)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出CoRPA,一种针对医学影像领域的临床聚焦对抗攻击框架,通过概念向量扰动生成对抗性影像报告和图像,揭示医疗AI在真实临床场景下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19712 2026-05-20 cs.CV 74%

Physics-informed simulation framework for realistic sonar image generation and statistical validation

具有物理信息的模拟框架用于真实声纳图像生成和统计验证

Kamal Basha S, Athira Nambiar

机构 * Department of Computational Intelligence, SRM Institute of Science

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出了一种基于物理的模拟框架ACOUSIM,用于生成真实声纳图像并进行统计验证,通过比较合成与真实声纳图像的统计特性,建立了可重复的分布级基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15884 2026-05-11 cs.CV 74%

Contrast-X: A Multi-Modal Contrast Image Synthesis Benchmark and Universal Modality Flow Matching

Contrast-X:一个多模态对比图像合成基准及通用模态流匹配

Yifan Chen, Fei Yin, Hao Chen, Jia Wu, Chao Li

机构 * University of Cambridge(剑桥大学) MD Anderson Cancer Center(MD安德森癌症中心) University of Dundee(邓迪大学)

专题命中 图像生成评测 :image synthesis(title);分类 cs.CV

AI总结 Contrast-X通过多器官CT和乳腺DCE-MRI数据,提出FlowMI模型解决多模态缺失问题,评估合成图像质量及跨器官泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25319 2026-03-27 cs.CV 74%

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

MACRO:通过结构化长上下文数据推进多参考图像生成

Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出MACRO数据集和基准,解决多参考图像生成中参考数量增加导致性能下降的问题,通过结构化长上下文数据提升生成质量。

Comments Project Page: https://macro400k.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05469 2026-03-18 cs.AI cs.CV cs.CY cs.HC 74%

From Image Generation to Infrastructure Design: a Multi-agent Pipeline for Street Design Generation

从图像生成到基础设施设计:一种多智能体管道用于街道设计生成

Chenguang Wang, Xiang Yan, Yilong Dai, Ziyi Wang, Susu Xu

机构 * Johns Hopkins University(约翰霍普金斯大学) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) University of Maryland(马里兰大学)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出一种多智能体系统,直接在真实街道视图上编辑和重新设计自行车设施,整合车道定位、提示优化、设计生成和自动评估,生成符合情境的街道设计。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏