arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-02 至 2025-12-02 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2512.00473 2025-12-02 cs.CV cs.AI 89%

RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards

RealGen:通过检测器引导的奖励实现逼真文本到图像生成

Junyan Ye, Leiqi Zhu, Yuncheng Guo, Dongzhi Jiang, Zilong Huang, Yifan Zhang, Zhiyuan Yan, Haohuan Fu, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Sun Yat-Sen University(中山大学) Nanjing University(南京大学) CUHK MMLab(香港中文大学多模态实验室) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 RealGen通过检测器引导的奖励机制提升文本到图像生成的真实感和细节,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20518 2025-12-02 cs.CV 88%

Dynamic Attention Analysis for Backdoor Detection in Text-to-Image Diffusion Models

文本到图像扩散模型中后门检测的动态注意力分析

Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS), Beijing 100190, China, and also with the University of Chinese Academy of Sciences (UCAS), Beijing 100049, China(中国科学院人工智能安全重点实验室,计算技术研究所(ICT),中国科学院(CAS),北京100190,中国,以及中国科学院大学(UCAS),北京100049,中国)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出动态注意力分析方法,通过分析扩散模型中注意力图的动态演变,有效检测文本到图像扩散模型中的后门攻击。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00743 2025-12-02 cs.CV 86%

Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards

多组GRPO:基于树状轨迹和多奖励的文本到图像生成多组优势估计

Qiang Lyu, Zicong Chen, Chongxiao Wang, Haolin Shi, Shibo Gao, Ran Piao, Youwei Zeng, Jianlou Si, Fei Ding, Jing Li, Chun Pong Lau, Weiqiang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Beihang University(北航) Alibaba Group(阿里巴巴集团) Beijing Jiaotong University(北京交通大学) TikTok Inc.(TikTok公司) City University of Hong Kong(香港城市大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 Multi-GRPO通过树状轨迹和多奖励分组机制,提升文本到图像生成的稳定性和多目标对齐性能。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07863 2025-12-02 cs.CV cs.LG cs.MM 73%

VIVAT: Virtuous Improving VAE Training through Artifact Mitigation

VIVAT: 通过抑制伪影改进VAE训练

Lev Novitskiy, Viacheslav Vasilev, Maria Kovaleva, Vladimir Arkhipkin, Denis Dimitrov

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 VIVAT通过抑制VAE训练中的常见伪影,提升图像重建和生成质量,实现更优的PSNR、SSIM和CLIP分数表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00557 2025-12-02 cs.CV 70%

NeuroVolve: Evolving Visual Stimuli toward Programmable Neural Objectives

NeuroVolve:通过可编程神经目标演化视觉刺激

Haomiao Chen, Keith W Jamison, Mert R. Sabuncu, Amy Kuceyeski

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔医学院)

专题命中 文生图 :image editing(abstract);image synthesis(abstract);分类 cs.CV

AI总结 NeuroVolve通过可编程神经目标生成视觉刺激,揭示大脑区域间的协同与对抗性调节关系,实现脑引导的图像编辑与首选刺激生成的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05068 2025-12-02 cs.CV cs.AI cs.CR 70%

ICAS: Detecting Training Data from Autoregressive Image Generative Models

ICAS: 从自回归图像生成模型中检测训练数据

Hongyao Yu, Yixiang Qiu, Yiheng Yang, Hao Fang, Tianqu Zhuang, Jiaxin Hong, Bin Chen, Hao Wu, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院) Shenzhen ShenNong Information Technology Co., Ltd.(深圳深农信息技术有限公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ICAS通过隐含分类和自适应得分聚合策略,从自回归图像生成模型中检测训练数据,揭示了大型模型的脆弱性,并展示了在不同场景下的有效性。

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12048 2025-12-02 cs.AI cs.HC cs.LG 67%

A Survey on Bridging EEG Signals and Generative AI: From Image and Text to Beyond

关于将EEG信号与生成式AI连接的综述:从图像和文本到更广泛的领域

Shreya Shukla, Jose Torres, Akshaj Murhekar, Christina Liu, Abhijit Mishra, Jacek Gwizdka, Shounak Roychowdhury

机构 * School of Information, The University of Texas at Austin, Austin, TX, USA(信息学院,德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本综述探讨了将EEG信号转化为图像、文本和音频的生成式AI方法,分析了当前技术趋势与挑战,为未来研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏