arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-01 至 2025-12-01 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2511.18742 2025-12-01 cs.CV cs.AI cs.LG 92%

ProxT2I: Efficient Reward-Guided Text-to-Image Generation via Proximal Diffusion

ProxT2I:通过近端扩散实现高效的奖励引导文本到图像生成

Zhenghan Fang, Jian Zheng, Qiaozi Gao, Xiaofeng Gao, Jeremias Sulam

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ProxT2I通过近端扩散和奖励引导方法,提升文本到图像生成的效率和人类偏好对齐,实现高效且轻量的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22245 2025-12-01 cs.CV 88%

Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models

语义锚定用于文本到图像扩散模型中的稳健个性化

Seoyun Yang, Gihoon Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 通过语义锚定方法,文本到图像扩散模型在有限参考图像中实现稳健个性化,平衡主题保真度与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12932 2025-12-01 cs.CV 86%

Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes

Text2Traffic: 一种用于交通场景的文本到图像生成与编辑方法

Feng Lv, Haoxuan Feng, Zilu Zhang, Chunlong Xia, Yanfeng Li

机构 * Baidu(百度) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文提出了一种统一的文本驱动框架,通过可控掩码机制和多视角数据增强,提升交通场景中文本到图像生成与编辑的保真度和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22119 2025-12-01 cs.CV 83%

PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and Fuzz Optimization

PROMPTMINER: 通过强化学习和模糊优化对文本到图像生成模型进行黑盒提示窃取

Mingzhe Li, Renhao Zhang, Zhiyang Wen, Siqi Pan, Bruno Castro da Silva, Juan Zhai, Shiqing Ma

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 PROMPTMINER通过强化学习和模糊优化实现文本到图像生成模型的黑盒提示窃取,有效恢复图像生成提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22982 2025-12-01 cs.CV cs.AI 70%

Ovis-Image Technical Report

Ovis-Image 技术报告

Guo-Hua Wang, Liangfu Cao, Tianyu Cui, Minghao Fu, Xiaohao Chen, Pengxin Zhan, Jianshan Zhao, Lan Li, Bowen Fu, Jiaqi Liu, Qing-Guo Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Ovis-Image 是一个70亿参数的文本到图像模型,通过优化的多模态主干和文本聚焦训练方法,在紧凑架构下实现与大型开源模型相当的文本渲染性能。

Comments Code is released at https://github.com/AIDC-AI/Ovis-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04675 2025-12-01 cs.CV 70%

InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation

InfinityStar: 一种统一的时空自回归模型用于视觉生成

Jinlai Liu, Jian Han, Bin Yan, Hui Wu, Fengda Zhu, Xing Wang, Yi Jiang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 InfinityStar是一种统一的时空自回归模型,能够高效生成高分辨率图像和动态视频,其在VBench上的表现优于现有自回归模型,且生成速度显著快于扩散方法。

Comments NeurIPS 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22943 2025-12-01 cs.CL cs.CV 57%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01008 2025-12-01 cs.CV cs.AI 57%

IntrinsiX: High-Quality PBR Generation using Image Priors

IntrinsiX: 基于图像先验的高质量PBR生成

Peter Kocsis, Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 IntrinsiX通过图像先验生成高质量PBR图像,提升内容创作中的重新照明和纹理生成能力。

Comments Project page: https://peter-kocsis.github.io/IntrinsiX/ Video: https://youtu.be/b0wVA44R93Y

详情

展开后加载摘要…

URL PDF HTML 收藏