arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 104 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 104 篇

2606.24484 2026-06-24 cs.CV 新提交 57%

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

推进面向艺术字的场景文本识别:数据集与方法

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) South China University of Technology(华南理工大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14297 2026-06-15 cs.CV cs.AI 新提交 57%

Pix2Pix-Hybrid: Structure-Guided Conditional Synthesis of Hajj Crowd Images with Multi-Channel Conditioning and Weak Attribute Supervision

Pix2Pix-Hybrid: 结构引导的多通道条件与弱属性监督的朝觐人群图像条件合成

Amirah F. Alshammari, Bander A. Alzahrani, Nahed A. Alowidi

机构 * King Abdulaziz University(阿卜杜勒阿齐兹国王大学) Jouf University(焦夫大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出Pix2Pix-Hybrid条件GAN,通过多通道结构线索和上下文属性条件合成朝觐人群图像,用于数据增强,在减少人工标注的同时提升合成质量,并验证了合成数据对人群计数模型的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13341 2026-06-12 cs.CV cs.AI physics.med-ph 新提交 57%

Dual-Domain Equivariant Generative Adversarial Network for Multimodal CT-PET Synthesis

双域等变生成对抗网络用于多模态CT-PET合成

Gabriel Steele, Alzahra Altalib, Alessandro Perelli

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出双域等变生成对抗网络(DDE-GAN),联合空间与频域学习并融入旋转等变性,实现高保真多模态CT-PET图像合成。

Comments 4 pages, 3 figures, 1 table, 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08421 2026-06-09 cs.CV 新提交 57%

Segmentation-Assisted Brain MRI Synthesis with Cross-Image Multi-Contrast Feature Memory Bank Retrieval Augmentation

基于跨图像多对比度特征记忆库检索增强的分割辅助脑MRI合成

Wenwei Huang, Jia Wei, Jianlong Zhou

机构 * South China University of Technology(华南理工大学) University of Technology Sydney(悉尼科技大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出分割辅助的闭环生成对抗框架,通过辅助分割分支和双库检索增强策略,提高多对比度脑MRI中肿瘤区域的合成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07613 2026-06-09 cs.CV cs.AI 新提交 57%

Can You Trust What You See? Human and AI Detection of Synthetic Legal Evidence

你能相信你所见的吗?人类与AI对合成法律证据的检测

Jinzhe Tan, Ali Ekber Cinar, Karim Benyekhlef

机构 * Faculty of Law, McGill University(麦吉尔大学法学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究人类和前沿多模态大模型在民事纠纷场景中区分真实照片与AI生成图像的能力,发现两者均不可靠,提出结合人工审查、MLLM筛查和来源认证的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06828 2026-06-08 cs.CV cs.LG 新提交 57%

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

AdaGRPO: 一种面向基于流的GRPO的能力感知自适应增强方法

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) CPII under InnoHK(InnoHK下的CPII) Adobe Research(Adobe研究)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出AdaGRPO,通过在线课程过滤策略和跨层级优势融合,解决流模型GRPO中提示选择随机和优势估计缺乏全局视角的问题,提升训练稳定性和性能。

Comments Project Website: https://bujiazi.github.io/adagrpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21615 2026-07-27 cs.AI cs.LG 新提交 50%

FrED: External Data Influence Estimation via Domain Knowledge Graph Grounding

FrED:通过领域知识图谱基础进行外部数据影响估计

Theodoros Aivalis, Iraklis A. Klampanos, Antonis Troumpoukis, Joemon M. Jose

机构 * National Centre for Scientific Research “Demokritos”(国家科学研究中心“德谟克利特”) University of Glasgow(格拉斯哥大学)

专题命中 文生图 :image synthesis(abstract)

AI总结 针对生成式AI训练数据归因问题,提出在黑盒设置下运行的概率框架,融合连续特征相似度与领域特定知识图谱,在艺术图像合成和天气预报等领域评估,证明其有效性,为外部数据影响分析提供高效可解释机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13541 2026-07-16 cs.CR cs.LG 新提交 50%

When T2I Synthetic Data Backfires: Amplified Privacy Risks in Real-Synthetic Mix Training

当文本到图像合成数据适得其反时:真实-合成混合训练中的隐私风险放大

Na Li, Boyu Kuang, Hongsheng Hu, Liquan Chen, Hyoungshick Kim, Yansong Gao, Anmin Fu

专题命中 文生图 :text-to-image(abstract)

AI总结 研究真实-合成混合训练中合成数据会放大真实训练样本隐私泄露问题,建立理论框架,提出RSMixLeak通过成员推理攻击评估风险,有两个变体,还给出轻量级泄露倾向指标以识别高风险数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10557 2026-07-14 cs.CL 新提交 50%

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

UNIBROWSE:用于多模态浏览比较的数据到智能体框架

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 文生图 :text-to-image(abstract)

AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04339 2026-07-07 cs.LG cs.AI cs.CR 新提交 50%

One Framework for All: Cross-Modal Membership Inference for Generative Models

一框架适用于所有:生成模型的跨模态成员推理

Dayong Ye, Tainqing Zhu, Kun Gao, Junhao Liu, Yichuan Chen, Shuai Zhou, Hengzhu Liu, Bo Liu, Wanlei Zhou

专题命中 文生图 :text-to-image(abstract)

AI总结 研究生成模型的跨模态成员推理问题,基于生成模型输出分布可近似训练数据分布的特性,在共享嵌入空间建模,通过似然比测试推理,贡献统一框架,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31711 2026-07-01 cs.AI 新提交 50%

Arena-T2I Hard: Benchmarking and Improving Faithfulness with Dependency-Aware Checklist

Arena-T2I Hard:基于依赖感知清单的忠实性基准测试与改进

Yuanhao Ban, Tong Xie, Sohyun An, Yunqi Hong, Evan Frick, I-Hung Hsu, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh

机构 * Arena Intelligence Inc UCLA(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(abstract)

AI总结 针对现有忠实性基准在复杂指令上的不足,提出310条压力测试提示集Arena-T2I Hard,并设计依赖感知清单奖励结合美学奖励,显著提升文本到图像模型的忠实性-美学权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28221 2026-06-29 astro-ph.IM 新提交 50%

Faraday Tomography with the SKA: A New Era of Cosmic Magnetism Studies

SKA的法拉第层析成像:宇宙磁学研究的新时代

Miguel Carcamo, Anna M. M. Scaife, Jeroen Stil, Russ Taylor, Jennifer L. West, Tessa Vernstrom

专题命中 文生图 :image synthesis(abstract)

AI总结 本文综述了SKA通过法拉第旋转和法拉第测量合成技术研究宇宙磁场的能力,重点介绍了AA4阶段的配置及其在星系、星系团和宇宙网中高分辨率法拉第层析成像的应用。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Carcamo01. Advancing Astrophysics with the SKA II (AASKAII) outlines the transformative scientific advances that will be enabled by the SKA telescopes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23645 2026-06-23 math-ph math.MP 新提交 50%

Which Waveguide Network Realizes a Prescribed Transmission Profile? An Exact Forward Construction

哪个波导网络实现指定的传输轮廓?一种精确的正向构造方法

Tristan M. Lawrie

专题命中 文生图 :image synthesis(abstract)

AI总结 提出一种基于规范平移亥姆霍兹算子的周期性波导网络散射特性的可解析反演框架,通过傅里叶展开将晶格电抗映射到图架构,直接从目标传输系数确定物理结构,实现从一维角滤波到二维图像合成的精确波前构造。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12972 2026-06-12 cs.HC 新提交 50%

From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis

从提示到偏好:生成式AI增强联合分析的开源平台

Philipp Brauner

专题命中 文生图 :text-to-image(abstract)

AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏