arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-27 至 2026-01-27 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2505.09166 2026-01-27 cs.HC cs.AI 86%

An Exploration of Default Images in Text-to-Image Generation

文本到图像生成中默认图像的探索

Hannu Simonen, Atte Kiviniemi, Hannah Johnston, Helena Barranha, Jonas Oppenlaender

机构 * University of Oulu Oulu Finland Carleton University Ottawa Canada IST, University of Lisbon \& IHA-NOVA FCSH / IN2PAST Lisbon Portugal University of Oulu Carleton University IST, University of Lisbon \& IHA-NOVA FCSH / IN2PAST

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文首次探讨了文本到图像生成中默认图像的特性,通过实验分析揭示了默认图像的一致性及其对用户满意度的影响。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17666 2026-01-27 cs.CV 85%

Training-Free Text-to-Image Compositional Food Generation via Prompt Grafting

无需训练的文本到图像组合食品生成 via 提示嫁接

Xinyue Pan, Yuhao Chen, Fengqing Zhu

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University(电气与计算机工程学院,普渡大学) Department of Systems Design Engineering, University of Waterloo(系统设计工程系,滑铁卢大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 无需训练的文本到图像组合食品生成方法通过提示嫁接实现对多食物图像生成的可控分离。

Comments Accepted by CAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-01-27 cs.CV cs.AI 83%

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Chonghan Qin, Zheng Liu, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02567 2026-01-27 cs.CV 77%

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

统一的多模态理解和生成模型:进展、挑战与机遇

Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。

Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18624 2026-01-27 cs.CV 70%

GeneMAN: Generalizable Single-Image 3D Human Reconstruction from Multi-Source Human Data

GeneMAN: 从多源人类数据中通用的单图像3D人体重建

Wentao Wang, Hang Ye, Fangzhou Hong, Xue Yang, Jianfu Zhang, Yizhou Wang, Ziwei Liu, Liang Pan

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Nanyang Technological University(南洋理工大学) SAIS & SCS, Shanghai Jiao Tong University(上海交通大学SAIS与SCS)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 GeneMAN通过多源高质量数据集和深度学习方法,实现从单张图像到高保真3D人体的通用重建。

Comments Accepted by NeurIPS 2025; Project page: https://roooooz.github.io/GeneMAN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17706 2026-01-27 cs.CL cs.CV 57%

A Computational Approach to Visual Metonymy

一种视觉隐喻的计算方法

Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种基于符号学理论的计算方法,通过构建ViMET数据集评估多模态语言模型在理解视觉隐喻方面的认知推理能力,并揭示了机器在处理间接视觉参考上的局限性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26861 2026-01-27 cs.IR cs.CL 50%

Evaluating Perspectival Biases in Cross-Modal Retrieval

评估跨模态检索中的视角偏差

Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich

机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏