arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-09-01 至 2026-09-01 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 5 篇

2608.29847 2026-09-01 cs.CV cs.CL 新提交 79%

ContextBias: Controlled Evaluation of Bias Persistence Under Context Shift in Text-to-Image Models

ContextBias:文本到图像模型中上下文变化下偏见持续性的可控评估

Shaghayegh Kolli, Sina Emami, Moreno D'Incà, Pouyan Nejadi, Nicu Sebe, Massimiliano Mancini, Jana Diesner

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所) University of Trento(特伦托大学) Orreco(奥雷科公司)

专题命中 图像生成评测 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ContextBias框架与ContextBench基准,评估文本到图像模型在角色关联视觉表征随上下文变化时的偏见持续性,发现语义不相关上下文不会抑制角色关联属性,凸显偏见基准需可控上下文变化的必要性。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29335 2026-09-01 cs.CV 新提交 70%

GenFirst: Generation Before Reconstruction for Stable End-to-End Latent Generative Modeling

GenFirst:用于稳定端到端隐空间生成建模的生成优先于重构方法

Guangting Zheng, Yiyuan Zhang, Tao Yang, Yunpeng Chen, Rui Zhu, Jiajun Deng, Yanyong Zhang

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究提出GenFirst策略,实现无隐空间塌陷的端到端隐空间生成建模,在图像生成任务上取得优异指标,并将框架扩展至多模态生成场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30475 2026-09-01 cs.CL cs.AI 新提交 67%

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

ImageEval 2026:基于文化语境的阿拉伯语多模态评估

Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam

机构 * Texas A&M University(德克萨斯农工大学) Qatar Computing Research Institute(卡塔尔计算研究所) Birzeit University(比尔宰特大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学) University of Toronto(多伦多大学)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

AI总结 ImageEval 2026共享任务含AynVQA和CRAI-Bench两项阿拉伯语多模态评估任务,14支团队参与,相关资源已发布,凸显文化语境多模态评估的挑战。

Comments Arabic LLMs, Multilingual, Multimodal, Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-09-01 cs.CL cs.CV 版本更新 57%

UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: this https URL (https://ureason.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09974 2026-09-01 cs.AI cs.CL 版本更新 50%

SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-Interpolated Generation

SPRInG: 通过选择性参数适应和检索插值生成实现连续大语言模型个性化

Seoyeon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 图像生成评测 :personalized generation(abstract)

AI总结 SPRInG通过选择性参数适应和检索插值生成,实现连续大语言模型个性化,有效应对用户偏好变化带来的挑战。

Comments EMNLP 26 Main, 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏