arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-26 至 2026-08-26 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2608.24563 2026-08-26 cs.CV cs.RO 新提交 83%

X-MULTI: VLM-based Imaging Factor Disentanglement for Factor-Aware Image Synthesis

X-MULTI:基于VLM的成像因子解耦用于因子感知图像合成

Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch, Maarten Bieshaar, Michael Moeller, Kristof Van Laerhoven, Danda Pani Paudel

机构 * University of Siegen(锡根大学) ETH Zürich(苏黎世联邦理工学院) Bosch Research(博世研究中心) INSAIT(INSAIT(保加利亚的智能与数据科学研究所)) Sofia University “St. Kliment Ohridski”(索非亚大学“圣·克利门特·奥赫里德斯基”)

专题命中 文生图 :image synthesis(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究针对文本到图像生成的成像因子解耦问题,提出基于VLM的X-MULTI方法及改进的I-FAA指标,提升了新颖因子组合的因子对齐效果与评估的稳健性。

Comments Accepted to the MUCG Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-08-26 cs.CV cs.AI 版本更新 83%

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Zheng Liu, Chonghan Qin, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24112 2026-08-26 cs.AI 新提交 78%

Scalable Question-Centric Text-to-Image Evaluation: Reliable Ranking, Fine-Grained Diagnosis, and Cost-Aware Routing

可扩展的以问题为中心的文本到图像评估:可靠排名、细粒度诊断与成本感知路由

Shaoan Zhao, Fang Zhao, Xueqiang Guo, Xinpei Su, Huanlin Gao, Qiang Hui, Ting Lu, Fuyuan Shi, Chao Tan, Bikun Yang, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能) China Unicom Group Co.,Ltd(中国联通集团有限公司)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究针对T2I模型评估的问题,提出QC-T2I-Bench框架,结合DSG实现细粒度诊断,评估显示多能力组件联合完成率随能力数增加下降,成本感知路由器可在减少算力的同时达到ERNIE的估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24160 2026-08-26 cs.AI 新提交 50%

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

全能评判者还是全能偏差?通过平衡、解耦的视角诊断多模态评判者

Guangzheng Hu, Ziyue Jiang, Weixu Qiao, Lixin Zhang, Jianye Kang, Yuru Wu, Rong Bao, Niantong Li, Wei Wang, Ziyi Cheng, Xinfa Zhu, HangRui Hu, Ting He, Bing Zhao, Lin Qu, Hu Wei, Jin Xu

专题命中 文生图 :text-to-image(abstract)

AI总结 本研究推出平衡解耦的多模态评判者诊断基准D3-Omni,发现全能评判者存在模态相关维度表现差、漏检失败等系统性盲点,为评估多模态模型提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏