arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-11 至 2026-02-11 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 5 篇

2602.09007 2026-02-11 cs.AI cs.CV 79%

GEBench: Benchmarking Image Generation Models as GUI Environments

GEBench: 图形用户界面生成模型的基准测试

Haodong Li, Jingwei Wu, Quan Sun, Guopeng Li, Juanxi Tian, Huanyu Zhang, Yanlin Lai, Ruichuan An, Hongbo Peng, Yuhong Dai, Chenxi Li, Chunmei Qing, Jia Wang, Ziyang Meng, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun South China University of Technology(南方科技大学) Peking University(北京大学) Tsinghua University(清华大学) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) The University of Chicago(芝加哥大学) Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 GEBench提出一个评估GUI生成模型动态交互和时间一致性的基准测试,通过五维指标揭示模型在多步交互中的瓶颈问题。

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10913 2026-02-11 cs.CV cs.CL 70%

Know "No" Better: A Data-Driven Approach for Enhancing Negation Awareness in CLIP

了解“不”:一种数据驱动的方法用于增强CLIP中的否定意识

Junsung Park, Jungbeom Lee, Jongyoon Song, Sangwon Yu, Dahuin Jung, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Amazon(亚马逊) Samsung Research(三星研究院) School of Computer Science and Engineering, Soongsil University(顺天大学计算机科学与工程学院) IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学IPAI、AIIS、ASRI、INMC和ISRC)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出NegationCLIP,通过生成包含否定的数据增强CLIP的否定意识,同时提出NegRefCOCOg基准用于评估多模态模型的否定理解能力。

Comments Accepted to ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 2825-2835

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09891 2026-02-11 cs.SD cs.LG cs.MM 57%

Stemphonic: All-at-once Flexible Multi-stem Music Generation

Stemphonic:一次生成灵活多音部音乐创作

Shih-Lun Wu, Ge Zhu, Juan-Pablo Caceres, Cheng-Zhi Anna Huang, Nicholas J. Bryan

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Adobe Research(Adobe研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.MM

AI总结 Stemphonic通过一次生成灵活多音部音乐创作,提升音乐生成效率和质量。

Comments Accepted for publication at Int. Conf. on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09461 2026-02-11 cs.LG 50%

Scalable and Reliable State-Aware Inference of High-Impact N-k Contingencies

可扩展且可靠的高影响N-k contingencies状态感知推断

Lihao Mai, Chenhan Xiao, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering at Arizona State University(亚利桑那州立大学电气、计算机与能源工程学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出了一种可扩展、状态感知的contingency推断框架,通过条件扩散模型和拓扑感知图神经网络生成高影响的N-k停电场景,提高contingency评估的可靠性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13981 2026-02-11 q-bio.BM cs.LG 50%

Decomposed Direct Preference Optimization for Structure-Based Drug Design

基于结构的分解直接偏好优化用于基于结构的药物设计

Xiwei Cheng, Xiangxin Zhou, Yuwei Yang, Yu Bao, Quanquan Gu

专题命中 图像生成评测 :diffusion(abstract)

AI总结 DecompDPO通过分解优化目标和引入物理信息能量项,提升基于结构的药物设计中分子生成与优化的性能。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏