arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-04 至 2026-02-04 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 3 篇

2602.02033 2026-02-04 cs.CV cs.AI cs.MM 81%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16964 2026-02-04 cs.CV cs.CL 57%

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

MedFrameQA: 一个多图像医学视觉问答基准用于临床推理

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang Wang, Yannan Yu, Yuyin Zhou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Santa Cruz(加州大学圣克鲁兹分校) Harvard University(哈佛大学) UC Berkeley(加州大学伯克利分校) Emory University(埃默里大学) UC San Francisco(旧金山加州大学)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

AI总结 MedFrameQA是一个多图像医学视觉问答基准,旨在评估多图像医学推理能力,揭示现有模型在处理复杂医学叙述时的不足。

Comments 27 pages, 15 Figures Benchmark data: https://huggingface.co/datasets/SuhaoYu1020/MedFrameQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02955 2026-02-04 cs.SD cs.AI cs.LG 50%

Synthetic Data Augmentation for Medical Audio Classification: A Preliminary Evaluation

医学音频分类中的合成数据增强:初步评估

David McShannon, Anthony Mella, Nicholas Dietrich

机构 * Independent Researcher(独立研究者) University of Toronto(多伦多大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本研究评估了合成数据增强在医学音频分类中的效果,发现仅在模型集合中应用增强时,F1分数有所提升,但标准CNN分类器未见明显性能提升。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏