arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-16 至 2026-06-16 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 3 篇

2606.08525 2026-06-16 cs.CV 新提交 74%

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米汽车)

专题命中 图像生成评测 :generative vision(title);分类 cs.CV

AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05214 2026-06-16 eess.IV cs.AI cs.CV 74%

CoRPA: Adversarial Image Generation for Chest X-rays Using Concept Vector Perturbations and Generative Models

CoRPA: 基于概念向量扰动和生成模型的胸部X光图像对抗生成

Amy Rafferty, Rishi Ramaesh, Ajitha Rajan

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) NHS Lothian(NHS洛锡安)

专题命中 图像生成评测 :image generation(title);分类 cs.CV

AI总结 本文提出CoRPA,一种针对医学影像领域的临床聚焦对抗攻击框架,通过概念向量扰动生成对抗性影像报告和图像,揭示医疗AI在真实临床场景下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09098 2026-06-16 eess.AS 新提交 50%

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音

Wenhao Guan, Yifan Duan, Junxi Liu, Yu Gu, Feng Dang, Kaidi Wang, Qingyang Hong, Lin Li, Xie Chen

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏