arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-02 至 2025-12-02 共收录 132 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 3 篇

2512.00413 2025-12-02 cs.CV cs.GR 62%

SplatFont3D: Structure-Aware Text-to-3D Artistic Font Generation with Part-Level Style Control

SplatFont3D: 基于结构的文本到3D艺术字体生成与部分级风格控制

Ji Gan, Lingxu Chen, Jiaxu Leng, Xinbo Gao

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Xidian University(西安电子科技大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 SplatFont3D通过3D高斯溅射技术实现基于结构的文本到3D艺术字体生成,提供精确的部分级风格控制,提升渲染效率和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01895 2025-12-02 cs.CV 57%

StyleYourSmile: Cross-Domain Face Retargeting Without Paired Multi-Style Data

StyleYourSmile: 跨域人脸重定向无需配对多风格数据

Avirup Dey, Vinay Namboodiri

机构 * University of Bath(巴斯大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 StyleYourSmile通过双编码器框架和高效数据增强策略,实现无需多风格配对数据的跨域人脸重定向,提升身份保持与重定向保真度。

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 4 篇

2512.00438 2025-12-02 cs.CV cs.AI 79%

FR-TTS: Test-Time Scaling for NTP-based Image Generation with Effective Filling-based Reward Signal

FR-TTS: 基于有效填充奖励信号的NTP图像生成测试时扩展

Hang Xu, Linjiang Huang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(信息与通信技术联合实验室,中国科学技术大学) Beihang University(北京航空航天大学)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 FR-TTS通过有效填充奖励信号提升NTP图像生成的测试时扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01816 2025-12-02 cs.CV cs.AI 70%

Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights

Envision:基于因果世界过程洞察的统一理解和生成基准测试

Juanxi Tian, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Envision通过因果事件进程基准测试,评估统一模型在动态时空一致性上的表现,揭示其在因果叙事一致性上的优势及仍需改进的时空一致性挑战。

Comments 35 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00752 2025-12-02 cs.CV 57%

Charts Are Not Images: On the Challenges of Scientific Chart Editing

图表不是图像:关于科学图表编辑挑战的探讨

Shawn Li, Ryan Rossi, Sungchul Kim, Sunav Choudhary, Franck Dernoncourt, Puneet Mathur, Zhengzhong Tu, Yue Zhao

机构 * University of Southern California(南加州大学) Adobe Research(Adobe研究院) Texas A&M University(德克萨斯A&M大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FigEdit基准测试,揭示科学图表编辑中结构转换的重要性,并指出传统像素操作方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23525 2025-12-02 cs.CV 57%

Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization

Hallo4: 通过直接偏好优化实现高保真的动态肖像动画

Jiahao Cui, Yan Chen, Mingwang Xu, Hanlin Shang, Yuxuan Chen, Yun Zhan, Zilong Dong, Yao Yao, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Baidu Inc.(百度公司) Shanghai Innovative Institute(上海创新研究院) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 Hallo4通过直接偏好优化和时空运动调制,实现高保真的动态肖像动画生成,提升唇部同步、表情自然性和身体运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 2 篇

2409.07417 2025-12-02 eess.IV cs.CV 79%

Self-Supervised One-Step Diffusion Refinement for Snapshot Compressive Imaging

自监督单步扩散细化用于快照压缩成像

Shaoguang Huang, Yunzhen Wang, Haijin Zeng, Hongyu Chen, Hongyan Zhang

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出自监督单步扩散框架,用于提升快照压缩成像的重建精度与效率,实现高质量图像生成并减少计算时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00308 2025-12-02 cs.CV 57%

Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation

基于最优传输的分布几何对齐优化用于生成数据集蒸馏

Xiao Cui, Yulei Qin, Wengang Zhou, Hongsheng Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) CUHK MMLab(香港中文大学多媒体实验室) Independent Researcher(独立研究者)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于最优传输的分布几何对齐方法,通过优化传输距离提升数据集蒸馏效果,实验表明在ImageNet-1K上准确率提升至少4%。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他图像生成 4 篇

2512.02018 2025-12-02 cs.CV cs.RO 57%

Data-Centric Visual Development for Self-Driving Labs

以数据为中心的自动驾驶实验室视觉发展

Anbang Liu, Guanzhong Hu, Jiayi Wang, Ping Guo, Han Liu

机构 * Department of Computer Science, Northwestern University(计算机科学系,西北大学) Department of Mechanical Engineering, Northwestern University(机械工程系,西北大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种融合真实与虚拟数据生成的混合管道,用于解决自动驾驶实验室中pipetting任务的训练数据稀缺问题,通过人机协作和图像生成技术提升气泡检测的鲁棒性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00539 2025-12-02 cs.CV 57%

SAIDO: Generalizable Detection of AI-Generated Images via Scene-Aware and Importance-Guided Dynamic Optimization in Continual Learning

SAIDO: 通过场景感知和重要性引导的动态优化在持续学习中实现通用的人工智能生成图像检测

Yongkang Hu, Yu Cheng, Yushuo Zhang, Yuan Xie, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 SAIDO通过场景感知和重要性引导的动态优化在持续学习中实现通用的人工智能生成图像检测,提升检测稳定性和可塑性。

Comments 17 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00428 2025-12-02 cs.CV 57%

Recognizing Pneumonia in Real-World Chest X-rays with a Classifier Trained with Images Synthetically Generated by Nano Banana

用Nano Banana生成的合成图像训练分类器以在真实世界胸片中识别肺炎

Jiachuan Peng, Kyle Lam, Jianing Qiu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 利用Nano Banana生成的合成图像训练分类器,实现在真实世界胸片中识别肺炎,取得较高AUROC和AUPR,但存在提示设计和数据对齐的挑战。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22113 2025-12-02 cs.LG 50%

Countering adversarial evasion in regression analysis

对抗回归分析中的对抗逃逸

David Benfield, Phan Tu Vuong, Alain Zemkoho

机构 * School of Mathematical Sciences University of Southampton(数学科学学院 英国南安普顿大学)

专题命中 其他图像生成 :image generation(abstract)

AI总结 本文提出了一种适用于回归场景的悲观双层优化方法,以应对对抗逃逸问题,无需假设对手解的凸性或唯一性。

详情

展开后加载摘要…

URL PDF HTML 收藏