arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-13 至 2025-10-13 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2510.08054 2025-10-13 cs.CV 74%

RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models

Moon Ye-Bin, Roy Miles, Tae-Hyun Oh, Ismail Elezi, Jiankang Deng

机构 * POSTECH Huawei London Research Center(华为伦敦研究中心) KAIST(韩国科学技术院) Imperial College London(伦敦帝国理工学院)

专题命中 其他VLM :vision language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03948 2025-10-13 cs.CV 57%

ProbRes: Probabilistic Jump Diffusion for Open-World Egocentric Activity Recognition

Sanjoy Kundu, Shanmukha Vellamcheti, Sathyanarayanan N. Aakur

机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯丁大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. 17 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09078 2025-10-13 cs.GR cs.LG 57%

MCMC: Bridging Rendering, Optimization and Generative AI

Gurprit Singh, Wenzel Jakob

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) EPFL(瑞士联邦理工学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.LG

Comments SIGGRAPH Asia 2024 Courses. arXiv admin note: text overlap with arXiv:2208.11970 by other authors

Journal ref SIGGRAPH Asia 2024 Courses, Article No.: 8, Pages 1 - 27

详情

展开后加载摘要…

URL PDF HTML 收藏