arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-15 至 2025-12-15 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1 篇

2512.10867 2025-12-15 cs.CV 79%

From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models

从宏观到微观:通过视觉-语言模型在分子上基准测试微观空间智能

Zongzhao Li, Xiangzhe Kong, Jiahui Su, Zongyang Ma, Mingze Li, Songyou Li, Yuelin Zhang, Yu Rong, Tingyang Xu, Deli Zhao, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) SKL-ESPC & SEPKL-AERM, College of Environmental Sciences and Engineering, Peking University(环境科学与工程学院,北京大学) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团 DAMO Academy,中国杭州) Hupan Lab, Hangzhou, China(杭州实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出MiSI-Bench基准测试框架,评估视觉-语言模型在分子微观空间智能任务中的表现,发现微调模型在空间转换任务上超越人类,但需整合领域知识以推动科学AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏