arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-15 至 2025-12-15 共收录 34 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 10 篇

2503.24379 2025-12-15 cs.CV cs.AI 62%

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11251 2025-12-15 cs.LG 57%

Insight Miner: A Time Series Analysis Dataset for Cross-Domain Alignment with Natural Language

Insight Miner: 一个用于跨领域对齐的时间序列分析数据集与自然语言

Yunkai Zhang, Yawen Zhang, Ming Zheng, Kezhen Chen, Chongyang Gao, Ruian Ge, Siyuan Teng, Amine Jelloul, Jinmeng Rao, Xiaoyuan Guo, Chiang-Wei Fang, Zeyu Zheng, Jie Yang

机构 * UC Berkeley(加州大学伯克利分校) Mineral(矿石) Northwestern University(西北大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.LG

AI总结 Insight Miner 是一个大规模多模态模型,通过代理工作流生成高质量时间序列描述,提升跨领域时间序列分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11755 2025-12-15 cs.CL 50%

SUMFORU: An LLM-Based Review Summarization Framework for Personalized Purchase Decision Support

SUMFORU: 一种基于LLM的个性化购买决策支持的评论摘要框架

Yuming Feng, Xinrui Jiang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 SUMFORU通过可调节的多元对齐方法,实现个性化购买决策支持,结合高质量数据管道和两阶段对齐流程,提升摘要的一致性、基础性和偏好对齐性能。

Comments Code available at https://github.com/Harry20030331/SumForU

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 1 篇

2512.10867 2025-12-15 cs.CV 79%

From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models

从宏观到微观:通过视觉-语言模型在分子上基准测试微观空间智能

Zongzhao Li, Xiangzhe Kong, Jiahui Su, Zongyang Ma, Mingze Li, Songyou Li, Yuelin Zhang, Yu Rong, Tingyang Xu, Deli Zhao, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) SKL-ESPC & SEPKL-AERM, College of Environmental Sciences and Engineering, Peking University(环境科学与工程学院,北京大学) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团 DAMO Academy,中国杭州) Hupan Lab, Hangzhou, China(杭州实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出MiSI-Bench基准测试框架,评估视觉-语言模型在分子微观空间智能任务中的表现,发现微调模型在空间转换任务上超越人类,但需整合领域知识以推动科学AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏