arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-11 至 2025-12-11 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2411.14499 2025-12-11 cs.CL cs.AI cs.LG 62%

Understanding World or Predicting Future? A Comprehensive Survey of World Models

理解世界还是预测未来?世界模型的全面综述

Jingtao Ding, Yunke Zhang, Yu Shang, Jie Feng, Yuheng Zhang, Zefang Zong, Yuan Yuan, Hongyuan Su, Nian Li, Jinghua Piao, Yucheng Deng, Nicholas Sukiennik, Chen Gao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(电子工程系,信息科学与技术国家研究中心(BNRist),清华大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了世界模型在理解与预测方面的功能,探讨了其在多个领域的应用及未来研究方向。

Comments Extended version of the original ACM CSUR paper, 49 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09670 2025-12-11 cs.CV cs.SY eess.SY 57%

An Automated Tip-and-Cue Framework for Optimized Satellite Tasking and Visual Intelligence

一种自动化提示与提示框架用于优化卫星任务分配和视觉智能

Gil Weissman, Amir Ivry, Israel Cohen

机构 * Andrew and Erna Viterbi Faculty of Electrical and Computer Engineering, Technion-Israel Institute of Technology(安德鲁和伊尔纳·维特比电气与计算机工程学院,技术离子理工学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种自动化提示与提示框架,用于优化卫星任务分配和视觉智能,通过生成提示和任务并利用人工智能模型处理影像,提升地球观测效率。

Comments Under review at IEEE Transactions on Geoscience and Remote Sensing (TGRS). 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏