arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-26 至 2025-11-26 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 8 篇

2506.06836 2025-11-26 cs.CV cs.AI cs.LG 85%

Harnessing Vision-Language Models for Time Series Anomaly Detection

利用视觉语言模型进行时间序列异常检测

Zelin He, Sarah Alnegheimish, Matthew Reimherr

机构 * Amazon(亚马逊公司)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于视觉语言模型的两阶段方法,无需时间序列训练即可提升时间序列异常检测的准确性和效率。

Comments Accepted at AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11177 2025-11-26 cs.CV 77%

Viper-F1: Fast and Fine-Grained Multimodal Understanding with Cross-Modal State-Space Modulation

Viper-F1:基于交叉模态状态空间调制的高效细粒度多模态理解

Quoc-Huy Trinh

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Viper-F1通过引入高效液态状态空间动力学和令牌-网格相关模块,实现了高效细粒度多模态理解。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19920 2025-11-26 cs.CV 70%

Intelligent Image Search Algorithms Fusing Visual Large Models

融合视觉大模型的智能图像搜索算法

Kehan Wang, Tingqiong Cui, Yang Zhang, Yu Chen, Shifeng Wu, Zhenzhang Li

机构 * Chongqing University(重庆大学) CRRC Chongqing Co., Ltd.(CRRC重庆公司) Guangdong Polytechnic Normal University(广东 polytechnic 正规大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 DetVLM融合视觉大模型与物体检测,实现细粒度图像检索中的状态搜索和零样本搜索,取得高准确率。

Comments 31 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14421 2025-11-26 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

ExDDV: A New Dataset for Explainable Deepfake Detection in Video

ExDDV:用于视频可解释深度伪造检测的新数据集

Vlad Hondru, Eduard Hogea, Darian Onchis, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯大学) West University of Timişoara(蒂米什瓦拉西大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 ExDDV通过引入文本和点击监督,开发出可解释的深度伪造检测模型,以提高视频中深度伪造内容的识别能力。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19537 2025-11-26 cs.CV cs.AI cs.LG eess.IV 67%

Cross-Domain Generalization of Multimodal LLMs for Global Photovoltaic Assessment

多领域泛化用于全球光伏评估的多模态大语言模型

Muhao Guo, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本研究提出利用多模态大语言模型实现跨领域泛化,用于全球光伏评估,通过结构化提示和微调在统一框架内整合检测、定位和量化,优于传统CV和Transformer基线。

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20590 2025-11-26 cs.MA cs.AI cs.SE 57%

EnergyTwin: A Multi-Agent System for Simulating and Coordinating Energy Microgrids

EnergyTwin: 一种用于模拟和协调能源微电网的多智能体系统

Jakub Muszyński, Ignacy Walużenicz, Patryk Zan, Zofia Wrona, Maria Ganzha, Marcin Paprzycki, Costin Bădică

机构 * Warsaw University of Technology(华沙技术大学) Systems research Institute Polish Academy of Sciences(波兰科学院系统研究 institute) University of Technology and Arts(技术与艺术大学) University of Craiova(克劳日瓦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 EnergyTwin是一种基于智能体的微电网模拟环境,结合物理建模与预测驱动的滚动时间规划,用于提升微电网的韧性和能源自给率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16334 2025-11-26 cs.CV 57%

Panoptic Captioning: An Equivalence Bridge for Image and Text

全景描述:图像与文本之间的等价桥梁

Kun-Yu Lin, Hongjun Wang, Weining Ren, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 视觉定位与Grounding :InternVL(abstract);分类 cs.CV

AI总结 本文提出全景描述任务,通过PancapEngine和PancapChain方法提升图像与文本的等价描述能力,实验表明其优于现有大语言模型。

Comments NeurIPS 2025; Project page: https://visual-ai.github.io/pancap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08367 2025-11-26 cs.CV 57%

Embodied Crowd Counting

具身人群计数

Runling Long, Yunlong Wang, Jia Wan, Xiang Deng, Xinting Zhu, Weili Guan, Antoni B. Chan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

AI总结 本文提出具身人群计数任务,通过构建大规模交互式模拟器和零样本导航方法,在复杂场景中实现高效人群计数。

详情

展开后加载摘要…

URL PDF HTML 收藏