arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-14 至 2026-01-14 共收录 14 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 14 篇

2601.08811 2026-01-14 cs.CV cs.AI 81%

Reasoning Matters for 3D Visual Grounding

推理在3D视觉定位中至关重要

Hsiang-Wei Huang, Kuang-Ming Chen, Wenhao Chai, Cheng-Yen Yang, Jen-Hao Cheng, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种自动合成3D视觉定位数据的管道,并引入了在仅使用1.6%训练数据下表现优于现有方法的Reason3DVG-8B模型,证明了推理在3D视觉定位中的重要性。

Comments 2025 CVPR Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17493 2026-01-14 cs.AI cs.LO 79%

Automated Hybrid Grounding Using Structural and Data-Driven Heuristics

基于结构和数据驱动启发式的自动化混合接地

Alexander Beiser, Markus Hecher, Stefan Woltran

机构 * Univ. Artois, CNRS, UMR8188, Computer Science Research Center of Lens (CRIL), Lens, France(阿托瓦大学、法国国家科学研究中心、UMR8188、Lens计算科学研究中心(CRIL)、Lens)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出基于结构和数据驱动启发式的自动化混合接地方法,通过分割算法优化接地策略,提升难接地场景的性能并接近当前最佳水平。

Journal ref Theory and Practice of Logic Programming 25 (2025) 489-506

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08531 2026-01-14 cs.AI 70%

Sketch-Based Facade Renovation With Generative AI: A Streamlined Framework for Bypassing As-Built Modelling in Industrial Adaptive Reuse

基于草图的立面修复与生成式AI:一种简化框架,用于在工业适应性再利用中绕过实际建成建模

Warissara Booranamaitree, Xusheng Du, Yushu Cai, Zhengyang Wang, Ye Zhang, Haoran Xie

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出了一种结合生成式AI和视觉-语言模型的三阶段框架,通过处理粗糙草图和文本描述,快速生成保留原结构且提高细节质量的立面修复提案,从而绕过传统详细建模流程。

Comments 10 pages, 9 figures, Proceedings of CAADRIA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08155 2026-01-14 cs.CV 70%

Instance-Aligned Captions for Explainable Video Anomaly Detection

实例对齐的描述用于可解释的视频异常检测

Inpyo Song, Minjun Joo, Joonhyung Kwon, Eunji Jeon, Jangwon Lee

机构 * SungKyunKwan University(顺 Kyun 峰大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06010 2026-01-14 cs.CV cs.MM 70%

Latent Reconstruction from Generated Data for Multimodal Misinformation Detection

从生成数据中进行潜在重建用于多模态虚假信息检测

Stefanos-Iordanis Papadopoulos, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Information Technology Institute, Centre for Research & Technology, Hellas(信息科技研究所,研究中心,希腊) Department of Electrical & Computer Engineering, Aristotle University of Thessaloniki(电气与计算机工程系,亚里士多德大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出MisCaption This!框架和LAMAR网络,通过生成高保真度的误标数据和潜在重建技术,提升多模态虚假信息检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08371 2026-01-14 cs.CV cs.AI cs.GR cs.LG 67%

Geo-NVS-w: Geometry-Aware Novel View Synthesis In-the-Wild with an SDF Renderer

Geo-NVS-w:基于SDF渲染器的野外几何感知新视角合成

Anastasios Tsalakopoulos, Angelos Kanlis, Evangelos Chatzis, Antonis Karakottas, Dimitrios Zarpalas

机构 * Centre for Research and Technology Hellas (CERTH)(希腊研究中心与技术中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Geo-NVS-w通过SDF渲染器实现野外高保真新视角合成,采用几何保持损失提升细节精度,显著降低能耗。

Comments Presented at the ICCV 2025 Workshop on Large Scale Cross Device Localization

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03910 2026-01-14 math.RT cs.AI cs.LG 62%

An Algebraic Representation Theorem for Linear GENEOs in Geometric Machine Learning

线性GENEOs在几何机器学习中的代数表示定理

Francesco Conti, Patrizio Frosini, Nicola Quercioli

机构 * Inria Sophia Antipolis(法国 Sophia Antipolis 研究所) University of Pisa(比萨大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出新的代数表示定理,用于描述在不同数据空间之间作用的线性GENEOs,通过广义T-置换测度实现,扩展了几何机器学习中对称性编码的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08773 2026-01-14 cs.SE cs.AI 57%

Reliable Graph-RAG for Codebases: AST-Derived Graphs vs LLM-Extracted Knowledge Graphs

可靠的代码库图-RAG:基于AST的图与LLM提取的知识图谱

Manideep Reddy Chinthareddy

机构 * Software Engineer, Centerville, USA(美国辛斯维尔软件工程师)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文比较了基于AST的图谱和LLM提取的知识图谱在代码库中的检索性能,发现确定性AST图谱在索引成本和多跳推理方面更具优势。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 57%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08288 2026-01-14 cs.AI 57%

OpenMic: A Multi-Agent-Based Stand-Up Comedy Generation System

OpenMic: 基于多智能体的站立喜剧生成系统

Yuyang Wu, Hanzhong Cao, Jianhao Chen, Yufei Li

机构 * School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 OpenMic通过多智能体系统生成基于文化背景的站立喜剧,结合检索增强生成和专用JokeWriter提升幽默与节奏表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08040 2026-01-14 cs.CV 57%

Rescind: Countering Image Misconduct in Biomedical Publications with Vision-Language and State-Space Modeling

Rescind: 通过视觉-语言和状态空间建模对抗生物医学出版物中的图像不当行为

Soumyaroop Nandi, Prem Natarajan

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 Rescind通过视觉-语言和状态空间建模方法,提出首个生物医学图像伪造生成与检测框架,实现高精度伪造定位与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00406 2026-01-14 quant-ph cs.AI 57%

Quantum Machine Unlearning: Foundations, Mechanisms, and Taxonomy

量子机器遗忘:基础、机制与分类

Thanveer Shaik, Xiaohui Tao, Haoran Xie

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出量子机器遗忘的统一框架,结合物理约束、算法机制与伦理治理,通过五轴分类体系和实用机制设计,推动QMU在可验证性和伦理对齐方面的应用发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08105 2026-01-14 cs.CL 50%

Query Suggestion for Retrieval-Augmented Generation via Dynamic In-Context Learning

通过动态上下文学习实现检索增强生成的查询建议

Fabian Spaeh, Tianyi Chen, Chen-Hao Chiang, Bin Shen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过动态上下文学习实现检索增强生成的查询建议,以提升用户交互的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏