arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-14 至 2026-01-14 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2406.09838 2026-01-14 cs.CV cs.AI 88%

ClimateIQA: A New Dataset and Benchmark to Advance Vision-Language Models in Meteorology Anomalies Analysis

ClimateIQA: 一种新的数据集和基准,以推进气象异常分析中的视觉-语言模型

Jian Chen, Peilin Zhou, Yining Hua, Dading Chong, Meng Cao, Yaowei Li, Wei Chen, Bing Zhu, Junwei Liang, Zixuan Yuan

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能研究所,香港科学与技术大学(广州)) Thrust of Data Science and Analytics, The Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析研究所,香港科学与技术大学(广州)) Harvard University(哈佛大学) Peking University(北京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);visual question answering(abstract)

AI总结 ClimateIQA通过引入SPOT算法和新型数据集,提升视觉-语言模型在气象异常分析中的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 73%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2601.08292 2026-01-14 cs.CV 79%

KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?

KidVis: 多模态大语言模型是否具备六岁儿童的视觉感知能力?

Xianfeng Wang, Kaiwei Zhang, Qi Jia, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 KidVis研究通过对比人类儿童与多模态大语言模型在视觉能力上的表现,揭示了当前模型在基础视觉感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08440 2026-01-14 cs.CV 70%

Incentivizing Cardiologist-Like Reasoning in MLLMs for Interpretable Echocardiographic Diagnosis

激励MLLMs实现类似心内科医生的推理以实现可解释的超声心动图诊断

Yi Qin, Lehan Wang, Chenxu Zhao, Alex P. W. Lee, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CRT和CardiacMind,通过引入心内科医生的思维模式,提升MLLMs在超声心动图诊断中的推理能力,实现48%的诊断性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20665 2026-01-14 cs.CV 70%

DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving

DriveRX:一种用于跨任务自动驾驶的视觉-语言推理模型

Muxi Diao, Lele Yang, Hongbo Yin, Zhexu Wang, Yejie Wang, Daxin Tian, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Beihang University(北航)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DriveRX是一种用于自动驾驶的视觉-语言推理模型,通过结构化推理提升多阶段决策能力,并在复杂驾驶条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03215 2026-01-14 cs.AI 70%

COSINT-Agent: A Knowledge-Driven Multimodal Agent for Chinese Open Source Intelligence

COSINT-Agent: 一种面向中文开源情报的知识驱动多模态智能体

Wentao Li, Congcong Wang, Xiaoxiao Cui, Zhi Liu, Wei Guo, Lizhen Cui

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 COSINT-Agent通过整合多模态大语言模型与实体-事件-场景知识图谱,提升中文开源情报的多模态推理能力与情报生成效率。

Comments This manuscript (arXiv:2503.03215) is being withdrawn at the supervisor's request. The content is preliminary and needs further internal revision and approval before public release. We will resubmit a revised version after completion. Apologies for the inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20387 2026-01-14 cs.AI cs.CL cs.CV 62%

Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems

生成数字孪生:用于可执行工业系统的视觉-语言模拟模型

YuChe Hsu, AnJui Wang, TsaiChing Ni, YuanFu Yang

机构 * Institute of Artificial Intelligence Innovation(人工智能创新研究所)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉-语言模拟模型VLSM,通过统一视觉与文本理解,实现从布局草图和自然语言提示生成可执行的工业模拟代码,建立首个大规模生成数字孪生数据集并提出三个专用评估指标。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07553 2026-01-14 cs.AI q-bio.QM 57%

GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition

GTR-CoT:图遍历作为视觉推理链用于分子结构识别

Jingchao Wang, Yifan He, Haote Yang, Jiang Wu, Lingli Ge, Xingjian Wei, Yinfan Wang, Linye Li, Huijie Ao, Chengjin Liu, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 GTR-CoT通过图遍历机制和强化学习提升手绘分子结构识别性能,构建首个细粒度评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08739 2026-01-14 cs.CL 50%

PrivGemo: Privacy-Preserving Dual-Tower Graph Retrieval for Empowering LLM Reasoning with Memory Augmentation

PrivGemo: 保护隐私的双塔图检索用于增强LLM推理的记忆增强

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Data61, CSIRO(Data61,CSIRO)

专题命中 视觉推理 :grounding(abstract)

AI总结 PrivGemo通过双塔设计和隐私保护机制,实现隐私保护的图检索增强推理,提升LLM在知识密集型任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 14 篇

2601.08811 2026-01-14 cs.CV cs.AI 81%

Reasoning Matters for 3D Visual Grounding

推理在3D视觉定位中至关重要

Hsiang-Wei Huang, Kuang-Ming Chen, Wenhao Chai, Cheng-Yen Yang, Jen-Hao Cheng, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种自动合成3D视觉定位数据的管道,并引入了在仅使用1.6%训练数据下表现优于现有方法的Reason3DVG-8B模型,证明了推理在3D视觉定位中的重要性。

Comments 2025 CVPR Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17493 2026-01-14 cs.AI cs.LO 79%

Automated Hybrid Grounding Using Structural and Data-Driven Heuristics

基于结构和数据驱动启发式的自动化混合接地

Alexander Beiser, Markus Hecher, Stefan Woltran

机构 * Univ. Artois, CNRS, UMR8188, Computer Science Research Center of Lens (CRIL), Lens, France(阿托瓦大学、法国国家科学研究中心、UMR8188、Lens计算科学研究中心(CRIL)、Lens)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出基于结构和数据驱动启发式的自动化混合接地方法,通过分割算法优化接地策略,提升难接地场景的性能并接近当前最佳水平。

Journal ref Theory and Practice of Logic Programming 25 (2025) 489-506

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08531 2026-01-14 cs.AI 70%

Sketch-Based Facade Renovation With Generative AI: A Streamlined Framework for Bypassing As-Built Modelling in Industrial Adaptive Reuse

基于草图的立面修复与生成式AI:一种简化框架,用于在工业适应性再利用中绕过实际建成建模

Warissara Booranamaitree, Xusheng Du, Yushu Cai, Zhengyang Wang, Ye Zhang, Haoran Xie

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出了一种结合生成式AI和视觉-语言模型的三阶段框架,通过处理粗糙草图和文本描述,快速生成保留原结构且提高细节质量的立面修复提案,从而绕过传统详细建模流程。

Comments 10 pages, 9 figures, Proceedings of CAADRIA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08155 2026-01-14 cs.CV 70%

Instance-Aligned Captions for Explainable Video Anomaly Detection

实例对齐的描述用于可解释的视频异常检测

Inpyo Song, Minjun Joo, Joonhyung Kwon, Eunji Jeon, Jangwon Lee

机构 * SungKyunKwan University(顺 Kyun 峰大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06010 2026-01-14 cs.CV cs.MM 70%

Latent Reconstruction from Generated Data for Multimodal Misinformation Detection

从生成数据中进行潜在重建用于多模态虚假信息检测

Stefanos-Iordanis Papadopoulos, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Information Technology Institute, Centre for Research & Technology, Hellas(信息科技研究所,研究中心,希腊) Department of Electrical & Computer Engineering, Aristotle University of Thessaloniki(电气与计算机工程系,亚里士多德大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出MisCaption This!框架和LAMAR网络,通过生成高保真度的误标数据和潜在重建技术,提升多模态虚假信息检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08371 2026-01-14 cs.CV cs.AI cs.GR cs.LG 67%

Geo-NVS-w: Geometry-Aware Novel View Synthesis In-the-Wild with an SDF Renderer

Geo-NVS-w:基于SDF渲染器的野外几何感知新视角合成

Anastasios Tsalakopoulos, Angelos Kanlis, Evangelos Chatzis, Antonis Karakottas, Dimitrios Zarpalas

机构 * Centre for Research and Technology Hellas (CERTH)(希腊研究中心与技术中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Geo-NVS-w通过SDF渲染器实现野外高保真新视角合成,采用几何保持损失提升细节精度,显著降低能耗。

Comments Presented at the ICCV 2025 Workshop on Large Scale Cross Device Localization

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03910 2026-01-14 math.RT cs.AI cs.LG 62%

An Algebraic Representation Theorem for Linear GENEOs in Geometric Machine Learning

线性GENEOs在几何机器学习中的代数表示定理

Francesco Conti, Patrizio Frosini, Nicola Quercioli

机构 * Inria Sophia Antipolis(法国 Sophia Antipolis 研究所) University of Pisa(比萨大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出新的代数表示定理,用于描述在不同数据空间之间作用的线性GENEOs,通过广义T-置换测度实现,扩展了几何机器学习中对称性编码的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08773 2026-01-14 cs.SE cs.AI 57%

Reliable Graph-RAG for Codebases: AST-Derived Graphs vs LLM-Extracted Knowledge Graphs

可靠的代码库图-RAG:基于AST的图与LLM提取的知识图谱

Manideep Reddy Chinthareddy

机构 * Software Engineer, Centerville, USA(美国辛斯维尔软件工程师)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文比较了基于AST的图谱和LLM提取的知识图谱在代码库中的检索性能,发现确定性AST图谱在索引成本和多跳推理方面更具优势。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 57%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08288 2026-01-14 cs.AI 57%

OpenMic: A Multi-Agent-Based Stand-Up Comedy Generation System

OpenMic: 基于多智能体的站立喜剧生成系统

Yuyang Wu, Hanzhong Cao, Jianhao Chen, Yufei Li

机构 * School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 OpenMic通过多智能体系统生成基于文化背景的站立喜剧,结合检索增强生成和专用JokeWriter提升幽默与节奏表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08040 2026-01-14 cs.CV 57%

Rescind: Countering Image Misconduct in Biomedical Publications with Vision-Language and State-Space Modeling

Rescind: 通过视觉-语言和状态空间建模对抗生物医学出版物中的图像不当行为

Soumyaroop Nandi, Prem Natarajan

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 Rescind通过视觉-语言和状态空间建模方法,提出首个生物医学图像伪造生成与检测框架,实现高精度伪造定位与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00406 2026-01-14 quant-ph cs.AI 57%

Quantum Machine Unlearning: Foundations, Mechanisms, and Taxonomy

量子机器遗忘:基础、机制与分类

Thanveer Shaik, Xiaohui Tao, Haoran Xie

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出量子机器遗忘的统一框架,结合物理约束、算法机制与伦理治理,通过五轴分类体系和实用机制设计,推动QMU在可验证性和伦理对齐方面的应用发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08105 2026-01-14 cs.CL 50%

Query Suggestion for Retrieval-Augmented Generation via Dynamic In-Context Learning

通过动态上下文学习实现检索增强生成的查询建议

Fabian Spaeh, Tianyi Chen, Chen-Hao Chiang, Bin Shen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过动态上下文学习实现检索增强生成的查询建议,以提升用户交互的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 3 篇

2601.08470 2026-01-14 cs.CV 70%

Towards Safer Mobile Agents: Scalable Generation and Evaluation of Diverse Scenarios for VLMs

迈向更安全的移动代理:为视觉语言模型(VLMs)可扩展生成和评估多样化场景

Takara Taniguchi, Kuniaki Saito, Atsushi Hashimoto

机构 * OMRON SINIC X

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出HazardForge框架,用于生成多样化场景以评估VLM在复杂环境中的安全决策能力,构建MovSafeBench基准测试并验证VLM在异常场景下的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08325 2026-01-14 cs.RO 50%

ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation

ActiveVLA: 向视觉-语言-动作模型注入主动感知以实现精确的3D机器人操控

Zhenyang Liu, Yongchong Gu, Yikai Wang, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 ActiveVLA通过引入主动感知能力,提升机器人在复杂环境中的高精度3D操控性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00634 2026-01-14 cs.SE cs.HC 50%

Does GenAI Make Usability Testing Obsolete?

生成式AI会使可用性测试过时吗?

Ali Ebrahimi Pourasad, Walid Maalej

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出UX-LLM,一种基于大视觉语言模型的可用性问题预测工具,虽无法完全替代传统测试,但可作为补充,尤其适用于资源有限的小型团队。

Comments Accepted for publication at The 47th IEEE/ACM International Conference on Software Engineering ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 3 篇

2601.06224 2026-01-14 cs.CV 70%

Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization

在所见之地接地:通过标题反馈、多样性感知采样和冲突正则化实现抗幻觉的MLLMs

Miao Pan, Wangjie Gan, Jintao Chen, Wenqi Zhang, Bing Sun, Jianwei Yin, Xuhong Zhang

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出抗幻觉的MLLMs方法,通过标题反馈、多样性感知采样和冲突正则化减少幻觉,提升推理准确性。

Comments AAAI-2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08557 2026-01-14 cs.CV cs.AI 62%

VideoHEDGE: Entropy-Based Hallucination Detection for Video-VLMs via Semantic Clustering and Spatiotemporal Perturbations

VideoHEDGE: 基于熵的视频视频语言模型幻觉检测方法:通过语义聚类和时空扰动

Sushant Gautam, Cise Midoglu, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VideoHEDGE通过语义聚类和时空扰动检测视频VLMs中的幻觉,利用熵和校准方法提高检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12992 2026-01-14 cs.RO cs.CL cs.CV cs.MA 57%

UNCAP: Uncertainty-Guided Neurosymbolic Planning Using Natural Language Communication for Cooperative Autonomous Vehicles

UNCAP:基于自然语言通信的不确定性引导神经符号规划

Neel P. Bhatt, Po-han Li, Kushagra Gupta, Rohan Siva, Daniel Milan, Alexander T. Hogue, Sandeep P. Chinchali, David Fridovich-Keil, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 UNCAP通过自然语言通信和不确定性引导方法,提升多车辆协同自动驾驶系统的可扩展性和安全性。

Journal ref AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 9 篇

2601.08139 2026-01-14 cs.CV cs.AI 84%

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏