arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-10 至 2026-02-10 共收录 23 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 23 篇

2602.08211 2026-02-10 cs.CV 83%

Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension

Chain-of-Caption: 无需训练提升多模态大语言模型的指称表达理解

Yik Lung Pang, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出无需训练的Chain-of-Caption框架,通过结合多种上下文提升多模态大语言模型在指称表达理解任务中的性能。

Comments 4 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07017 2026-02-10 cs.CV cs.AI 81%

XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models

XAI-CLIP: 通过区域感兴趣引导扰动框架实现多模态视觉-语言模型中可解释的医学图像分割

Thuraya Alzubaidi, Sana Ammar, Maryam Alsharqi, Islem Rekik, Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) Massachusetts Institute of Technology(麻省理工学院) Imperial College London(伦敦帝国学院) KFUPM-SDAIA Joint Research Centre for Artificial Intelligence(KFUPM-SDAIA联合人工智能研究中心)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 XAI-CLIP通过多模态视觉-语言模型嵌入实现医学图像分割的可解释性和效率提升,减少计算开销并提高分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07827 2026-02-10 cs.CV 79%

Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection

开放文本航空检测:面向航空场景理解的统一框架

Guoting Wei, Xia Yuan, Yang Zhou, Haizhao Jing, Yu Liu, Xianbiao Qi, Chunxia Zhao, Haokui Zhang, Rong Xiao

机构 * Nanjing University of Science and Technology(南京理工大学) Northwestern Polytechnical University(西北工业大学) Zhejiang Lab(浙江实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 OTA-Det提出一个统一框架,整合开放词汇航空检测与遥感视觉定位,通过任务重述和密集语义对齐策略实现细粒度语义理解和多目标检测,达到最佳性能并保持实时推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08717 2026-02-10 cs.CV cs.AI 73%

Zero-shot System for Automatic Body Region Detection for Volumetric CT and MR Images

零样本系统用于体积CT和MRI图像的自动身体区域检测

Farnaz Khun Jush, Grit Werner, Mark Klemens, Matthias Lenga

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出零样本系统用于体积CT和MRI图像自动身体区域检测,通过预训练模型实现无监督分割,展示了基于规则和多模态语言模型的性能对比。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07931 2026-02-10 cs.CV 70%

Which private attributes do VLMs agree on and predict well?

VLMs在哪些隐私属性上达成一致并预测良好?

Olena Hrynenko, Darya Baranouskaya, Alina Elena Baia, Andrea Cavallaro

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构)

专题命中 视觉定位与Grounding :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 本文研究了VLMs在隐私属性识别上的表现,发现其在某些属性上与人类标注一致且预测准确,可辅助大规模图像数据集的隐私标注。

Comments This work has been accepted to the ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08999 2026-02-10 cs.RO 67%

CLUE: Crossmodal disambiguation via Language-vision Understanding with attEntion

CLUE: 通过语言-视觉理解进行跨模态歧义消除

Mouad Abrini, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所) Sorbonne Université Paris(索邦大学巴黎)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract)

AI总结 CLUE通过语言-视觉理解实现跨模态歧义消除,利用显式空间信号决定何时提问,提升人机交互的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22441 2026-02-10 cs.CV cs.AI 62%

Can NeRFs See without Cameras?

NeRF能否在没有摄像头的情况下看到?

Chaitanya Amballa, Sattwik Basu, Yu-Lin Wei, Zhijian Yang, Mehmet Ergezer, Romit Roy Choudhury

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过重新设计NeRF来利用多路径信号推断环境,应用于从稀疏Wi-Fi测量中推断室内平面图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08828 2026-02-10 cs.CV 57%

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

VideoVeritas:通过感知预设强化学习实现AI生成视频检测

Hao Tan, Jun Lan, Senyuan Shi, Zichang Tan, Zijian Yu, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。

Comments Project: https://github.com/EricTan7/VideoVeritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08593 2026-02-10 cs.HC cs.AI 57%

Kissan-Dost: Bridging the Last Mile in Smallholder Precision Agriculture with Conversational IoT

Kissan-Dost:通过对话物联网弥合小农户精准农业的最后一公里

Muhammad Saad Ali, Daanish U. Khan, Laiba Intizar Ahmad, Umer Irfan, Maryam Mustafa, Naveed Anwar Bhatti, Muhammad Hamad Alizai

机构 * Lahore University of Management Sciences (LUMS), Pakistan(拉合尔管理科学大学(LUMS),巴基斯坦)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Kissan-Dost通过对话物联网系统,利用传感器数据和多语言翻译,为小农户提供精准农业的实时指导和高效决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08565 2026-02-10 cs.HC cs.AI 57%

Agent-Supported Foresight for AI Systemic Risks: AI Agents for Breadth, Experts for Judgment

支持智能体的前瞻性分析以应对AI系统性风险:智能体用于广度,专家用于判断

Leon Fröhling, Alessandro Giaconia, Edyta Paulina Bogucka, Daniele Quercia

机构 * GESIS - Leibniz Institute for the Social Sciences(GESIS-莱布尼茨社会科学研究所) ETH Zurich(苏黎世联邦理工学院) Nokia Bell Labs(诺基亚贝尔实验室) University of Cambridge(剑桥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种结合智能体和专家的前瞻性分析方法,用于评估AI系统的长期系统性风险,通过模拟智能体和专家讨论,扩大风险覆盖范围并提供上下文基础。

Comments 48 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15305 2026-02-10 cs.AI 57%

Coarse-to-Fine Grounded Memory for LLM Agent Planning

粗到细的 grounded memory 用于 LLM agent 计划

Wei Yang, Jinwei Xiao, Hongming Zhang, Qingyang Zhang, Yanna Wang, Bo Xu

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统国家重点实验室,自动化研究所,中国科学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出 Coarse-to-Fine Grounded Memory,通过 LLM 实现粗到细的记忆 grounding,以提升代理在复杂规划任务中的灵活性和适应性。

Comments Accepted to EMNLP 2025 Main Conference;27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19184 2026-02-10 cs.CV 57%

A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches

对类无关计数的综述:从基于参考到开放世界文本引导方法的进展

Luca Ciampi, Ali Azmoudeh, Elif Ecem Akbaba, Erdi Sarıtaş, Ziya Ata Yazıcı, Hazım Kemal Ekenel, Giuseppe Amato, Fabrizio Falchi

机构 * CNR-ISTI Istanbul Technical University(伊斯坦布尔技术大学) Division of Engineering, NYU Abu Dhabi(NYU阿布扎比分校工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文综述了类无关计数方法,提出三种范式并评估了30种架构,探讨了其性能、挑战及未来方向。

Comments Preprint version of an article accepted ad Elsevier's CVIU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 57%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07378 2026-02-10 cs.LG physics.data-an stat.ML 57%

Dichotomy of Feature Learning and Unlearning: Fast-Slow Analysis on Neural Networks with Stochastic Gradient Descent

特征学习与遗忘的二元性:基于随机梯度下降的神经网络快慢分析

Shota Imai, Sota Nishiyama, Masaaki Imaizumi

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN先进人工智能项目中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了神经网络中特征学习与遗忘的二元性,通过快慢动态分析揭示特征遗忘的机制与条件,提出特征遗忘由数据主非线性项强度和第二层权重初始尺度决定。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00030 2026-02-10 cs.LG 57%

RAPTOR-AI for Disaster OODA Loop: Hierarchical Multimodal RAG with Experience-Driven Agentic Decision-Making

RAPTOR-AI用于灾难OODA循环:基于经验驱动的多模态RAG框架

Takato Yasuno

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 RAPTOR-AI通过分层多模态RAG框架,结合经验驱动的代理控制和LoRA适应,提升灾害响应中的检索精度、情境基础性和任务分解准确性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06984 2026-02-10 cs.CY cs.AI 57%

Empowering Affected Individuals to Shape AI Fairness Assessments: Processes, Criteria, and Tools

赋能受影响个体塑造AI公平性评估:过程、标准与工具

Lin Luo, Satwik Ghanta, Yuri Nakao, Mathieu Chollet, Simone Stumpf

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院) FUJITSU LIMITED(Fujitsu 有限公司) Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术与科学研究生院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过定性研究探讨了如何让受影响个体参与AI公平性评估,揭示了个体如何通过模型特征生成公平性标准,并提出了支持包容性AI公平性评估的设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08545 2026-02-10 cs.IR 50%

DA-RAG: Dynamic Attributed Community Search for Retrieval-Augmented Generation

DA-RAG:动态属性社区搜索用于检索增强生成

Xingyuan Zeng, Zuohan Wu, Yue Wang, Chen Zhang, Quanming Yao, Libin Zheng, Jian Yin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DA-RAG通过动态属性社区搜索提升检索增强生成的效果,有效处理动态复杂查询,减少计算与经济成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08529 2026-02-10 cs.MA 50%

EvoCorps: An Evolutionary Multi-Agent Framework for Depolarizing Online Discourse

EvoCorps:一种用于去极化的进化多智能体框架

Ning Lin, Haolun Li, Mingshu Liu, Chengyun Ruan, Kaibo Huang, Yukun Wei, Zhongliang Yang, Linna Zhou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoCorps通过进化多智能体框架主动应对在线讨论中的极化问题,提升讨论质量并实现闭环干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22246 2026-02-10 quant-ph cond-mat.dis-nn cond-mat.str-el 50%

Complexity in multi-qubit and many-body systems

多量子比特和许多体系统的复杂性

Imre Varga

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于熵的复杂性度量,用于识别多量子比特和许多体系统中的非平凡量子相变和临界行为。

Comments 13 pages, 9 figures

Journal ref Phys. Rev. A 113, 022606, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 50%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07371 2026-02-10 cs.DB 50%

DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation

DeepPrep: 一种基于大语言模型的自主数据准备代理系统

Meihao Fan, Ju Fan, Yuxin Zhang, Shaolei Zhang, Xiaoyong Du, Jie Song, Peng Li, Fuxin Jiang, Tieying Zhang, Jianjun Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DeepPrep通过基于树状代理推理和渐进式训练框架,实现高效且准确的数据准备,相比闭源模型具有更低的成本和更广的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23189 2026-02-10 eess.SY cs.SY 50%

The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design

代理EDA的黎明:自主数字芯片设计的综述

Zelin Zang, Yuhang Song, Aili Wang, Bingo Wing-Kuen Ling, Qi Sun, Zhen Lei, Fuji Yang, Cheng Zhuo, Jiebo Luo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22978 2026-02-10 cs.CL 50%

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp: LLMs 是否真的准备好为您的购物车服务?

Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

机构 * ByteDance(字节跳动)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏