arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2603.06732 2026-03-10 cs.CV 79%

HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

HERO: 分层嵌入-细化用于视频中开放词汇时间句接地

Tingting Han, Xinsong Tao, Yufei Yin, Min Tan, Sicheng Zhao, Zhou Yu

机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07915 2026-03-06 cs.AI cs.CL cs.SY eess.SY 79%

A Signal Contract for Online Language Grounding and Discovery in Decision-Making

在线语言 grounding 与决策制定中的语言发现信号契约

Dimitris Panagopoulos, Adolfo Perrusquia, Weisi Guo

机构 * Faculty of Engineering and Applied Science, Cranfield University(工程与应用科学学院,克兰菲尔德大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 LUCIFER 通过信号契约实现在线语言 grounding,提升决策安全性和信息收集效率,需结合两者才能达成最佳效果。

Comments 10 pages, 4 Figures, 4 Tables, submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01486 2026-03-03 cs.AI 79%

Agentic Multi-Source Grounding for Enhanced Query Intent Understanding: A DoorDash Case Study

代理多源接地以增强查询意图理解:一个DoorDash案例研究

Emmanuel Aboah Boateng, Kyle MacDonald, Akshad Viswanathan, Sudeep Das

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出一种代理多源接地系统,通过目录检索和网络搜索结合,提升多意图查询的准确率,已在DoorDash实现90.7%的准确率提升。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01927 2026-03-03 cs.AI cs.MA 79%

From Grounding to Planning: Benchmarking Bottlenecks in Web Agents

从基础到规划:网络代理中的瓶颈基准测试

Segev Shlomov, Ben wiesel, Aviad Sela, Ido Levy, Liane Galanti, Roy Abitbol

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文通过分析网络代理的规划和基础组件,发现规划是性能退化的主要原因,提出新的基准测试以改进代理能力。

Journal ref ECAI 2025 - 28th European Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23677 2026-03-02 cs.CV 79%

Vision-Language Semantic Grounding for Multi-Domain Crop-Weed Segmentation

面向多领域作物杂草分割的视觉-语言语义定位

Nazia Hossain, Xintong Jiang, Yu Tian, Philippe Seguin, O. Grant Clark, Shangpeng Sun

机构 * Department of Bioresource Engineering, McGill University(生物资源工程系,麦吉尔大学) Department of Plant Science, McGill University(植物科学系,麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 VL-WS通过视觉-语言对齐实现多领域作物杂草细粒度分割,提升泛化能力和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21865 2026-02-26 cs.LG 79%

Beyond RAG vs. Long-Context: Learning Distraction-Aware Retrieval for Efficient Knowledge Grounding

超越RAG与长上下文:学习抗干扰检索以实现高效的知识 grounding

Seongwoong Shim, Myunsoo Kim, Jae Hyeon Cho, Byung-Jun Lee

机构 * Korea University, Decision Making Lab(韩国大学,决策实验室) LG CNS

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出LDAR方法,通过学习抗干扰检索提升知识 grounding 的效率与性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21406 2026-02-26 cs.CV 79%

Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation

探索用于开放词汇零样本动作分割的视觉-语言模型

Asim Unmesh, Kaki Ramesh, Mayank Patel, Rahul Jain, Karthik Ramani

机构 * Purdue University(普渡大学) Birla Institute of Technology and Science (BITS) Hyderabad(比拉理工学院和科学研究院(BITS)海得拉巴)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出开放词汇零样本时间动作分割方法,利用视觉-语言模型的零样本能力,通过帧-动作嵌入相似性和相似性矩阵时间分割实现无需训练的分割任务,展示了其在结构化时间理解中的潜力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20639 2026-02-25 cs.AI 79%

Grounding LLMs in Scientific Discovery via Embodied Actions

通过具身动作 grounding LLMs 在科学发现中

Bo Zhang, Jinfeng Zhou, Yuxuan Chen, Jianing Yin, Minlie Huang, Hongning Wang

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 通过具身动作框架,LLMs在科学发现中实现更稳定的物理模拟和更高的建模准确性。

Comments 24 pages, 7 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19768 2026-02-25 cs.CV 79%

TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding

TraceVision: 一种具有轨迹感知能力的视觉-语言模型,用于类人空间理解

Fan Yang, Shurong Zheng, Hongyin Zhao, Yufei Zhan, Xin Li, Yousong Zhu, Chaoyang Zhao Ming Tang, Jinqiao Wang

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 TraceVision通过整合轨迹感知的空间理解,实现了类人空间认知,提升视觉-语言模型在轨迹引导任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13961 2026-02-17 cs.CV astro-ph.IM cs.CL 79%

MarsRetrieval: Benchmarking Vision-Language Models for Planetary-Scale Geospatial Retrieval on Mars

MarsRetrieval: 用于火星尺度地理空间检索的视觉-语言模型基准测试

Shuoyuan Wang, Yiran Wang, Hongxin Wei

机构 * Department of Statistics and Data Science(统计与数据科学系) Department of Earth and Space Sciences(地球与空间科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 MarsRetrieval提出了一种用于评估视觉-语言模型在火星地理空间发现中检索能力的基准测试,强调领域特定微调对可推广发现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13195 2026-02-16 cs.CV 79%

Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision

对话式图像分割:通过可扩展监督将抽象概念具象化

Aadarsh Sahoo, Georgia Gkioxari

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出对话式图像分割方法,通过可扩展监督将抽象概念转化为精确掩码,并引入ConverSeg基准和ConverSeg-Net模型提升分割性能。

Comments Project webpage: https://glab-caltech.github.io/converseg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07388 2026-02-16 cs.AI 79%

Invert4TVG: A Temporal Video Grounding Framework with Inversion Tasks Preserving Action Understanding Ability

Invert4TVG: 一种具有逆向任务的时序视频定位框架,以保持动作理解能力

Zhaoyu Chen, Hongnan Lin, Yongwei Nie, Fei Ma, Xuemiao Xu, Fei Yu, Chengjiang Long

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ByteDance Inc.(字节跳动公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 Invert4TVG通过引入逆向任务保持动作理解能力,提升时序视频定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07827 2026-02-10 cs.CV 79%

Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection

开放文本航空检测:面向航空场景理解的统一框架

Guoting Wei, Xia Yuan, Yang Zhou, Haizhao Jing, Yu Liu, Xianbiao Qi, Chunxia Zhao, Haokui Zhang, Rong Xiao

机构 * Nanjing University of Science and Technology(南京理工大学) Northwestern Polytechnical University(西北工业大学) Zhejiang Lab(浙江实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 OTA-Det提出一个统一框架,整合开放词汇航空检测与遥感视觉定位,通过任务重述和密集语义对齐策略实现细粒度语义理解和多目标检测,达到最佳性能并保持实时推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05215 2026-02-06 cs.CV 79%

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Ground: 一种具有整体事件感知和匹配的时序地面视频大语言模型

Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) Xi’an Jiaotong University, China(西安交通大学) Alibaba DAMO Academy, Singapore(阿里巴巴达摩院) Institute of Science Tokyo, Japan(东京科学研究院) VinUniversity, Vietnam(文大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 E.M.Ground通过引入事件标记、平滑处理和多粒度特征聚合,提升了时序视频地面任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 79%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03071 2026-02-05 cs.CV 79%

Finding Optimal Video Moment without Training: Gaussian Boundary Optimization for Weakly Supervised Video Grounding

无需训练即可找到最优视频片段:用于弱监督视频定位的高斯边界优化

Sunoh Kim, Kimin Yun, Daeho Um

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GBO方法,通过解决优化问题提升弱监督视频定位的定位性能,无需训练且兼容多种提案架构。

Comments Accepted in IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03361 2026-02-04 cs.CV 79%

Z3D: Zero-Shot 3D Visual Grounding from Images

Z3D:从图像实现零样本3D视觉定位

Nikita Drozdov, Andrey Lemeshko, Nikita Gavrilov, Anton Konushin, Danila Rukhovich, Maksim Kolodiazhnyi

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) M3L Lab, Institute of Mechanics, Armenia(阿塞拜疆力学研究所M3L实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 Z3D通过先进的零样本3D实例分割和基于提示的推理,实现了从多视角图像中无需几何监督的零样本3D视觉定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09981 2026-02-03 cs.CV 79%

DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models

DR$^2$Seg: 分解式两阶段 rollout 用于多模态大语言模型中的高效推理分割

Yulin He, Wei Chen, Zhikang Jian, Tianhang Guo, Wenjuan Zhou, Minglong Li, Shaowu Yang, Wenjing Yang

机构 * School of Computer, National University of Defense Technology, Changsha, China(计算机学院,国防科技大学,中国长沙)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

AI总结 DR$^2$Seg通过分解式两阶段rollout策略提升多模态大语言模型中的推理效率和分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00070 2026-02-03 cs.CY cs.CL cs.LG 79%

FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs

FoundationalASSIST: 一个用于基础知识追踪和LLM教学基础的教育数据集

Eamon Worden, Cristina Heffernan, Neil Heffernan, Shashank Sonkar

机构 * Worcester Polytechnic Institute(沃斯特理工大学) The ASSISTments Foundation(ASSISTments基金会) University of Central Florida(中央佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 FoundationalASSIST 是首个为研究LLM在教育中的应用而设计的英文教育数据集,提供完整问题文本、学生实际回答和对齐标准,用于评估LLM在知识追踪和教学基础方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09114 2026-02-03 cs.LG 79%

TRACE: Grounding Time Series in Context for Multimodal Embedding and Retrieval

TRACE: 在上下文中对时间序列进行建模以实现多模态嵌入与检索

Jialin Chen, Ziyu Zhao, Gaukhar Nurbek, Aosong Feng, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 TRACE通过在上下文中对时间序列进行建模,实现多模态嵌入与检索,提升下游任务的预测精度和可解释性,同时作为强大的独立编码器优化上下文感知表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22666 2026-02-02 cs.CV 79%

ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding

ExpAlign:基于期望引导的视觉-语言对齐用于开放词汇接地

Junyi Hu, Tian Bai, Fengyi Wu, Wenyan Li, Zhenming Peng, Yi Zhang

机构 * Department of Automation, Tsinghua University, China(清华大学自动化系) University of Electronic Science and Technology of China, China(电子科技大学) University of Copenhagen, Denmark(哥本哈根大学) Lingsu Lab, China(灵素实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 ExpAlign通过理论指导的多实例学习框架,实现开放词汇接地任务中隐式token和实例选择,提升检测和分割性能,尤其在长尾类别上表现突出。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 79%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16532 2026-01-27 cs.CV 79%

AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding

AnchoredDream: 通过几何约束从单视角生成零样本360°室内场景

Runmao Yao, Junsheng Zhou, Zhen Dong, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 AnchoredDream通过几何约束和外观-几何互促机制,实现从单视角零样本生成高质量360°室内场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15871 2026-01-27 cs.CV cs.MM 79%

Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval

通过视图检索实现3D高斯体的零样本视觉定位

Liwei Liao, Xufeng Li, Xiaoyun Zheng, Boning Liu, Feng Gao, Ronggang Wang

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) City University of Hongkong(香港城市大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GVR框架,通过视图检索将3DVG转化为2D检索任务,实现零样本3DGS的视觉定位,无需每场景训练和3D标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17588 2026-01-27 cs.AI cs.CL 79%

Intelligence Requires Grounding But Not Embodiment

智能需要具身但不需要身体

Marcus Ma, Shrikanth Narayanan

机构 * University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出智能需要基础性而非具身,通过定义智能的四个属性并论证非具身智能体可实现这些属性,从而得出结论:基础性是智能的必要条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06515 2026-01-27 cs.CV 79%

BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok

BigTokDetect: 一种临床指导的视觉-语言建模框架,用于检测TikTok上促进大肌肉畸形行为的视频

Minh Duc Chu, Kshitij Pawar, Zihao He, Roxanna Sharifi, Ross Sonnenblick, Magdalayna Curry, Laura D'Adamo, Lindsay Young, Stuart B Murray, Kristina Lerman

机构 * USC Information Sciences Institute(USC信息科学研究所) Keck School of Medicine, USC(USC凯克医学院) Department of Clinical Psychology, Drexel University(德雷塞尔大学临床心理学系) Department of Psychiatry and Biobehavioral Sciences, UCLA(UCLA精神病学与生物行为科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 BigTokDetect通过临床指导的视觉-语言模型,检测TikTok上促进大肌肉畸形行为的视频,建立了可扩展的有害内容缓解框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08905 2026-01-27 cs.AI cs.CL 79%

Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora

在无监督文档语料中使语言模型的合成数据评估接地

Michael Majurski, Cynthia Matuszek

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本研究提出了一种自动化方法,利用文档语料生成事实性合成数据评估,以提高语言模型在无监督文档中的评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16108 2026-01-23 cs.AI 79%

Multimodal Climate Disinformation Detection: Integrating Vision-Language Models with External Knowledge Sources

多模态气候虚假信息检测:整合视觉-语言模型与外部知识源

Marzieh Adeli Shamsabad, Hamed Ghodrati

机构 * CRIM

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15711 2026-01-23 cs.CV 79%

Zero-Shot Product Attribute Labeling with Vision-Language Models: A Three-Tier Evaluation Framework

基于视觉-语言模型的零样本产品属性标注:一种三级评估框架

Shubham Shukla, Kunal Sonalkar

机构 * Nordstrom(诺德斯特拉姆)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种三级评估框架,评估视觉-语言模型在多属性服装任务中的零样本属性标注性能,发现高效模型在成本较低时能实现接近旗舰级性能,揭示了属性适用性检测是关键瓶颈。

Comments Accepted to WACV 2026 Workshop on Physical Retail AI (PRAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13634 2026-01-21 cs.AI 79%

V2P: Visual Attention Calibration for GUI Grounding via Background Suppression and Center Peaking

V2P: 通过背景抑制和中心峰值校准实现GUI定位的视觉注意力校准

Jikai Chen, Long Chen, Dong Wang, Qinglin Su, Zhixuan Chu, Bingguang Hao, Leilei Gan, Chenyi Zhuang, Jinjie Gu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 V2P通过背景抑制和中心峰值校准提升GUI元素定位精度,解决注意力漂移和中心边缘区分问题,实现高精度GUI接地任务。

详情

展开后加载摘要…

URL PDF HTML 收藏