arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2602.14833 2026-02-17 eess.SP cs.LG 57%

RF-GPT: Teaching AI to See the Wireless World

RF-GPT:教AI看见无线世界

Hang Zou, Yu Tian, Bohao Wang, Lina Bariah, Samson Lasaulce, Chongwen Huang, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06185 2026-02-17 cs.AI 57%

Dataforge: Agentic Platform for Autonomous Data Engineering

Dataforge:自主数据工程的代理平台

Xinyuan Wang, Hongyu Cao, Kunpeng Liu, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Dataforge是一个基于大语言模型的自动数据工程平台,通过自动数据清理和迭代优化特征操作,提升表格数据的AI准备质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09027 2026-02-17 cs.CV 57%

Measure Twice, Cut Once: A Semantic-Oriented Approach to Video Temporal Localization with Video LLMs

两次测量,一次切割:一种面向语义的视频时间定位方法与视频LLMs

Zongshang Pang, Mayu Otani, Yuta Nakashima

机构 * The University of Osaka(大阪大学) CyberAgent, Inc.(CyberAgent公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MeCo提出一种面向语义的视频时间定位方法,通过生成和判别学习任务提升视频LLMs对事件结构的识别能力,实现更精确的时间分割。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13320 2026-02-17 cs.AI 57%

Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol

工具使用LLM代理中的信息保真度:模型上下文协议的鞅分析

Flint Xiaofeng Fan, Cheston Tan, Roger Wattenhofer, Yew-Soon Ong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种分析模型上下文协议中误差累积的理论框架,通过鞅分析证明误差呈现线性增长并受$O(\sqrt{T})$约束,实验验证了语义加权和周期性再定位对误差控制的有效性。

Comments Full working version of an extended abstract accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03474 2026-02-17 cs.CV 57%

Procedural Mistake Detection via Action Effect Modeling

通过动作效果建模实现过程性错误检测

Wenliang Guo, Yujiang Pu, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出通过动作效果建模实现过程性错误检测,结合语义和视觉信息,在单类分类任务中取得最佳性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13013 2026-02-16 cs.CV 57%

Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions

面向具有属性结构和质量验证指令的通用视频MLLMs

Yunheng Li, Hengrui Zhang, Meng-Hao Guo, Wenzhao Gao, Shaoyong Jia, Shaohui Jiao, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ByteDance Inc.(字节跳动公司) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本研究提出ASID-1M数据集、ASID-Verify验证流程和ASID-Captioner模型,通过细粒度结构化指令提升视频理解性能,实现高质量描述生成与指令遵循。

Comments Project page: https://asid-caption.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12173 2026-02-13 cs.AI 57%

SAM3-LiteText: An Anatomical Study of the SAM3 Text Encoder for Efficient Vision-Language Segmentation

SAM3-LiteText: SAM3文本编码器的解剖学研究:用于高效视觉-语言分割

Chengxi Zeng, Yuxuan Jiang, Ge Gao, Shuai Wang, Duolikun Danier, Bin Zhu, Stevan Rudinac, David Bull, Fan Zhang

机构 * Visual Information Lab, University of Bristol(布里斯托大学视觉信息实验室) University of Amsterdam(阿姆斯特丹大学) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Singapore Management University(新加坡管理大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SAM3-LiteText通过轻量级文本编码框架优化视觉-语言分割模型,减少88%的参数并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05578 2026-02-13 cs.CV 57%

LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation

LoGoSeg:整合局部和全局特征以实现开放词汇语义分割

Junyang Chen, Xiangbo Lv, Zhiqiang Kou, Xingdong Sheng, Ning Xu, Yiguo Qiao

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 LoGoSeg通过整合局部和全局特征,提升开放词汇语义分割的精度与效率,减少幻觉和漏检问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19269 2026-02-13 cs.RO cs.LG 57%

Translating Flow to Policy via Hindsight Online Imitation

通过回顾在线模仿将流翻译为政策

Yitian Zheng, Zhangchen Ye, Weijun Dong, Shengjie Wang, Yuyang Liu, Chongjie Zhang, Chuan Wen, Yang Gao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) University of California San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Qi Zhi Institute(上海启智研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 通过回顾在线模仿将流翻译为政策,利用2D点流作为高层规划器,在模拟和现实任务中实现超过2倍的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11662 2026-02-13 cs.LG 57%

UMAP Is Spectral Clustering on the Fuzzy Nearest-Neighbor Graph

UMAP是模糊最近邻图上的谱聚类

Yang Yang

机构 * Frazer Institute, Faculty of Health, Medicine and Behavioural Sciences, The University of Queensland(弗拉泽研究所,健康、医学与行为科学学院,昆士兰大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文证明UMAP在模糊最近邻图上执行谱聚类,将UMAP、对比学习和谱聚类统一于一个理论框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10354 2026-02-12 cs.CL cs.LG 57%

Physically Interpretable AlphaEarth Foundation Model Embeddings Enable LLM-Based Land Surface Intelligence

可解释的AlphaEarth基础模型嵌入使基于大语言模型的地表智能成为可能

Mashrekur Rahman

机构 * Dartmouth College(达特茅斯学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 基于AlphaEarth基础模型的可解释嵌入,通过检索增强生成实现地表智能,验证了卫星嵌入在环境决策中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08892 2026-02-12 cs.CL cs.AI 57%

Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders

迈向基于稀疏自编码器的忠实检索增强生成

Guangzhi Xiong, Zhenghao He, Bohan Liu, Sanchit Sinha, Aidong Zhang

机构 * Department of Computer Science University of Virginia(计算机科学系弗吉尼亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出RAGLens,通过稀疏自编码器解构LLM内部激活,有效检测RAG生成中的不忠实输出,并提供可解释的决策理由。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11093 2026-02-12 cs.CV 57%

OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning

OmniDiff: 一个全面的细粒度图像差异描述基准

Yuan Liu, Saihui Hou, Saijie Hou, Jiabao Du, Shibei Meng, Yongzhen Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 OmniDiff提出一个全面的细粒度图像差异描述基准,结合多模态大语言模型与插拔式多尺度差异感知模块,提升跨场景差异识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09979 2026-02-11 cs.CV 57%

Learning to Detect Baked Goods with Limited Supervision

在有限监督下学习检测烘焙食品

Thomas H. Schmitt, Maximilian Bundscherer, Tobias Bocklet

机构 * Technische Hochschule Nürnberg(纽伦堡技术大学) Georg Simon Ohm Nuremberg Germany(乔治·西蒙·奥姆纽尔堡德国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 在有限监督下,通过结合OWLv2和Grounding DINO定位与图像级监督,以及使用Segment Anything 2伪标签微调,训练出YOLOv11模型,实现烘焙食品检测的高精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09146 2026-02-11 cs.CV 57%

SemanticMoments: Training-Free Motion Similarity via Third Moment Features

语义时刻:通过第三时刻特征实现免训练的运动相似性

Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady

机构 * BRIA AI(BRIA人工智能研究中心) Tel Aviv University(特拉维夫大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SemanticMoments通过计算语义特征的高阶矩,无需训练即可提升基于运动的视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07342 2026-02-11 q-bio.NC cs.LG eess.IV 57%

Beyond Grid-Locked Voxels: Neural Response Functions for Continuous Brain Encoding

超越网格锁定体素:神经响应函数用于连续脑编码

Haomiao Chen, Keith W Jamison, Mert R. Sabuncu, Amy Kuceyeski

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔医学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 NRF通过连续函数建模大脑响应,超越传统扁平体素方法,提升跨受试者适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08828 2026-02-10 cs.CV 57%

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

VideoVeritas:通过感知预设强化学习实现AI生成视频检测

Hao Tan, Jun Lan, Senyuan Shi, Zichang Tan, Zijian Yu, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。

Comments Project: https://github.com/EricTan7/VideoVeritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08593 2026-02-10 cs.HC cs.AI 57%

Kissan-Dost: Bridging the Last Mile in Smallholder Precision Agriculture with Conversational IoT

Kissan-Dost:通过对话物联网弥合小农户精准农业的最后一公里

Muhammad Saad Ali, Daanish U. Khan, Laiba Intizar Ahmad, Umer Irfan, Maryam Mustafa, Naveed Anwar Bhatti, Muhammad Hamad Alizai

机构 * Lahore University of Management Sciences (LUMS), Pakistan(拉合尔管理科学大学(LUMS),巴基斯坦)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Kissan-Dost通过对话物联网系统,利用传感器数据和多语言翻译,为小农户提供精准农业的实时指导和高效决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08565 2026-02-10 cs.HC cs.AI 57%

Agent-Supported Foresight for AI Systemic Risks: AI Agents for Breadth, Experts for Judgment

支持智能体的前瞻性分析以应对AI系统性风险:智能体用于广度,专家用于判断

Leon Fröhling, Alessandro Giaconia, Edyta Paulina Bogucka, Daniele Quercia

机构 * GESIS - Leibniz Institute for the Social Sciences(GESIS-莱布尼茨社会科学研究所) ETH Zurich(苏黎世联邦理工学院) Nokia Bell Labs(诺基亚贝尔实验室) University of Cambridge(剑桥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种结合智能体和专家的前瞻性分析方法,用于评估AI系统的长期系统性风险,通过模拟智能体和专家讨论,扩大风险覆盖范围并提供上下文基础。

Comments 48 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15305 2026-02-10 cs.AI 57%

Coarse-to-Fine Grounded Memory for LLM Agent Planning

粗到细的 grounded memory 用于 LLM agent 计划

Wei Yang, Jinwei Xiao, Hongming Zhang, Qingyang Zhang, Yanna Wang, Bo Xu

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统国家重点实验室,自动化研究所,中国科学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出 Coarse-to-Fine Grounded Memory,通过 LLM 实现粗到细的记忆 grounding,以提升代理在复杂规划任务中的灵活性和适应性。

Comments Accepted to EMNLP 2025 Main Conference;27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19184 2026-02-10 cs.CV 57%

A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches

对类无关计数的综述:从基于参考到开放世界文本引导方法的进展

Luca Ciampi, Ali Azmoudeh, Elif Ecem Akbaba, Erdi Sarıtaş, Ziya Ata Yazıcı, Hazım Kemal Ekenel, Giuseppe Amato, Fabrizio Falchi

机构 * CNR-ISTI Istanbul Technical University(伊斯坦布尔技术大学) Division of Engineering, NYU Abu Dhabi(NYU阿布扎比分校工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文综述了类无关计数方法,提出三种范式并评估了30种架构,探讨了其性能、挑战及未来方向。

Comments Preprint version of an article accepted ad Elsevier's CVIU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 57%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07378 2026-02-10 cs.LG physics.data-an stat.ML 57%

Dichotomy of Feature Learning and Unlearning: Fast-Slow Analysis on Neural Networks with Stochastic Gradient Descent

特征学习与遗忘的二元性:基于随机梯度下降的神经网络快慢分析

Shota Imai, Sota Nishiyama, Masaaki Imaizumi

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN先进人工智能项目中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了神经网络中特征学习与遗忘的二元性,通过快慢动态分析揭示特征遗忘的机制与条件,提出特征遗忘由数据主非线性项强度和第二层权重初始尺度决定。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00030 2026-02-10 cs.LG 57%

RAPTOR-AI for Disaster OODA Loop: Hierarchical Multimodal RAG with Experience-Driven Agentic Decision-Making

RAPTOR-AI用于灾难OODA循环:基于经验驱动的多模态RAG框架

Takato Yasuno

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 RAPTOR-AI通过分层多模态RAG框架,结合经验驱动的代理控制和LoRA适应,提升灾害响应中的检索精度、情境基础性和任务分解准确性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06984 2026-02-10 cs.CY cs.AI 57%

Empowering Affected Individuals to Shape AI Fairness Assessments: Processes, Criteria, and Tools

赋能受影响个体塑造AI公平性评估:过程、标准与工具

Lin Luo, Satwik Ghanta, Yuri Nakao, Mathieu Chollet, Simone Stumpf

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院) FUJITSU LIMITED(Fujitsu 有限公司) Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术与科学研究生院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过定性研究探讨了如何让受影响个体参与AI公平性评估,揭示了个体如何通过模型特征生成公平性标准,并提出了支持包容性AI公平性评估的设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06474 2026-02-09 cs.CV 57%

LAB-Det: Language as a Domain-Invariant Bridge for Training-Free One-Shot Domain Generalization in Object Detection

LAB-Det: 语言作为域不变桥梁用于无训练的一 shot 域泛化在目标检测

Xu Zhang, Zhe Chen, Jing Zhang, Dacheng Tao

机构 * The University of Sydney, Australia(悉尼大学) La Trobe University, Australia(拉特罗布大学) Wuhan University, China(武汉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LAB-Det通过语言条件替代梯度微调,实现无训练的一 shot 域泛化,在数据稀缺的检测任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22650 2026-02-06 cs.CV 57%

RefAM: Attention Magnets for Zero-Shot Referral Segmentation

RefAM:用于零样本指代分割的注意力磁铁

Anna Kukleva, Enis Simsar, Alessio Tonioni, Muhammad Ferjad Naeem, Federico Tombari, Jan Eric Lenssen, Bernt Schiele

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ETH Zürich(苏黎世联邦理工学院) Google(谷歌) TU Munich(慕尼黑技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 RefAM通过利用扩散模型的注意力机制和停用词处理,实现无需训练的零样本指代分割,提升分割精度和效率。

Comments Project Page: https://refam-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05701 2026-02-06 cs.LG 57%

Statistically Valid Post-Deployment Monitoring Should Be Standard for AI-Based Digital Health

基于AI的数字健康应将统计上有效的部署后监控作为标准

Pavel Dolin, Weizhi Li, Gautam Dasarathy, Visar Berisha

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文主张基于AI的数字健康应采用统计上有效的部署后监控作为标准,提出统计有效且标签效率高的测试框架以确保现实部署的可靠性和安全性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04731 2026-02-05 cs.CL cs.LG 57%

Less Finetuning, Better Retrieval: Rethinking LLM Adaptation for Biomedical Retrievers via Synthetic Data and Model Merging

更少微调,更好检索:通过合成数据和模型合并重新思考LLM适应于生物医学检索器

Sameh Khattab, Jean-Philippe Corbeil, Osman Alperen Koraş, Amin Dada, Julian Friedrich, François Beaulieu, Paul Vozila, Jens Kleesiek

机构 * IKIM, University Hospital Essen(IKIM,埃森大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出STM框架,通过合成数据和模型合并提升生物医学检索性能,实验显示在任务特定专家上提升23.5%并优于基线模型。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03974 2026-02-05 cs.AI 57%

Active Epistemic Control for Query-Efficient Verified Planning

主动认知控制用于查询高效的验证规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 主动认知控制通过结合基于模型的信念管理和范畴可行性检查,实现查询高效的验证规划,在交互环境中减少重新规划轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏