arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2603.12930 2026-03-16 cs.CV cs.LG 73%

Rethinking VLMs for Image Forgery Detection and Localization

重新思考视觉语言模型用于图像伪造检测与定位

Shaofeng Guo, Jiequan Cui, Richang Hong

机构 * Hefei University of Technology Key Laboratory of Knowledge Engineering with Big Data, Ministry of Education(合肥工业大学大数据知识工程重点实验室,教育部)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文研究如何利用视觉语言模型提升图像伪造检测与定位性能,发现传统先验知识对检测效果有负面影响,提出IFDL-VLM新方法,通过位置掩码增强模型可解释性,并在多个基准上取得新最优结果。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12538 2026-03-16 cs.CV cs.AI 73%

Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation

具有混合专家的时空语义专家路由架构用于指代图像分割

Alaa Dalaq, Muzammil Behzad

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SERA架构,通过在视觉语言框架中引入轻量级表达感知专家细化,提升指代图像分割的时空一致性与边界精度,实验表明其在准确定位和精细边界界定上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08180 2026-03-10 cs.CV cs.LG 73%

ALOOD: Exploiting Language Representations for LiDAR-based Out-of-Distribution Object Detection

ALOOD:利用语言表示进行基于LiDAR的分布外物体检测

Michael Kösel, Marcel Schreiber, Michael Ulrich, Claudius Gläser, Klaus Dietmayer

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 ALOOD通过整合语言表示,提出了一种基于LiDAR的分布外物体检测新方法,利用视觉-语言模型实现零样本分类。

Comments Accepted for publication at the 2025 IEEE Intelligent Transportation Systems Conference (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03983 2026-03-05 cs.CV cs.AI 73%

GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery

GeoSeg: 无需训练的推理驱动遥感图像分割

Lifan Jiang, Yuhang Pei, oxi Wu, Yan Zhao, Tianrun Wu, Shulong Yu, Lihui Zhang, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University UniTTEC Co. Ltd. Wuchan Zhongda Chengtou (Ningbo) Holdings. Ltd.

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GeoSeg通过结合大规模语言模型推理与精确定位,无需训练实现遥感图像分割的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01509 2026-03-03 cs.CV cs.AI 73%

Retrieval, Refinement, and Ranking for Text-to-Video Generation via Prompt Optimization and Test-Time Scaling

通过提示优化和测试时扩展实现文本到视频生成的检索、细化与排序

Zillur Rahman, Alex Sheng, Cristian Meo

机构 * Algoverse AI

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3R框架,通过提示优化和测试时扩展提升文本到视频生成的准确性与效率。

Comments 2026 ICLR TTU Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22426 2026-02-27 cs.CV cs.LG 73%

SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read

SimpleOCR: 将可视化问题呈现以教导大语言模型阅读

Yibo Peng, Peng Xia, Ding Zhong, Kaide Zeng, Siwei Han, Yiyang Zhou, Jiaqi Liu, Ruiyi Zhang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Adobe Research(Adobe研究)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 SimpleOCR通过强制模型视觉参与,解决多模态大语言模型在图像中阅读文本的性能问题,提升模型的视觉文本提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00523 2026-02-24 cs.AI cs.CV 73%

VIRTUE: Visual-Interactive Text-Image Universal Embedder

VIRTUE: 视觉-交互文本-图像通用嵌入器

Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团有限公司) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 VIRTUE通过引入视觉交互能力,提升图像和文本的联合表示学习,实现更精确的实体级信息处理和应用拓展。

Comments ICLR 2026. 25 pages. Project page: https://sony.github.io/virtue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13758 2026-02-17 cs.CV cs.AI 73%

OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding

OmniScience: 一个大规模多模态数据集用于科学图像理解

Haoyi Tao, Chaozheng Huang, Nan Wang, Han Lyu, Linfeng Zhang, Guolin Ke, Xi Fang

机构 * DP Technology(DP技术)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 OmniScience是一个大规模多模态数据集,通过动态模型路由生成高信息密度的图像标题,提升多模态模型在科学图像理解上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02186 2026-02-12 cs.CV cs.LG 73%

GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation

GeoPurify: 一种数据高效的几何蒸馏框架用于开放词汇3D分割

Weijia Dou, Xu Zhang, Yi Bin, Jian Liu, Bo Peng, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) Tianjin University(天津大学) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 GeoPurify通过几何蒸馏和亲和网络提升3D分割的数据效率,实现高效且准确的开放词汇3D分割

Comments Accepted at ICLR 2026. Code available at: https://github.com/tj12323/GeoPurify

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08717 2026-02-10 cs.CV cs.AI 73%

Zero-shot System for Automatic Body Region Detection for Volumetric CT and MR Images

零样本系统用于体积CT和MRI图像的自动身体区域检测

Farnaz Khun Jush, Grit Werner, Mark Klemens, Matthias Lenga

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出零样本系统用于体积CT和MRI图像自动身体区域检测,通过预训练模型实现无监督分割,展示了基于规则和多模态语言模型的性能对比。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04692 2026-02-09 cs.CV cs.AI 73%

DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking

DRMOT:用于RGBD参照多目标跟踪的数据集和框架

Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DRMOT任务,通过融合RGB、深度和语言信息,构建DRSet数据集并提出DRTrack框架,提升多目标跟踪的3D感知能力。

Comments https://github.com/chen-si-jia/DRMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 73%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00292 2026-02-03 cs.CV cs.AI 73%

LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification

LogicGaze:通过反事实验证基准测试视觉叙事中的因果一致性

Rory Driscoll, Alexandros Christoforos, Chadbourne Davis

机构 * Boston University(波士顿大学) Suffolk University(索尔福德大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 LogicGaze通过反事实验证基准测试,评估视觉语言模型在视觉叙事中因果一致性验证的能力,揭示了现有模型在处理因果链和幻觉问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00117 2026-02-03 cs.CV cs.AI 73%

IC-EO: Interpretable Code-based assistant for Earth Observation

IC-EO: 可解释的基于代码的地球观测助手

Lamia Lahouel, Laurynas Lopata, Simon Gruening, Gabriele Meoni, Gaetan Petit, Sylvain Lobry

机构 * Université Paris Cité, LIPADE, F-75006 Paris, France askEarth AG, Zurich, Switzerland ESA -lab, Frascati, Italy ESA, Advanced Concepts Studies Office, Noordwijk, the Netherlands

专题命中 视觉定位与Grounding :VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 IC-EO提出一个可解释的代码生成助手,通过生成可审计的Python工作流程,提升地球观测分析的透明性和可复现性,优于现有基线模型。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22114 2026-01-30 cs.CV cs.AI cs.SY eess.SY 73%

SINA: A Circuit Schematic Image-to-Netlist Generator Using Artificial Intelligence

SINA:一种使用人工智能的电路原理图到网表生成器

Saoud Aldowaish, Yashwanth Karumanchi, Kai-Chen Chiang, Soroosh Noorzad, Morteza Fayazi

机构 * University of Utah, Salt Lake City, UT, USA(犹他大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 SINA利用深度学习、CCL和OCR技术,结合视觉-语言模型,实现了高准确率的电路原理图到网表自动转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21199 2026-01-30 cs.CV cs.AI 73%

Thinker: A vision-language foundation model for embodied intelligence

Thinker:一个用于具身智能的视觉-语言基础模型

Baiyu Pan, Daqin Luo, Junpeng Yang, Jiyuan Wang, Yixuan Zhang, Hailin Shi, Jichao Jiao

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Thinker通过构建大规模数据集和改进输入方式,在机器人感知与推理任务中实现了最先进的性能。

Comments IROS 2025, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04655 2026-01-29 cs.CV cs.AI 73%

X-SAM: From Segment Anything to Any Segmentation

X-SAM:从Segment Anything到Any Segmentation

Hao Wang, Limeng Qiao, Zequn Jie, Zhijian Huang, Chengjian Feng, Qingfang Zheng, Lin Ma, Xiangyuan Lan, Xiaodan Liang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 X-SAM通过引入统一框架和VGD分割任务,提升多模态大语言模型的像素级视觉理解能力,实现更广泛的分割任务整合。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19222 2026-01-28 cs.CV cs.AI 73%

UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection

UniPCB: 一个统一的视觉-语言基准用于开放式PCB质量检测

Fuxiang Sun, Xi Jiang, Jiansheng Wu, Haigang Zhang, Feng Zheng, Jinfeng Yang

机构 * Shenzhen Polytechnic University(深圳职业技术大学) Southern University of Science and Technology(南方科技大学) University of Science and Technology Liaoning(辽宁科技大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 UniPCB提出一个统一的视觉-语言基准用于开放式PCB质量检测,通过系统化流程和PCB-GPT模型提升缺陷定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11031 2026-01-27 cs.LG cs.AI cs.CL 73%

Prefill-Guided Thinking for zero-shot detection of AI-generated images

预填充引导的思考用于AI生成图像的零样本检测

Zoher Kachwala, Danishjeet Singh, Danielle Yang, Filippo Menczer

机构 * Observatory on Social Media(社会媒体观察所) Indiana University(印第安纳大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出预填充引导思考方法,通过引导视觉-语言模型推理提升AI生成图像的零样本检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17844 2026-01-27 cs.HC cs.AI cs.LG 73%

RAICL: Retrieval-Augmented In-Context Learning for Vision-Language-Model Based EEG Seizure Detection

RAICL:基于视觉-语言模型的EEG癫痫检测的检索增强上下文学习

Siyang Li, Zhuoya Wang, Xiyan Gui, Xiaoqing Chen, Ziwei Wang, Yaozhi Wen, Dongrui Wu

机构 * Ministry of Education Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(教育部图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(脑认知与脑启发智能技术国家重点实验室,自动化研究所,中国科学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 RAICL通过利用视觉-语言模型分析EEG波形图,实现了更高效的癫痫检测,无需重新训练,具有广泛临床应用前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11808 2026-01-27 cs.CV cs.AI cs.CL cs.CY cs.MM 73%

Labels or Input? Rethinking Augmentation in Multimodal Hate Detection

标签还是输入?重新思考多模态仇恨检测中的增强

Sahajpreet Singh, Kokil Jaidka, Subhayan Mukerjee

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过提示优化、微调和自动化数据增强改进小型模型,开发多模态增强框架以提升隐含仇恨检测性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00662 2026-01-27 cs.CV cs.CL cs.LG 73%

Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias Estimation

弥合模态差距:基于多模态原型和图像偏差估计的少样本分布外检测

Yimu Wang, Evelien Riddell, Adrian Chow, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SUPREME框架,通过引入多模态原型和图像偏差估计,有效缓解图像与文本之间的模态差距,提升少样本分布外检测性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13142 2026-01-21 cs.CV cs.AI cs.CL 73%

TVWorld: Foundations for Remote-Control TV Agents

TVWorld: 电视遥控的基石

Zhantao Ma, Quanfeng Lu, Shuai Zhong, Dahai Yu, Ping Luo, Michael K. Ng

机构 * The University of Hong Kong(香港大学) Hong Kong Baptist University(香港 Baptist 大学) TCL Corporate Research (Hong Kong) Co., Ltd(TCL 香港企业研究有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 TVWorld提出了一种基于图的电视导航抽象,开发了TVWorld-N和TVWorld-G两个基准测试,通过拓扑感知训练框架TVTheseus实现了68.3%的成功率,超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24097 2026-01-01 cs.CV cs.AI cs.CL cs.MM 73%

Factorized Learning for Temporally Grounded Video-Language Models

分解学习用于时间感知的视频-语言模型

Wenzheng Zeng, Difei Gao, Mike Zheng Shou, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出D$^2$VLM框架,通过分解学习方法提升视频-语言模型在时间定位和文本响应任务中的性能,引入证据标记和FPO算法以优化学习过程。

Comments ICCV 2025 paper. This arXiv version updates Figure 1 to include the concurrent work Qwen2.5-VL to ensure consistency with Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23244 2025-12-30 cs.CV cs.AI 73%

ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing

ViLaCD-R1: 一种用于遥感语义变化检测的视觉-语言框架

Xingwei Ma, Shiyang Feng, Bo Zhang, Bin Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ViLaCD-R1通过多图像推理器和掩码引导解码器,提升遥感变化检测的语义识别与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14312 2025-12-17 cs.CV cs.AI 73%

From YOLO to VLMs: Advancing Zero-Shot and Few-Shot Detection of Wastewater Treatment Plants Using Satellite Imagery in MENA Region

从YOLO到VLMs:利用卫星图像在中东和北非地区推进零样本和少样本废水处理厂检测

Akila Premarathna, Kanishka Hewageegana, Garcia Andarcia Mariangel

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用VLMs替代YOLOv8,通过零样本和少样本方法高效识别中东和北非地区废水处理厂,提升遥感应用的可扩展性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04728 2025-12-05 cs.CV cs.AI 73%

Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild

测量未言之: 一种解耦模型和基准用于野外心理分析

Yigui Feng, Qinglin Wang, Haotian Mo, Yang Liu, Ke Liu, Gencheng Liu, Xinhai Chen, Siqi Shen, Songzhu Mei, Jie Liu

机构 * College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MIND模型和PRISM基准,通过解耦算法和专家标注数据提升野外对话心理分析的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02835 2025-12-03 cs.CV cs.AI cs.CL 73%

ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning

ReVSeg:通过强化学习激励视频分割的推理链

Yifan Li, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Xin Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) LIGHTSPEED

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 ReVSeg通过强化学习优化视频分割的多步推理链,实现可解释的推理轨迹和先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00287 2025-12-02 cs.RO cs.AI cs.CV 73%

RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals

RealAppliance: 让高保真家电资产可控且可操作,如对齐的现实手册

Yuzheng Gao, Yuxing Long, Lei Kang, Yuchong Guo, Ziyan Yu, Shangqing Mao, Jiyao Zhang, Ruihai Wu, Dongjiang Li, Hui Shen, Hao Dong

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 RealAppliance通过高保真家电资产和对齐手册的基准测试,推动家电操控技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18164 2025-11-25 cs.CV cs.AI 73%

Nested Unfolding Network for Real-World Concealed Object Segmentation

嵌套展开网络用于现实世界隐蔽物体分割

Chunming He, Rihan Zhang, Dingming Zhang, Fengyang Xiao, Deng-Ping Fan, Sina Farsiu

机构 * Duke University(杜克大学) Nankai University(南开大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出嵌套展开网络(NUN),通过解耦恢复与分割并引入自一致性损失,提升现实世界隐蔽物体分割的性能。

Comments 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏