arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7494 篇

2605.21973 2026-05-22 cs.CV 79%

Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

Foresee-to-Ground: 从预测性时间感知到证据驱动推理的视频时间接地

Zelin Zheng, Xinyan Liu, Ruixin Li, Antoni B. Chan, Guorong Li, Qingming Huang, Laiyun Qing

机构 * Qwen3-VL-8B-Instruct

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出了一种新的视频时间接地框架F2G,通过将时间接地问题重新表述为可验证的识别-测量问题,结合预测性时间感知和证据驱动推理,以提高时间接地的准确性和鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21244 2026-05-21 cs.CV 79%

SR-Ground: Image Quality Grounding for Super-Resolved Content

SR-Ground: 图像质量接地用于超分辨内容

Artem Borisov, Evgeney Bogatyrev, Khaled Abud, Dmitriy Vatolin

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) MSU AI Center, Lomonosov Moscow State University(MSU人工智能中心,莫斯科罗蒙诺索夫莫斯科国立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出SR-Ground数据集,用于超分辨图像中细粒度伪影分割,通过大规模众包研究生成高质量数据集,提升IQA模型性能并减少超分辨输出中的可感知伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02060 2026-05-19 cs.CV cs.RO 79%

CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects

CompassAD: 基于意图的多功能竞争物体3D affordance 地标

Jingliang Li, Jindou Jia, Tuo An, Chuhao Zhou, Xiangyu Chen, Shilin Shan, Boyu Ma, Bofan Lyu, Gen Li, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 该研究提出了一种新的3D affordance设定,即意图驱动的可混淆地标,旨在预测多物体点云中正确物体的每点affordance掩码,基于隐含的自然语言意图。通过构建CompassAD基准,该研究展示了在具有隐含意图的多物体组合中的先进结果,并在机器人机械臂上验证了其在真实世界抓取中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00876 2026-05-19 cs.AI cs.MA 79%

BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning

BioProAgent:用于受限科学规划的神经符号接地

Yuyang Liu, Jingya Wang, Liuzhenghao Lv, Yonghong Tian

机构 * School of AI for Science, Peking University(科学人工智能学院,北京大学) School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 BioProAgent通过神经符号框架将概率规划锚定在确定性有限状态机中,解决复杂设备模式中的上下文瓶颈,提升物理执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13016 2026-05-15 cs.CV 79%

SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding

SVAG-Bench:多实例时空视频动作定位的大规模基准

Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

机构 * LMU Munich(慕尼黑大学) MCML Technical University of Munich(慕尼黑技术大学) University of Zurich(苏黎世大学) University of Oxford(牛津大学) Amazon(亚马逊) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13803 2026-05-14 cs.CV 79%

EvoGround: Self-Evolving Video Agents for Video Temporal Grounding

EvoGround:用于视频时间定位的自进化视频智能体

Minjoon Jung, Byoung-Tak Zhang, Lorenzo Torresani

机构 * Seoul National University(首尔国立大学) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出EvoGround框架,通过两个自进化智能体自学习视频时间定位,无需人工标注数据,在多个基准上表现优异。

Comments Project page: https://minjoong507.github.io/projects/EvoGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02752 2026-05-14 cs.CV 79%

Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

真的计数吗?评估文本引导的类无关计数中的语义基础

Giacomo Pacini, Luca Ciampi, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi

机构 * Institute of Information Science and Technologies of the National Research Council (ISTI-CNR)(意大利国家研究理事会信息科学与技术研究所) University of Pisa - Department of Information Engineering(比萨大学信息工程系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文评估了文本引导的类无关计数中语义基础的重要性,提出新的评估框架和数据集,揭示现有模型在理解对象类别描述上的不足。

Comments Code available at https://github.com/ciampluca/PrACo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13122 2026-05-14 cs.CV 79%

Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation

图像编辑模型中的早期语义接地用于零样本指引用图像分割

Jingxuan He, Xiyu Wang, Yunke Wang, Mengyu Zheng, Chang Xu

机构 * The University of Sydney(悉尼大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文探讨利用图像编辑模型的隐含语义接地能力进行零样本指引用图像分割,通过分析发现早期去噪步骤即可实现前景背景分离,提出无需训练的框架利用预训练模型的中间表示进行分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18951 2026-05-14 cs.LG 79%

Benchmarking Attribute Discrimination in Infant-Scale Vision-Language Models

对婴儿级视觉-语言模型属性辨别能力的基准测试

Patrick Batsell, Satoshi Tsutsui, Bihan Wen

机构 * Rice University(里士大学) ROSE Lab(ROSE实验室) School of EEE, Nanyang Technological University(南洋理工大学电子工程学院)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.LG

AI总结 研究通过合成渲染对比颜色、尺寸和纹理属性,评估婴儿训练模型在属性辨别上的能力,发现其在视觉和语言属性信息上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV 79%

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02549 2026-05-13 cs.CV cs.CL 79%

DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding

DemaFormer: 带能量建模的阻尼指数移动平均变换器用于时序语言定位

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出DemaFormer,通过阻尼指数移动平均机制改进时序语言定位任务中的注意力机制,有效分离目标视频片段与其余片段。

Comments Accepted at EMNLP 2023 (Findings). Code is available at https://github.com/nguyentthong/demaformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09419 2026-05-12 cs.AI 79%

From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

从被动重用来主动推理:为神经符号经验回放构建大型语言模型

Yanan Xiao, Yixiang Tang, Zechen Feng, Lu Jiang, Minghao Yin, Pengyang Wang

机构 * Affiliation(机构1)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出神经符号经验回放框架,通过将经验回放从被动样本重用机制转变为知识构建的主动引擎,解决语言推理与数值优化的不兼容问题,提升样本效率和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08837 2026-05-12 cs.CL cs.AI 79%

The Grounding Gap: How LLMs Anchor the Meaning of Abstract Concepts Differently from Humans

概念基础差距:LLMs如何以不同于人类的方式锚定抽象概念的含义

Odysseas S. Chlapanis, Orfeas Menis Mastromichalakis, Christos H. Papadimitriou

机构 * Department of Informatics(信息学院) Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿基米德·雅典研究中心) Instituto de Telecomunicações(电信研究所) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究比较了LLMs与人类对抽象概念的锚定方式,发现LLMs过度依赖词关联,缺乏情感和内部状态属性,导致基础差距显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00963 2026-05-05 cs.RO cs.AI 79%

Ablation Study of Multimodal Perception, Language Grounding, and Control for Human-Robot Interaction in an Object Detection and Grasping Task

多模态感知、语言接地与控制在物体检测与抓取任务中的人机交互消融研究

Zi Tian, Guanting Shen

机构 * Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文通过消融研究探讨多模态感知、语言接地和控制模块对端到端性能的影响,评估最佳组合以优化执行时间和成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00684 2026-05-04 cs.CV 79%

Static and Dynamic Graph Alignment Network for Temporal Video Grounding

静态与动态图对齐网络用于时序视频定位

Zhanjie Hu, Bolin Zhang, Jianhua Wang, Jianbo Zheng, Chenchen Yan, Takahiro Komamizu, Ichiro Ide, Jiangbo Qian

机构 * Faculty of Electronic Engineering and Computer Science, Ningbo University(宁波大学电子工程与计算机科学学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) College of Computing and Engineering, Hunan Normal University(湖南师范大学计算机与工程学院) Faculty of Computing, Georg-August-Universität Göttingen(哥廷根大学计算机学院) Center for Artificial Intelligence, Mathematical and Data Science, Nagoya University(名古屋大学人工智能、数学与数据科学中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出SDGAN,通过联合静态和动态视觉特征构建互补的时序图,引入查询-片段对比学习和自适应图建模,结合多粒度时间提案和渐进易难训练策略,提升时序视频定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11831 2026-04-28 cs.CV 79%

Towards High-Fidelity CAD Generation via LLM-Driven Program Generation and Text-Based B-Rep Primitive Grounding

通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成

Jiahao Li, Qingwang Zhang, Qiuyu Chen, Guozhan Qiu, Yunzhong Lou, Xiangdong Zhou

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07157 2026-04-28 cs.CV 79%

Multi-Scale Contrastive Learning for Video Temporal Grounding

多尺度对比学习用于视频时间定位

Thong Thanh Nguyen, Yi Bin, Xiaobao Wu, Zhiyuan Hu, Cong-Duy T Nguyen, See-Kiong Ng, Anh Tuan Luu

机构 * Institute of Data Science (IDS), National University of Singapore(数据科学研究所(IDS),新加坡国立大学) Tongji University(同济大学) Nanyang Technological University (NTU)(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出多尺度对比学习框架,通过多阶段视频编码器生成样本,无需数据增强或在线记忆库,提升视频时间定位的语义表达。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15756 2026-04-20 cs.CL cs.CV 79%

TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models

TTL: 用于基于预训练视觉-语言模型的分布外检测的测试时文本学习

Jinlun Ye, Jiang Liao, Runhe Lai, Xinhua Lu, Jiaxin Zhuang, Zhiyong Gan, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) China United Network Communications Corporation Limited Guangdong Branch(中国联合网络通信集团有限公司广东分公司) Peng Cheng Laboratory(鹏城实验室) Hong Kong University of Science and Technology(香港科技大学) Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与高级计算重点实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TTL框架,通过动态学习测试流中的分布外文本语义提升测试时分布外检测性能,实验表明其在多个基准上均取得最优效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14074 2026-04-16 cs.CV 79%

Training-Free Semantic Multi-Object Tracking with Vision-Language Models

无需训练的语义多目标跟踪与视觉-语言模型

Laurence Bonat, Francesco Tonini, Elisa Ricci, Lorenzo Vaquero

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

AI总结 本文提出TF-SMOT,一种无需训练的语义多目标跟踪方法,结合预训练组件生成时间一致的跟踪片段,并通过InternVideo2.5生成视频摘要和实例描述,同时通过语义检索提升交互识别性能。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10437 2026-04-14 cs.CV 79%

Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance

通过判别引导增强3D CT报告生成中的细粒度空间定位

Chenyu Wang, Weicheng Dai, Han Liu, Wenchao Li, Kayhan Batmanghelich

机构 * Boston University(波士顿大学) Siemens Healthineers(西门子医疗)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出DCP-PD框架,通过提炼自由文本报告中的细粒度线索,指导报告生成并减少对快捷方式的依赖,提升了CT-RATE和Rad-ChestCT的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09211 2026-04-14 cs.CV 79%

Affostruction: 3D Affordance Grounding with Generative Reconstruction

构形:基于生成重建的3D构形定位

Chunghyun Park, Seunghyeon Lee, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学) RLWRLD

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出Affostruction框架,通过生成式重建完整物体几何并基于全形体进行构形定位,优于现有方法,在构形定位和3D重建上取得显著成绩。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21078 2026-04-14 cs.CV 79%

Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization

面向视频时序动作定位中缓解模态偏差的视觉-语言模型

Jiaqi Li, Guangming Wang, Shuntian Zheng, Minzhe Ni, Xiaoman Lu, Guanghui Ye, Yu Guan

机构 * UVLab, Department of Computer Science, University of Warwick(华威大学计算机科学系UVLab) Department of Automation, University of Cambridge(剑桥大学自动化系) Department of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ActionVLM框架,通过去偏差重加权模块和残差聚合策略缓解视频时序动作定位中的模态偏差,提升时间推理能力,在THUMOS14数据集上取得3.2%的mAP提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02598 2026-04-13 cs.HC cs.AI cs.PL 79%

Explorable Theorems: Making Written Theorems Explorable by Grounding Them in Formal Representations

可探索的定理:通过将其基于形式化表示来使书面定理可探索

Hita Kambhamettu, Will Crichton, Sean Welleck, Harrison Goldstein, Andrew Head

机构 * University of Pennsylvania(宾夕法尼亚大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出可探索的定理系统,利用LLM将定理和证明转化为Lean语言,使用户能交互式地逐步验证证明并测试例子,提升数学理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21840 2026-04-10 eess.IV cs.CV 79%

Vision Language Models versus Machine Learning Models Performance on Polyp Detection and Classification in Colonoscopy Images

视觉语言模型与机器学习模型在结肠镜图像息肉检测与分类中的性能对比

Mohammad Amin Khalafi, Seyed Amir Ahmad Safavi-Naini, Ameneh Salehi, Nariman Naderi, Dorsa Alijanzadeh, Pardis Ketabi Moghadam, Kaveh Kavosi, Negar Golestani, Shabnam Shahrokh, Soltanali Fallah, Jamil S Samaan, Nicholas P. Tatonetti, Nicholas Hoerter, Girish Nadkarni, Hamid Asadzadeh Aghdaei, Ali Soroush

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文对比了视觉语言模型与传统机器学习模型在结肠镜图像息肉检测和分类任务中的性能,发现ResNet50在检测任务中表现最佳,而BiomedCLIP和GPT-4在特定情况下也表现出色。

Comments Code is available at: https://github.com/aminkhalafi/CML-vs-LLM-on-Polyp-Detection. CoI: AlSo serves on the advisory board and holds equity in Virgo Surgical Solutions. The other authors declare no conflicts of interest. Data

Journal ref Scientific Reports 15, 45484 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06824 2026-04-09 cs.CV 79%

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

专题命中 视觉定位与Grounding :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00643 2026-04-09 cs.CV 79%

Grounding Surgical Action Triplets with Instrument Instance Segmentation: A Dataset and Target-Aware Fusion Approach

通过仪器实例分割接地手术动作三元组:一个数据集和目标感知融合方法

Oluwatosin Alabi, Meng Wei, Charlie Budd, Tom Vercauteren, Miaojing Shi

机构 * Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出通过仪器实例分割接地手术动作三元组,引入CholecTriplet-Seg数据集和TargetFusionNet架构,提升手术场景中动作理解的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02323 2026-04-03 cs.CV 79%

Beyond Referring Expressions: Scenario Comprehension Visual Grounding

超越指称表达:场景理解视觉 grounding

Ruozhen He, Nisarg A. Shah, Qihua Dong, Zilin Xiao, Jaywon Koo, Vicente Ordonez

机构 * Rice University(莱斯大学) Johns Hopkins University(约翰霍普金斯大学) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出RSC基准,探索基于场景的视觉 grounding,通过角色、意图和关系上下文推断目标,而非显式命名。ScenGround方法结合监督预热与难度感知强化学习,提升模型在复杂场景下的表现。

Comments 20 pages, 18 figures, Project Page: https://catherine-r-he.github.io/RSC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16880 2026-04-03 eess.SP cs.CL cs.LG q-bio.NC 79%

NeuroNarrator: A Generalist EEG-to-Text Foundation Model for Clinical Interpretation via Spectro-Spatial Grounding and Temporal State-Space Reasoning

NeuroNarrator:一种通过频谱-空间定位和时间状态空间推理的通用EEG到文本基础模型,用于临床解释

Guoan Wang, Shihao Yang, Jun-en Ding, Hao Zhu, Feng Liu

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 NeuroNarrator通过频谱-空间定位和时间状态空间推理,将EEG信号转化为临床文本,解决传统EEG分析方法在临床解释中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01893 2026-04-03 cs.CV 79%

ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery

ProVG:通过语言解耦实现遥感图像的渐进式视觉定位

Ke Li, Ting Wang, Di Wang, Yongshan Zhu, Yiming Zhang, Tao Lei, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 ProVG通过解耦语言表达为全局上下文、空间关系和对象属性,提出一种改进遥感图像定位精度的新框架,采用渐进式跨模态调节器和跨尺度融合模块,实现更精确的视觉语言对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00507 2026-04-02 cs.CV 79%

RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

RegFormer:可转移的交互关系接地以实现高效的弱监督人类-物体交互检测

Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) LG Energy Solution(LG新能源) Korea University(高丽大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 RegFormer通过空间接地信号实现高效的弱监督人类-物体交互检测,无需额外训练即可直接迁移至实例级推理,实验表明其在效率和性能上均优于传统方法。

Comments Accepted at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏