arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2605.27924 2026-05-28 cs.CV 79%

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization

SIGMA: 基于语义差异的指令引导掩码标注器用于文本驱动图像操作定位

Peiyu Zhuang, Jianquan Yang, Haodong Li, Zhuoying Cai, Ruitao Xie, Jishen Zeng, Baoying Chen, Jiwu Huang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Guangdong Provincial Key Laboratory of Intelligent Information Processing and Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室和深圳媒体安全重点实验室) Shenzhen University of Advanced Technology and Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术大学和深圳先进技术研究所,中国科学院) Alibaba Group(阿里巴巴集团) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出SIGMA方法,通过视觉基础模型中的语义特征差异和指令引导的空间先验,自动从公开编辑数据集中生成像素级掩码,用于训练图像操作定位模型,在五个基准上F1提升12.20%,并生成约110万训练集使六个检测器平均F1提升18.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27168 2026-05-27 cs.CL cs.AI cs.CY 79%

Grounding Text Embeddings in Stakeholder Associations

将文本嵌入与利益相关者关联对齐

Jonathan Rystrøm, Sofie Burgos-Thorsen, Zihao Fu, Johan Irving Søltoft, Kenneth C. Enevoldsen, Chris Russell

机构 * University of Oxford(牛津大学) Institute for Wicked Problems(复杂问题研究所) The Chinese University of Hong Kong(香港中文大学) Danish Technical University(丹麦技术大学) Aarhus University(奥胡斯大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出利益相关者对齐练习方法,通过评估嵌入模型与人类专家的语义距离一致性,发现神经文本嵌入在丹麦政策案例中可靠性显著低于专家(差距19-26个百分点),且该差距在美国联邦AI用例中复现(16个百分点)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26421 2026-05-27 cs.CV 79%

HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection

HydraPrompt: 面向合成图像检测的视觉语言模型自适应非对称框架

Senyuan Shi, Hao Tan, Zichang Tan, Shuhan Feng, Ajian Liu, Sergio Escalera, Jun Wan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) University of Barcelona(巴塞罗那大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 提出一种非对称提示框架HydraPrompt,通过动态调整类别中心对齐细粒度图像线索,结合条件监督对比学习,实现合成图像检测的SOTA性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14882 2026-05-26 cs.MM cs.CL cs.CV cs.IR 79%

Hierarchical Local-Global Transformer for Temporal Sentence Grounding

层次化局部-全局Transformer用于时间语句定位

Xiang Fang, Daizong Liu, Pan Zhou, Zichuan Xu, Ruixuan Li

机构 * Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(大数据安全湖北工程研究中心,华中科技大学网络安全科学与工程学院) Wangxuan Institute of Computer fTechnology, Peking University(王宣计算机技术研究院,北京大学) School of software, Dalian University of Technology(软件学院,大连理工大学) School of Computer Science, and Technology, Huazhong University of Science, and Technology(计算机科学与技术学院,华中科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出层次化局部-全局Transformer(HLGT),通过建模视频和查询的不同粒度层次及跨模态交互,实现更细粒度的多模态表示,并在三个数据集上取得最先进性能。

Comments Publish in IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24553 2026-05-26 cs.CV 79%

IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring

IQA-Spider:统一多粒度图像质量评估与推理、定位和指代

Xinge Peng, Yiting Lu, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出IQA-Spider框架,通过统一推理、定位和指代任务,实现多粒度图像质量评估,并采用两阶段设计解决现有方法仅支持部分感知维度的问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15678 2026-05-26 cs.CV 79%

Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network

多对时序句子定位的多线程知识迁移网络

Xiang Fang, Wanlong Fang, Changshuo Wang, Daizong Liu, Keke Tang, Jianfeng Dong, Pan Zhou, Beibei Li

机构 * Sichuan University(四川大学) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Peking University(北京大学) Guangzhou University(广州大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出多对时序句子定位新任务,并设计多线程知识迁移网络,通过跨模态对比、原型对齐和自适应负样本选择实现多对视频-查询对的协同训练。

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22619 2026-05-22 cs.CV 79%

GLeVE: Graph-Guided Lesion Grounding with Proposal Verification in 3D CT

GLeVE: 在3D CT中基于图的病变接地与提案验证

Shuo Jiang, Yuhao Hong, Chunbo Jiang, Weihong Chen, Huangwei Chen, Shenghao Zhu, Beining Wu, Mingxuan Liu, Zhu Zhu, Feiwei Qin, Min Tan, Yifei Chen

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Children's Hospital, Zhejiang University School of Medicine(浙江大学医学院附属儿童医院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出GLeVE框架,通过图引导的病变接地和解剖学先验验证,解决3D CT中自由文本叙述与体积解剖之间的语义-空间差距问题,提升病变定位的准确性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21973 2026-05-22 cs.CV 79%

Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding

Foresee-to-Ground: 从预测性时间感知到证据驱动推理的视频时间接地

Zelin Zheng, Xinyan Liu, Ruixin Li, Antoni B. Chan, Guorong Li, Qingming Huang, Laiyun Qing

机构 * Qwen3-VL-8B-Instruct

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出了一种新的视频时间接地框架F2G,通过将时间接地问题重新表述为可验证的识别-测量问题,结合预测性时间感知和证据驱动推理,以提高时间接地的准确性和鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21244 2026-05-21 cs.CV 79%

SR-Ground: Image Quality Grounding for Super-Resolved Content

SR-Ground: 图像质量接地用于超分辨内容

Artem Borisov, Evgeney Bogatyrev, Khaled Abud, Dmitriy Vatolin

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) MSU AI Center, Lomonosov Moscow State University(MSU人工智能中心,莫斯科罗蒙诺索夫莫斯科国立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出SR-Ground数据集,用于超分辨图像中细粒度伪影分割,通过大规模众包研究生成高质量数据集,提升IQA模型性能并减少超分辨输出中的可感知伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02060 2026-05-19 cs.CV cs.RO 79%

CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects

CompassAD: 基于意图的多功能竞争物体3D affordance 地标

Jingliang Li, Jindou Jia, Tuo An, Chuhao Zhou, Xiangyu Chen, Shilin Shan, Boyu Ma, Bofan Lyu, Gen Li, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 该研究提出了一种新的3D affordance设定,即意图驱动的可混淆地标,旨在预测多物体点云中正确物体的每点affordance掩码,基于隐含的自然语言意图。通过构建CompassAD基准,该研究展示了在具有隐含意图的多物体组合中的先进结果,并在机器人机械臂上验证了其在真实世界抓取中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00876 2026-05-19 cs.AI cs.MA 79%

BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning

BioProAgent:用于受限科学规划的神经符号接地

Yuyang Liu, Jingya Wang, Liuzhenghao Lv, Yonghong Tian

机构 * School of AI for Science, Peking University(科学人工智能学院,北京大学) School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 BioProAgent通过神经符号框架将概率规划锚定在确定性有限状态机中,解决复杂设备模式中的上下文瓶颈,提升物理执行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13016 2026-05-15 cs.CV 79%

SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding

SVAG-Bench:多实例时空视频动作定位的大规模基准

Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

机构 * LMU Munich(慕尼黑大学) MCML Technical University of Munich(慕尼黑技术大学) University of Zurich(苏黎世大学) University of Oxford(牛津大学) Amazon(亚马逊) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13803 2026-05-14 cs.CV 79%

EvoGround: Self-Evolving Video Agents for Video Temporal Grounding

EvoGround:用于视频时间定位的自进化视频智能体

Minjoon Jung, Byoung-Tak Zhang, Lorenzo Torresani

机构 * Seoul National University(首尔国立大学) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出EvoGround框架,通过两个自进化智能体自学习视频时间定位,无需人工标注数据,在多个基准上表现优异。

Comments Project page: https://minjoong507.github.io/projects/EvoGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02752 2026-05-14 cs.CV 79%

Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting

真的计数吗?评估文本引导的类无关计数中的语义基础

Giacomo Pacini, Luca Ciampi, Nicola Messina, Nicola Tonellotto, Giuseppe Amato, Fabrizio Falchi

机构 * Institute of Information Science and Technologies of the National Research Council (ISTI-CNR)(意大利国家研究理事会信息科学与技术研究所) University of Pisa - Department of Information Engineering(比萨大学信息工程系)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文评估了文本引导的类无关计数中语义基础的重要性,提出新的评估框架和数据集,揭示现有模型在理解对象类别描述上的不足。

Comments Code available at https://github.com/ciampluca/PrACo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13122 2026-05-14 cs.CV 79%

Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation

图像编辑模型中的早期语义接地用于零样本指引用图像分割

Jingxuan He, Xiyu Wang, Yunke Wang, Mengyu Zheng, Chang Xu

机构 * The University of Sydney(悉尼大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文探讨利用图像编辑模型的隐含语义接地能力进行零样本指引用图像分割,通过分析发现早期去噪步骤即可实现前景背景分离,提出无需训练的框架利用预训练模型的中间表示进行分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18951 2026-05-14 cs.LG 79%

Benchmarking Attribute Discrimination in Infant-Scale Vision-Language Models

对婴儿级视觉-语言模型属性辨别能力的基准测试

Patrick Batsell, Satoshi Tsutsui, Bihan Wen

机构 * Rice University(里士大学) ROSE Lab(ROSE实验室) School of EEE, Nanyang Technological University(南洋理工大学电子工程学院)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.LG

AI总结 研究通过合成渲染对比颜色、尺寸和纹理属性,评估婴儿训练模型在属性辨别上的能力,发现其在视觉和语言属性信息上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV 79%

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02549 2026-05-13 cs.CV cs.CL 79%

DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding

DemaFormer: 带能量建模的阻尼指数移动平均变换器用于时序语言定位

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出DemaFormer,通过阻尼指数移动平均机制改进时序语言定位任务中的注意力机制,有效分离目标视频片段与其余片段。

Comments Accepted at EMNLP 2023 (Findings). Code is available at https://github.com/nguyentthong/demaformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09419 2026-05-12 cs.AI 79%

From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

从被动重用来主动推理:为神经符号经验回放构建大型语言模型

Yanan Xiao, Yixiang Tang, Zechen Feng, Lu Jiang, Minghao Yin, Pengyang Wang

机构 * Affiliation(机构1)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出神经符号经验回放框架,通过将经验回放从被动样本重用机制转变为知识构建的主动引擎,解决语言推理与数值优化的不兼容问题,提升样本效率和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08837 2026-05-12 cs.CL cs.AI 79%

The Grounding Gap: How LLMs Anchor the Meaning of Abstract Concepts Differently from Humans

概念基础差距:LLMs如何以不同于人类的方式锚定抽象概念的含义

Odysseas S. Chlapanis, Orfeas Menis Mastromichalakis, Christos H. Papadimitriou

机构 * Department of Informatics(信息学院) Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿基米德·雅典研究中心) Instituto de Telecomunicações(电信研究所) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究比较了LLMs与人类对抽象概念的锚定方式,发现LLMs过度依赖词关联,缺乏情感和内部状态属性,导致基础差距显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00963 2026-05-05 cs.RO cs.AI 79%

Ablation Study of Multimodal Perception, Language Grounding, and Control for Human-Robot Interaction in an Object Detection and Grasping Task

多模态感知、语言接地与控制在物体检测与抓取任务中的人机交互消融研究

Zi Tian, Guanting Shen

机构 * Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文通过消融研究探讨多模态感知、语言接地和控制模块对端到端性能的影响,评估最佳组合以优化执行时间和成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00684 2026-05-04 cs.CV 79%

Static and Dynamic Graph Alignment Network for Temporal Video Grounding

静态与动态图对齐网络用于时序视频定位

Zhanjie Hu, Bolin Zhang, Jianhua Wang, Jianbo Zheng, Chenchen Yan, Takahiro Komamizu, Ichiro Ide, Jiangbo Qian

机构 * Faculty of Electronic Engineering and Computer Science, Ningbo University(宁波大学电子工程与计算机科学学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) College of Computing and Engineering, Hunan Normal University(湖南师范大学计算机与工程学院) Faculty of Computing, Georg-August-Universität Göttingen(哥廷根大学计算机学院) Center for Artificial Intelligence, Mathematical and Data Science, Nagoya University(名古屋大学人工智能、数学与数据科学中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出SDGAN,通过联合静态和动态视觉特征构建互补的时序图,引入查询-片段对比学习和自适应图建模,结合多粒度时间提案和渐进易难训练策略,提升时序视频定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11831 2026-04-28 cs.CV 79%

Towards High-Fidelity CAD Generation via LLM-Driven Program Generation and Text-Based B-Rep Primitive Grounding

通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成

Jiahao Li, Qingwang Zhang, Qiuyu Chen, Guozhan Qiu, Yunzhong Lou, Xiangdong Zhou

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07157 2026-04-28 cs.CV 79%

Multi-Scale Contrastive Learning for Video Temporal Grounding

多尺度对比学习用于视频时间定位

Thong Thanh Nguyen, Yi Bin, Xiaobao Wu, Zhiyuan Hu, Cong-Duy T Nguyen, See-Kiong Ng, Anh Tuan Luu

机构 * Institute of Data Science (IDS), National University of Singapore(数据科学研究所(IDS),新加坡国立大学) Tongji University(同济大学) Nanyang Technological University (NTU)(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出多尺度对比学习框架,通过多阶段视频编码器生成样本,无需数据增强或在线记忆库,提升视频时间定位的语义表达。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15756 2026-04-20 cs.CL cs.CV 79%

TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models

TTL: 用于基于预训练视觉-语言模型的分布外检测的测试时文本学习

Jinlun Ye, Jiang Liao, Runhe Lai, Xinhua Lu, Jiaxin Zhuang, Zhiyong Gan, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) China United Network Communications Corporation Limited Guangdong Branch(中国联合网络通信集团有限公司广东分公司) Peng Cheng Laboratory(鹏城实验室) Hong Kong University of Science and Technology(香港科技大学) Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与高级计算重点实验室)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TTL框架,通过动态学习测试流中的分布外文本语义提升测试时分布外检测性能,实验表明其在多个基准上均取得最优效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14074 2026-04-16 cs.CV 79%

Training-Free Semantic Multi-Object Tracking with Vision-Language Models

无需训练的语义多目标跟踪与视觉-语言模型

Laurence Bonat, Francesco Tonini, Elisa Ricci, Lorenzo Vaquero

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

AI总结 本文提出TF-SMOT,一种无需训练的语义多目标跟踪方法,结合预训练组件生成时间一致的跟踪片段,并通过InternVideo2.5生成视频摘要和实例描述,同时通过语义检索提升交互识别性能。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10437 2026-04-14 cs.CV 79%

Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance

通过判别引导增强3D CT报告生成中的细粒度空间定位

Chenyu Wang, Weicheng Dai, Han Liu, Wenchao Li, Kayhan Batmanghelich

机构 * Boston University(波士顿大学) Siemens Healthineers(西门子医疗)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出DCP-PD框架,通过提炼自由文本报告中的细粒度线索,指导报告生成并减少对快捷方式的依赖,提升了CT-RATE和Rad-ChestCT的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09211 2026-04-14 cs.CV 79%

Affostruction: 3D Affordance Grounding with Generative Reconstruction

构形:基于生成重建的3D构形定位

Chunghyun Park, Seunghyeon Lee, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学) RLWRLD

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出Affostruction框架,通过生成式重建完整物体几何并基于全形体进行构形定位,优于现有方法,在构形定位和3D重建上取得显著成绩。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21078 2026-04-14 cs.CV 79%

Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization

面向视频时序动作定位中缓解模态偏差的视觉-语言模型

Jiaqi Li, Guangming Wang, Shuntian Zheng, Minzhe Ni, Xiaoman Lu, Guanghui Ye, Yu Guan

机构 * UVLab, Department of Computer Science, University of Warwick(华威大学计算机科学系UVLab) Department of Automation, University of Cambridge(剑桥大学自动化系) Department of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ActionVLM框架,通过去偏差重加权模块和残差聚合策略缓解视频时序动作定位中的模态偏差,提升时间推理能力,在THUMOS14数据集上取得3.2%的mAP提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02598 2026-04-13 cs.HC cs.AI cs.PL 79%

Explorable Theorems: Making Written Theorems Explorable by Grounding Them in Formal Representations

可探索的定理:通过将其基于形式化表示来使书面定理可探索

Hita Kambhamettu, Will Crichton, Sean Welleck, Harrison Goldstein, Andrew Head

机构 * University of Pennsylvania(宾夕法尼亚大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出可探索的定理系统,利用LLM将定理和证明转化为Lean语言,使用户能交互式地逐步验证证明并测试例子,提升数学理解。

详情

展开后加载摘要…

URL PDF HTML 收藏