arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2603.09733 2026-03-11 cs.CV cs.MA 57%

FetalAgents: A Multi-Agent System for Fetal Ultrasound Image and Video Analysis

FetalAgents:一种用于胎儿超声图像和视频分析的多智能体系统

Xiaotian Hu, Junwei Huang, Mingxuan Liu, Kasidit Anmahapong, Yifei Chen, Yitong Luo, Yiming Huang, Xuguang Bai, Zihan Li, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Tsinghua University(清华大学) University of California San Diego(加州大学圣地亚哥分校) West China Second University Hospital, Sichuan University(四川大学华西第二医院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 FetalAgents是一种多智能体系统,通过动态协调视觉专家,实现胎儿超声图像和视频的端到端分析与报告,提供高准确性和流程对齐的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09611 2026-03-11 cs.CV 57%

ParTY: Part-Guidance for Expressive Text-to-Motion Synthesis

ParTY: 部分引导用于表达性文本到运动合成

KunHo Heo, SuYeon Kim, Yonghyun Gwon, Youngbin Kim, MyeongAh Cho

机构 * Kyung Hee University(庆熙大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 ParTY通过部分引导网络、部分感知文本定位和整体-部分融合,提升文本到运动合成中部分表现力和动作连贯性。

Comments Accepted by CVPR 2026. Code: https://github.com/VisualScienceLab-KHU/ParTY

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09192 2026-03-11 cs.AI 57%

Explainable Innovation Engine: Dual-Tree Agent-RAG with Methods-as-Nodes and Verifiable Write-Back

可解释的创新引擎:双树代理-RAG与方法作为节点和可验证的写回

Renwei Meng

机构 * Anhui University(安徽大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出了一种双树代理-RAG框架,通过方法作为节点和可验证的写回机制,提升代理系统在可控、可解释和可验证创新方面的性能。

Comments 15pages, 4figures, code available on Github

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09020 2026-03-11 cs.HC cs.AI 57%

AI Phenomenology for Understanding Human-AI Experiences Across Eras

人工智能现象学:理解跨时代的以人为本的AI体验

Bhada Yun, Evgenia Taranova, Dana Feng, Renn Su, April Yi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) University of Bergen(卑尔根大学) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出人工智能现象学,通过研究用户与AI交互的主观体验,促进双向人机对齐,并提供可重复的方法论工具。

Comments This is an accepted workshop paper at CHI '26, "W37: Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures", or https://bialign-workshop.github.io/2026/cfp

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08814 2026-03-11 cs.RO cs.AI cs.ET cs.MA 57%

Scale-Plan: Scalable Language-Enabled Task Planning for Heterogeneous Multi-Robot Teams

Scale-Plan: 为异构多机器人团队实现可扩展的语言赋能任务规划

Piyush Gupta, Sangjae Bae, Jiachen Li, David Isele

机构 * Honda Research Institute(本田研究院) University of California(加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Scale-Plan通过生成紧凑的任务相关问题表示,提升异构多机器人团队的可扩展性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08347 2026-03-10 cs.CV 57%

Local-Global Prompt Learning via Sparse Optimal Transport

通过稀疏最优传输实现局部-全局提示学习

Deniz Kizaroğlu, Ülku Tuncer Küçüktas, Emre Çakmakyurdu, Alptekin Temizel

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SOT-GLP通过稀疏最优传输实现局部-全局提示学习,提升少样本分类和分布外检测性能。

Comments 9 pages, 3 figures, 4 tables. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07952 2026-03-10 cs.CV 57%

VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

VisualAD: 通过视觉变换器实现无语言零样本异常检测

Yanning Hou, Peiyuan Li, Zirui Liu, Yitong Wang, Yanran Ruan, Jianfeng Qiu, Ke Xu

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei, China(光电信息采集与防护技术国家重点实验室,安徽大学,合肥,中国) School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) College of Intelligence Science and Technology, National University of Defense Technology, Changsha, China(智能科学与技术学院,国防科技大学,长沙,中国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 VisualAD通过纯视觉变换器实现无语言零样本异常检测,引入可学习标记和空间感知模块,提升异常检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07525 2026-03-10 cs.LG 57%

Generative prediction of laser-induced rocket ignition with dynamic latent space representations

基于动态潜在空间表示的激光诱导火箭点火生成预测

Tony Zahtila, Ettore Saetta, Murray Cutforth, Davy Brouzet, Diego Rossinelli, Gianluca Iaccarino

机构 * Center for Turbulence Research(湍流研究中心) Stanford University(斯坦福大学) University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出基于动态潜在空间表示的生成预测方法,用于高效模拟激光点火火箭点火过程,显著降低预测成本并提升模拟效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18853 2026-03-10 cs.CV 57%

Open-Vocabulary Domain Generalization in Urban-Scene Segmentation

面向城市场景分割的开放词汇领域泛化

Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OVDG-SS,通过S2-Corr机制提升城市场景分割中开放词汇领域的泛化能力和鲁棒性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07264 2026-03-10 cs.RO cs.AI 57%

Kinematics-Aware Latent World Models for Data-Efficient Autonomous Driving

具备运动学意识的潜在世界模型用于数据高效的自动驾驶

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(道路与交通工程重点实验室,教育部,同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种具备运动学意识的潜在世界模型框架,通过整合车辆运动学信息提升自动驾驶的样本效率和驾驶性能。

Comments 6 pages, 5 figures. Under review at IEEE ITSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07098 2026-03-10 cs.CV 57%

NuNext: Reframing Nucleus Detection as Next-Point Detection

NuNext:将核检测重新表述为下一个点检测

Zhongyi Shui, Honglin Li, Xiaozhong Ji, Ye Zhang, Zijiang Yang, Chenglu Zhu, Yuxuan Sun, Kai Yao, Conghui He, Cheng Tan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology Beijing(北京科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 NuNext通过多模态大语言模型直接输出核质心,采用空间感知软监督和强化微调策略提升检测性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07022 2026-03-10 cs.CV 57%

OV-DEIM: Real-time DETR-Style Open-Vocabulary Object Detection with GridSynthetic Augmentation

OV-DEIM:基于网格合成增强的实时开放词汇目标检测

Leilei Wang, Longfei Liu, Xi Shen, Xuanlong Yu, Ying Tiffany He, Fei Richard Yu, Yingyi Chen

机构 * Intellindust AI Lab(Intellindust AI实验室) Guangdong Laboratory of Artificial Intelligence(广东人工智能实验室) College of Computer Science(计算机科学学院) Software Engineering, Shenzhen University, China(软件工程,深圳大学,中国) School of Information Technology, Carleton University, Canada(信息科技学院,卡尔顿大学,加拿大) Institute for Research in Biomedicine, Bellinzona, Switzerland(生物医学研究 institute,贝尔林扎,瑞士)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 OV-DEIM提出了一种基于DEIMv2框架的实时开放词汇目标检测方法,结合网格合成增强策略提升效率和罕见类别识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06630 2026-03-10 physics.soc-ph cs.AI 57%

Photons = Tokens: The Physics of AI and the Economics of Knowledge

光子等于标记:人工智能的物理与知识经济

Alec Litowitz, Nick Polson, Vadim Sokolov

机构 * QStar Capital(QStar资本) University of Chicago(芝加哥大学) George Mason University(乔治·梅森大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过物理和经济视角,探讨人工智能计算中标记的热力学成本及人类能向AI系统提出的问题数量限制,揭示经济价值集中与监管必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24850 2026-03-10 cs.CV 57%

PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement

PHASE-Net:基于物理的谐波注意力系统用于高效的远程光体积脉搏波测记测量

Bo Zhao, Dan Guo, Junzhe Cao, Yong Xu, Bochao Zou, Tao Tan, Yue Sun, Zitong Yu

机构 * Great Bay University(大湾大学) Hefei University of Technology(合肥工业大学) Macao Polytechnic University(澳门 polytechnic 大学) University of Science and Technology Beijing(北京科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 PHASE-Net基于物理原理设计,通过谐波注意力系统实现高效的远程光体积脉搏波测记测量,提升鲁棒性和可解释性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24099 2026-03-10 cs.CV 57%

Unified Multi-Modal Interactive & Reactive 3D Motion Generation via Rectified Flow

通过修正流实现统一的多模态交互与反应3D运动生成

Prerit Gupta, Shourya Verma, Ananth Grama, Aniket Bera

机构 * Department of Computer Science Purdue University(计算机科学系 哈佛大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 DualFlow通过修正流实现多模态双人运动生成,提升运动质量与节奏同步性。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06167 2026-03-09 cs.CV 57%

A Semi-Supervised Framework for Breast Ultrasound Segmentation with Training-Free Pseudo-Label Generation and Label Refinement

一种用于乳腺超声分割的半监督框架,具有无训练伪标签生成和标签细化

Ruili Li, Jiayi Ding, Ruiyu Li, Yilun Jin, Shiwen Ge, Yuwen Zeng, Xiaoyong Zhang, Eichi Takaya, Jan Vrba, Noriyasu Homma

机构 * Tohoku University Graduate School of Medicine(东北大学医学研究科) Advanced Institute of Convergence Knowledge Informatics(融合知识信息先进研究所) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) National Institute of Technology, Sendai College(名古屋国立技术大学送崎学院) State Key Laboratory of Oncology in South China, Sun Yat-sen University Cancer Center(南方肿瘤学国家重点实验室,中山大学肿瘤中心) Department of Mathematics, Informatics, and Cybernetics, University of Chemistry and Technology(化学与技术大学数学、信息学与自动控制系) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Southeast University, School of Cyber Science and Engineering(东南大学网络科学与工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种无训练伪标签生成和标签细化的半监督框架,通过跨域结构迁移提升乳腺超声分割性能,实现低标注下的高效分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06081 2026-03-09 cs.CV 57%

Lyapunov Probes for Hallucination Detection in Large Foundation Models

Lyapunov探针用于大型基础模型中的幻觉检测

Bozhi Luan, Gen Li, Yalan Qin, Jifeng Guo, Yun Zhou, Faguo Wu, Hongwei Zheng, Wenjun Wu, Zhaoxin Fan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) School of Electronic and Information Engineering, State Key Laboratory of CNS/ATM, Beihang University(电子与信息工程学院, CNS/ATM 国家重点实验室,北航) National Key Laboratory of Information Systems Engineering, National University of Defense Technology(信息系统工程国家重点实验室,国防科技大学) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Shanghai University(上海大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 通过Lyapunov探针检测大型基础模型中的幻觉,利用动力系统稳定性理论分析知识过渡区域的边界特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06022 2026-03-09 cs.CV 57%

MOSIV: Multi-Object System Identification from Videos

MOSIV:从视频中多物体系统识别

Chunjiang Liu, Xiaoyuan Wang, Qingran Lin, Albert Xiao, Haoyu Chen, Shizheng Wen, Hao Zhang, Lu Qi, Ming-Hsuan Yang, Laszlo A. Jeni, Min Xu, Yizhou Zhao

机构 * CMU(卡内基梅隆大学) Georgia Tech(佐治亚理工学院) Harvard(哈佛大学) ETH Zurich(苏黎世联邦理工学院) UIUC(伊利诺伊大学香槟分校) Insta360 UC Merced(加州大学默塞德分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MOSIV通过从视频中导出的几何目标直接优化连续材料参数,提升多物体系统识别的接地准确性和模拟保真度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05832 2026-03-09 cs.HC cs.AI 57%

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

Lexara: 一种以用户为中心的评估工具包,用于评估用于对话式可视化分析的大型语言模型

Srishti Palani, Vidya Setlur

机构 * Tableau Research, Salesforce(Tableau研究机构,Salesforce)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Lexara是一种以用户为中心的评估工具包,用于评估对话式可视化分析中的大型语言模型,通过多格式输出的可解释指标和交互式工具帮助用户进行模型和提示选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21835 2026-03-09 cs.CV 57%

UniVBench: Towards Unified Evaluation for Video Foundation Models

UniVBench:迈向统一评估视频基础模型

Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) Zhejiang Lab(浙江实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 UniVBench通过统一评估系统和多任务视频任务,首次提供衡量视频基础模型综合能力的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15849 2026-03-09 cs.CL cs.AI 57%

IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR

IntelliAsk: 通过RLVR学习生成高质量的研究问题

Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 IntelliAsk通过RLVR技术提升生成问题的质量,生成更深入、基于证据的问题,优于现有基线模型。

Comments 24 Pages, v2, Abstract Modified

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04920 2026-03-06 cs.AI 57%

Knowledge-informed Bidding with Dual-process Control for Online Advertising

基于双重过程控制的知识引导竞价

Huixiang Luo, Longyu Gao, Yaqi Liu, Qianqian Chen, Pingchun Huang, Tianning Li

机构 * Alibaba Health(阿里巴巴健康)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 KBD通过结合人类专业知识和双重过程控制,提升在线广告竞价优化的适应性和全局一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04896 2026-03-06 cs.AI 57%

Authorize-on-Demand: Dynamic Authorization with Legality-Aware Intellectual Property Protection for VLMs

按需授权:面向大型语言模型的动态授权与合法性感知知识产权保护

Lianyu Wang, Meng Wang, Huazhu Fu, Daoqiang Zhang

机构 * The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, China(脑机智能技术重点实验室,教育部,中国) Centre for Innovation and Precision Eye Health, Yong Loo Lin School of Medicine, NUS, Singapore(创新与精准眼健康中心,尤洛林医学院,国立新加坡大学,新加坡) Department of Ophthalmology, Yong Loo Lin School of Medicine, NUS, Singapore(眼科部,尤洛林医学院,国立新加坡大学,新加坡) Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 本文提出AoD-IP框架,通过动态授权和合法性感知机制,实现对视觉-语言模型的灵活知识产权保护,支持按需授权和自适应部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04746 2026-03-06 cs.AI cs.HC econ.GN q-fin.EC 57%

Visioning Human-Agentic AI Teaming: Continuity, Tension, and Future Research

展望人机协同AI:连续性、张力与未来研究

Bowen Lou, Tian Lu, T. S. Raghu, Yingjie Zhang

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Team SA理论作为人机协同AI转型的整合锚点,探讨在适应性自主下持续对齐的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04454 2026-03-06 cs.CL cs.AI 57%

Query Disambiguation via Answer-Free Context: Doubling Performance on Humanity's Last Exam

通过无答案上下文进行查询消歧:在人类最后一场考试中性能翻倍

Michael Majurski, Cynthia Matuszek

机构 * National Institute of Standards and Technology(国家标准与技术研究院) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 通过无答案上下文重写问题以减少歧义,显著提升模型在Humanity's Last Exam上的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03762 2026-03-05 cs.CV 57%

Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解

Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24178 2026-03-05 cs.CL cs.AI 57%

MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations

MuSaG:一个包含完整模态标注的多模态德语讽刺数据集

Aaron Scott, Maike Züfle, Jan Niehues

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 MuSaG是一个包含多模态标注的德语讽刺数据集,通过对比人类标注与多种模型性能,揭示了多模态模型在现实场景中的改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01222 2026-03-05 cs.CL cs.AI 57%

WebDS: An End-to-End Benchmark for Web-based Data Science

WebDS: 一种端到端的基于网络的数据科学基准

Ethan Hsu, Hong Meng Yam, Ines Bouissou, Aaron Murali John, Raj Thota, Josh Koe, Vivek Sarath Putta, G K Dharesan, Alexander Spangher, Shikhar Murty, Tenghao Huang, Christopher D. Manning

机构 * Stanford University(斯坦福大学) Pinetree Research(Pinetree研究公司) University of California, Berkeley(加州大学伯克利分校) Singapore University of Technology and Design(新加坡科技设计大学) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 WebDS提出了一种端到端的基于网络的数据科学基准,旨在评估代理在复杂多步骤任务中的表现,揭示当前LLM在实际数据科学任务中的性能差距。

Comments 14 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06912 2026-03-05 cs.RO cs.AI 57%

A Bayesian Framework for Active Tactile Object Recognition, Pose Estimation and Shape Transfer Learning

基于贝叶斯框架的主动触觉物体识别、姿态估计与形状迁移学习

Haodong Zheng, Andrei Jalba, Raymond H. Cuijpers, Wijnand IJsselsteijn, Sanne Schoenmakers

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于贝叶斯框架的主动触觉系统,结合定制粒子滤波器与高斯过程隐面,实现物体识别、姿态估计与形状迁移学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02924 2026-03-04 cs.CV 57%

HDINO: A Concise and Efficient Open-Vocabulary Detector

HDINO:一种简洁且高效的开放词汇检测器

Hao Zhang, Yiqun Wang, Qinran Lin, Runze Fan, Yong Li

机构 * Chongqing University(重庆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 HDINO提出了一种简洁高效的开放词汇检测方法,通过两阶段训练策略和轻量级特征融合模块,在无需人工数据编纂的情况下实现了优于现有方法的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏