arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2603.16875 2026-03-19 cs.HC cs.AI 57%

Attention Guidance through Video Script: A Case Study of Object Focusing on 360° VR Video Tours

通过视频脚本进行注意力引导:360°VR视频导览中物体聚焦的案例研究

Paulo Vitor Santana Silva, Arthur Ricardo Sousa Vitória, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * AKCIT Federal University of Goiás(戈亚斯联邦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过结合Grounding Dino和Segment Anything模型,利用视频脚本引导用户注意力,提升360°VR视频导览的用户体验。

Journal ref SVR 2024: Proceedings of the 26th Symposium on Virtual and Augmented Reality

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15699 2026-03-18 cs.PF cs.AI cs.SE 57%

This Is Taking Too Long -- Investigating Time as a Proxy for Energy Consumption of LLMs

这需要太长时间 -- 调查时间作为LLMs能耗的代理

Lars Krupp, Daniel Geißler, Francisco M. Calatrava-Nicolas, Vishal Banwari, Paul Lukowicz, Jakob Karolus

机构 * Centre for Applied Autonomous Sensor Systems (AASS)(应用自主传感器系统中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究通过推理时间估算API基于LLMs的能耗,验证了时间测量与实际能耗之间的关联,为用户理解LLMs能耗提供方法。

Comments This work was accepted at PerCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16207 2026-03-18 cs.AI 57%

Proactive Rejection and Grounded Execution: A Dual-Stage Intent Analysis Paradigm for Safe and Efficient AIoT Smart Homes

主动拒绝与 grounded 执行:一种双阶段意图分析范式用于安全高效的 AIoT 智能家居

Xinxin Jin, Zhengwei Ni, Zhengguo Sheng, Victor C. M. Leung

机构 * School of Information and Electronic Engineering (Sussex Artificial Intelligence Institute), Zhejiang Gongshang University(信息与电子工程学院(Sussex人工智能研究院),浙江工商大学) Sussex Artificial Intelligent Institute, Zhejiang Gongshang University(Sussex人工智能研究院,浙江工商大学) Department of Engineering and Design, University of Sussex(工程与设计系, Sussex大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学) Department of Electrical and Computer Engineering, The University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出双阶段意图感知框架,通过语义防火墙和确定性验证器,解决LLM在IoT中的可靠性与交互效率问题,提升家居任务执行精度与用户干扰最小化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15957 2026-03-18 cs.LG 57%

GASP: Guided Asymmetric Self-Play For Coding LLMs

GASP:指导性的非对称自我对弈用于编码大语言模型

Swadesh Jana, Cansu Sancaktar, Tomáš Daniš, Georg Martius, Antonio Orvieto, Pavel Kolev

机构 * University of Tübingen(图宾根大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 GASP通过引入真实数据目标问题,改进了非对称自我对弈方法,提升了LiveCodeBench上的pass@20指标,并解决了其他方法无法达到的难题。

Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement (RSI 2026) as Spotlight, and ICLR 2026 Workshop on Lifelong Agents (LLA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00512 2026-03-18 cs.CV 57%

Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding

基于语义边界的小波帧选择用于长视频理解

Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出WFS-SB方法,通过小波变换检测语义边界,提升长视频中大视觉语言模型的性能,实验显示在多个基准上均优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19570 2026-03-18 cs.CV 57%

VALD: Multi-Stage Vision Attack Detection for Efficient LVLM Defense

VALD:为高效LVLM防御的多阶段视觉攻击检测

Nadav Kadvil, Malak Fares, Ayellet Tal

机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VALD方法,通过图像变换与智能数据整合快速过滤清洁输入,结合文本嵌入空间和LLM解决攻击问题,实现高效准确的LVLM防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19476 2026-03-18 cs.LG 57%

LogicXGNN: Grounded Logical Rules for Explaining Graph Neural Networks

LogicXGNN: 基于逻辑规则的图神经网络解释方法

Chuqin Geng, Ziyu Zhao, Zhaoyue Wang, Haolin Ye, Yuhe Jiang, Xujie Si

机构 * University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 LogicXGNN通过构建逻辑规则提升图神经网络解释的可信度和可解释性,提出数据驱动的 fidelity 指标并显著提升解释质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16253 2026-03-18 cs.CV 57%

Open-Vocabulary Octree-Graph for 3D Scene Understanding

开放词汇八叉树图用于3D场景理解

Zhigang Wang, Yifei Su, Chenhui Li, Dong Wang, Yan Huang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) CASIA TeleAI

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Octree-Graph,通过CGSM和IFA算法获取3D实例及语义特征,构建适应性八叉树结构以高效表示场景,实验表明其在多种任务中具有广泛适用性和有效性。

Comments Accepted by ICCV25. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15712 2026-03-18 cond-mat.mtrl-sci cs.AI 57%

LLM-Driven Discovery of High-Entropy Catalysts via Retrieval-Augmented Generation

通过检索增强生成发现高效熵催化剂

AI Scientists, Xinyi Lin, Danqing Yin, Ying Guo

机构 * School of Biomedical Sciences, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学生物医学科学学院,利卡申医学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文展示如何利用大语言模型加速催化剂发现,通过检索增强生成框架生成250多个候选催化剂,其中82%具有热力学稳定性,同时满足多目标约束,最佳催化剂在性能和成本上均有显著提升。

Journal ref Open Conference of AI Agents for Science 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15558 2026-03-17 cs.CV cs.RO 57%

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV 57%

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14992 2026-03-17 cs.AI cs.MM 57%

Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos

揭示短视频中跨模态一致性以检测虚假新闻

Chong Tian, Yu Wang, Chenxu Yang, Junyi Guan, Zheng Lin, Yuhan Liu, Xiuying Chen, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.AI

AI总结 本文提出MAGIC3模型,通过多粒度跨模态一致性建模提升虚假新闻检测性能,实现高准确率与低成本的平衡。

Comments 16 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03718 2026-03-17 cs.CL cs.AI 57%

Grounded Misunderstandings in Asymmetric Dialogue: A Perspectivist Annotation Scheme for MapTask

对话中的基础误解:一种面向MapTask的视角主义标注方案

Nan Li, Albert Gatt, Massimo Poesio

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种视角主义标注方案,用于分析MapTask中对话参与者对参照表达的 grounded 解释差异,揭示理解如何演变并修复,评估LLM对视角依赖性 grounding 的建模能力。

Comments 14 pages, 5 figures, 6 tables; Camera-ready Version; Accepted by LREC 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14770 2026-03-17 cs.CV 57%

AnyPhoto: Multi-Person Identity Preserving Image Generation with ID Adaptive Modulation on Location Canvas

AnyPhoto: 多人身份保持图像生成与基于ID自适应调制的定位画布

Longhui Yuan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 AnyPhoto通过定位画布和身份自适应调制实现多人身份保持生成,提升可控性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22436 2026-03-17 cs.CV 57%

ABounD: Adversarial Boundary-Driven Few-Shot Learning for Multi-Class Anomaly Detection

ABounD:面向多类异常检测的对抗边界驱动少样本学习

Runzhi Deng, Yundi Hu, Xinshuang Zhang, Zhao Wang, Xixi Liu, Wang-Zhou Dai, Caifeng Shan, Fang Zhao

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ABounD框架,通过语义概念锚定与几何边界优化,解决多类异常检测中特征空间塌陷和跨类干扰问题,实现高效准确的少样本学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13696 2026-03-17 cs.CL cs.LG 57%

Repetition Without Exclusivity: Scale Sensitivity of Referential Mechanisms in Child-Scale Language Models

无排斥性重复:儿童语言模型中指称机制的规模敏感性

Jon-Paul Cacioli

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究评估了文本模型中排斥性机制的规模敏感性,发现基于儿童对话训练的模型在指称抑制方面表现不敏感,且重复素有增强效应,挑战了传统排斥性假设。

Comments 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13393 2026-03-17 cs.CV 57%

Colony Grounded SAM2: Zero-shot detection and segmentation of bacterial colonies using foundation models

基于群体的SAM2:利用基础模型进行细菌群落的零样本检测和分割

Daan Korporaal, Patrick de Kruijf, Ralph H. G. M. Litjens, Bas H. M. van der Velden

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Colony Grounded SAM2,利用预训练的基础模型进行细菌群落的零样本检测和分割,无需进一步训练,实现了高精度的检测和分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13317 2026-03-17 cs.LG cs.HC 57%

Evaluating Large Language Models for Gait Classification Using Text-Encoded Kinematic Waveforms

利用文本编码的运动学波形评估大语言模型用于步态分类

Carlo Dindorf, Jonas Dully, Rebecca Keilhauer, Michael Lorenz, Michael Fröhlich

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究评估了将连续步态运动学波形编码为文本数值序列时,通用大语言模型在步态分类中的性能,并与传统机器学习方法进行比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11750 2026-03-17 q-bio.QM cs.LG 57%

PRISM: Enhancing Protein Inverse Folding through Fine-Grained Retrieval on Structure-Sequence Multimodal Representations

PRISM:通过结构-序列多模态表示的细粒度检索增强蛋白质反向折叠

Sazan Mahbub, Souvik Kundu, Eric P. Xing

机构 * Carnegie Mellon University(卡内基梅隆大学) GenBio AI(基因组生物人工智能) Intel(英特尔)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 PRISM通过结构-序列多模态表示的细粒度检索提升蛋白质反向折叠性能,结合混合自交叉注意力解码器,实现更高效的序列生成与折叠预测。

Comments Published as a conference paper at International Conference on Learning Representation (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07605 2026-03-17 cs.CV 57%

LOSC: LiDAR Open-voc Segmentation Consolidator

LOSC:激光雷达开放词汇分割整合器

Nermin Samet, Gilles Puy, Renaud Marlet

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工大学,埃菲尔大学,CNRS)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了基于图像的视觉-语言模型在驾驶场景中对激光雷达扫描进行开放词汇分割的应用,通过整合标签提升空间时间一致性与图像增强鲁棒性,提出LOSC方法在nuScenes和SemanticKITTI上优于现有最佳方法。

Comments 3DV 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13168 2026-03-16 cs.AI cs.CL cs.IR 57%

Developing and evaluating a chatbot to support maternal health care

开发和评估一个支持产科保健的聊天机器人

Smriti Jha, Vidhi Jain, Jianyu Xu, Grace Liu, Sowmya Ramesh, Jitender Nagpal, Gretchen Chapman, Benjamin Bellows, Siddhartha Goyal, Aarti Singh, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Population Council Institute(人口理事会研究所) Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) Nivi, Inc.(Nivi公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。

Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 57%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV 57%

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12781 2026-03-16 cs.CY cs.AI cs.HC 57%

The RIGID Framework: Research-Integrated, Generative AI-Mediated Instructional Design

RIGID框架:研究集成、生成式AI介导的课程设计

Yerin Kwak, Zachary A. Pardos

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出RIGID框架,整合学习科学研究与课程设计流程,利用生成式AI实现研究与设计的系统集成,提升课程设计的实证性和情境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21662 2026-03-16 cs.CV 57%

Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

多标准:在多元标准下评估多模态裁判

Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Waterloo(滑铁卢大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11441 2026-03-13 cs.CV 57%

Detect Anything in Real Time: From Single-Prompt Segmentation to Multi-Class Detection

实时检测任意目标:从单提示分割到多类检测

Mehmet Kerem Turkcan

机构 * Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 DART通过共享视觉主干网络计算,实现实时多类检测,无需训练,提升速度达25倍,达到80类检测的55.8 AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11076 2026-03-13 cs.AI cs.SE 57%

DIVE: Scaling Diversity in Agentic Task Synthesis for Generalizable Tool Use

DIVE:在代理任务合成中扩展多样性以实现通用工具使用

Aili Chen, Chi Zhang, Junteng Liu, Jiangjie Chen, Chengyu Du, Yunji Li, Ming Zhong, Qin Wang, Zhengmao Zhu, Jiayuan Song, Ke Ji, Junxian He, Pengyu Zhao, Yanghua Xiao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DIVE通过反转合成顺序,先执行多样化的现实工具并反向推导任务,从而提升代理任务合成的多样性,使模型在不同任务和工具集下的泛化能力显著增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10900 2026-03-13 cs.IR cs.AI 57%

Tuning-Free LLM Can Build A Strong Recommender Under Sparse Connectivity And Knowledge Gap Via Extracting Intent

无需调优的LLM可通过提取意图在稀疏连接和知识缺口下构建强大的推荐系统

Wenqing Zheng, Noah Fatsi, Daniel Barcklow, Dmitri Kalaev, Steven Yao, Owen Reinert, C. Bayan Bruss, Daniele Rosa

机构 * Capital One

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出IKGR,一种基于LLM的意图知识图推荐系统,通过提取意图构建意图中心知识图,缓解稀疏性和冷启动问题,实现高效推荐。

Comments Accepted in Learning on Graphs (LoG) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10279 2026-03-12 cs.LG 57%

Robust Post-Training for Generative Recommenders: Why Exponential Reward-Weighted SFT Outperforms RLHF

生成推荐系统的鲁棒性训练:为何指数奖励加权SFT优于RLHF

Keertana Chidambaram, Sanath Kumar Krishnamurthy, Qiuling Xu, Ko-Jen Hsiao, Moumita Bhattacharya

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出指数奖励加权SFT方法,通过直接优化观测奖励,有效解决生成推荐系统中的鲁棒性训练问题,理论和实验证实其在噪声环境下的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00681 2026-03-12 cs.CV 57%

Adaptive Event Stream Slicing for Open-Vocabulary Event-Based Object Detection via Vision-Language Knowledge Distillation

面向视觉语言知识蒸馏的自适应事件流切片用于开放词汇事件基物体检测

Jinchang Zhang, Zijun Li, Jiakai Lin, Guoyu Lu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于视觉语言知识蒸馏的事件流切片方法,利用CLIP的语义理解实现事件数据上的开放词汇物体检测。

详情

展开后加载摘要…

URL PDF HTML 收藏