arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2512.08934 2025-12-11 cs.HC cs.AI 57%

Motion2Meaning: A Clinician-Centered Framework for Contestable LLM in Parkinson's Disease Gait Interpretation

Motion2Meaning: 一种以临床为中心的可挑战LLM框架,用于帕金森病步态解读

Loc Phuc Truong Nguyen, Hung Thanh Do, Hung Truong Thanh Nguyen, Hung Cao

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of New Brunswick(新 Brunswick大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Motion2Meaning通过结合可解释AI和可挑战LLM,为帕金森病步态解读提供透明、可审计的临床系统。

Comments Accepted at the 9th International Symposium on Chatbots and Human-Centered AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07845 2025-12-10 cs.SD cs.AI eess.AS 57%

AudioScene: Integrating Object-Event Audio into 3D Scenes

AudioScene: 将对象事件音频整合到3D场景中

Shuaihang Yuan, Congcong Wen, Muhammad Shafique, Anthony Tzes, Yi Fang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AudioScene数据集,通过整合音频事件与3D场景,探索音频条件任务,提升空间学习的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06862 2025-12-09 cs.CV 57%

Omni-Referring Image Segmentation

多模态指引用图像分割

Qiancheng Zheng, Yunhang Shen, Gen Luo, Baiyang Song, Xing Sun, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Youtu Lab, Tencent, P.R. China(腾讯视频实验室,中国) OpenGVLab, Shanghai AI Laboratory(上海AI实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多模态指引用图像分割任务,通过OmniRIS框架实现高度通用的图像分割,结合文本和视觉模态,构建了OmniRef数据集和OmniSegNet基线模型,验证了其在多模态提示下的分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21615 2025-12-09 cs.CL cs.AI cs.IR 57%

Refine Medical Diagnosis Using Generation Augmented Retrieval and Clinical Practice Guidelines

通过生成增强检索和临床实践指南提升医学诊断

Wenhao Li, Hongkuan Zhang, Hongwei Zhang, Zhengxu Li, Zengjie Dong, Yafan Chen, Niranjan Bidargaddi, Hong Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出GARMLE-G框架,通过生成增强检索和临床指南整合,提升医学诊断的准确性和临床实用性。

Journal ref Journal of Biomedical and Health Informatics (JBHI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02738 2025-12-08 cs.CV 57%

Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning

Open-PMC-18M: 一种高保真大规模医学数据集用于多模态表示学习

Negin Baghbanzadeh, Mohammed Saidul Islam, Sajad Ashkezari, Elham Dolatabadi, Arash Afkanpour

机构 * Vector Institute(Vector研究所) York University(约克大学) University of Waterloo(滑铁卢大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 Open-PMC-18M通过高保真医学数据集提升多模态表示学习性能,实现子图提取与上下文丰富化,支持多种视觉-语言任务。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17948 2025-12-08 cs.IR cs.AI 57%

VERIRAG: A Post-Retrieval Auditing of Scientific Study Summaries

VERIRAG:一种科学研究摘要的后检索审计

Shubham Mohole, Hongjun Choi, Shusen Liu, Christine Klymko, Shashank Kushwaha, Derek Shi, Wesam Sakla, Sainyam Galhotra, Ruben Glatt

机构 * Cornell University(康奈尔大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Illinois Urbana‑Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 VERIRAG通过后检索审计框架检测科学摘要的方法学漏洞,提升宏F1值19个百分点,提供结构化审计轨迹支持负责任的科学实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05060 2025-12-05 cs.CV 57%

4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer

4DLangVGGT: 4D语言-视觉几何 grounded Transformer

Xianfeng Wu, Yajing Bai, Minghan Li, Xianzu Wu, Xueqi Zhao, Zhongyuan Lai, Wenyu Liu, Xinggang Wang

机构 * State Key Laboratory of Precision Blasting, Jianghan University(江汉大学精密爆破重点实验室) Harvard AI and Robotics Lab, Harvard University(哈佛大学AI与机器人实验室) School of EIC, Huazhong University of Science and Technology(华中科技大学电子信息学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) School of Mathematics and Statistics, Hubei University of Education(湖北省教育学院数学与统计学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 4DLangVGGT是一种基于Transformer的统一框架,用于4D语言 grounding,通过整合几何感知和语言对齐,提升4D场景理解的泛化能力和部署效率。

Comments Code: https://github.com/hustvl/4DLangVGGT, Webpage: https://hustvl.github.io/4DLangVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14332 2025-12-04 cs.LG stat.ML 57%

Accelerating data-driven algorithm selection for combinatorial partitioning problems

加速组合划分问题的数据驱动算法选择

Vaggos Chatziafratis, Ishani Karmarkar, Yingxi Li, Ellen Vitercik

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种理论基础,用于数据驱动算法选择中的大小泛化,通过在较小样本上评估算法性能来预测大规模实例的表现,并验证了三种聚类算法和两种max-cut算法的泛化能力。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03041 2025-12-03 cs.CV 57%

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster: 一种可控的多镜头视频生成框架

Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。

Comments Project Page: https://qinghew.github.io/MultiShotMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02520 2025-12-03 cs.CV stat.ML 57%

On the Problem of Consistent Anomalies in Zero-Shot Anomaly Detection

关于零样本异常检测中一致异常问题的研究

Tai Le-Gia

机构 * Department of Mathematics Graduate School(数学系研究生院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出CoDeGraph框架,解决零样本异常检测中的一致异常问题,并扩展至3D医学影像,实现无需训练的零样本检测。

Comments PhD Dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02502 2025-12-03 cs.IR cs.AI 57%

AskNearby: An LLM-Based Application for Neighborhood Information Retrieval and Personalized Cognitive-Map Recommendations

AskNearby: 一种基于LLM的邻里信息检索与个性化认知地图推荐应用

Luyao Niu, Zhicheng Deng, Boyang Li, Nuoxian Huang, Ruiqi Liu, Wenjia Zhang

机构 * Peking University(北京大学) Qianmo Smart Link(千摩智能链接) New York University(纽约大学) Imperial College London(伦敦帝国学院) Tencent(腾讯) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 AskNearby通过整合检索增强生成和认知地图模型,提升邻里信息检索与个性化推荐效果,解决局部生活信息可及性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00076 2025-12-02 cs.RO cs.CV 57%

Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning

Arcadia:迈向一个完整的生命周期框架用于具身终身学习

Minghe Gao, Juncheng Li, Yuze Lin, Xuqi Liu, Jiaming Ji, Xiaoran Pan, Zihan Xu, Xian Li, Mingjie Li, Wei Ji, Rong Wei, Rui Tang, Qizhou Wang, Kai Shen, Jun Xiao, Qi Wu, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Unitree Tech(单位树科技) Peking University(北京大学) Nanjing University(南京大学) Manycore Tech(Manycore科技) Bytedance Seed(字节跳动种子) University of Adelaide(阿德莱德大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Arcadia提出了一种闭环框架,通过紧密耦合四个阶段实现具身终身学习,支持持续改进和端到端泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23146 2025-12-01 cs.CV 57%

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22906 2025-12-01 cs.CV 57%

See, Rank, and Filter: Important Word-Aware Clip Filtering via Scene Understanding for Moment Retrieval and Highlight Detection

见、排、滤:通过场景理解的重要词感知Clip过滤用于片段检索和亮点检测

YuEun Lee, Jung Uk Kim

机构 * YuEun Lee, Jung Uk Kim

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出通过识别查询中的重要词,结合多模态大语言模型实现视频片段检索和亮点检测的细粒度过滤方法,提升检索和检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22245 2025-12-01 cs.CV 57%

Semantic Anchoring for Robust Personalization in Text-to-Image Diffusion Models

语义锚定用于文本到图像扩散模型中的稳健个性化

Seoyun Yang, Gihoon Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 通过语义锚定方法,文本到图像扩散模型在有限参考图像中实现稳健个性化,平衡主题保真度与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22025 2025-12-01 cs.CV 57%

Layover or Direct Flight: Rethinking Audio-Guided Image Segmentation

转折或直接飞行:重新思考音频引导的图像分割

Joel Alberto Santos, Zongwei Wu, Xavier Alameda-Pineda, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学、德国) Inria at Univ. Grenoble Alpes, CNRS, LJK, France(Inria于格勒诺布尔阿尔卑斯大学、CNRS、LJK、法国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出通过直接音频-视觉对齐进行图像分割,无需依赖文本转录,提升了鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21762 2025-12-01 cs.CL cs.AI 57%

Factors That Support Grounded Responses in LLM Conversations: A Rapid Review

支持LLM对话中基础响应的因素:一项快速回顾

Gabriele Cesar Iwashima, Claudia Susie Rodrigues, Claudio Dipolitto, Geraldo Xexéo

机构 * (June 2025)((2025年6月))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过快速回顾识别了支持LLM对话中基础响应的因素,重点分析了推理时间、训练后及强化学习方法,旨在提升LLM响应的准确性和可靠性。

Comments 28 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21066 2025-11-27 cs.CL cs.AI 57%

Context-Aware Pragmatic Metacognitive Prompting for Sarcasm Detection

面向上下文的元认知修辞提示用于讽刺检测

Michael Iskandardinata, William Christian, Derwin Suhartono

机构 * Computer Science Department(计算机科学系) School of Computer Science(计算机科学学院) Bina Nusantara University(宾努斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于检索的元认知修辞提示方法,通过整合上下文信息提升LLMs在讽刺检测中的性能,实验显示在多个数据集上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20957 2025-11-27 cs.CV 57%

Beyond Realism: Learning the Art of Expressive Composition with StickerNet

超越现实:利用StickerNet学习表现性创作

Haoming Lu, David Kocharian, Humphrey Shi

机构 * Picsart AI Research(Picsart人工智能研究) Picsart Inc(Picsart公司) College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 StickerNet通过学习真实世界编辑模式,实现了表现性图像合成,超越传统真实感追求,提升艺术性和用户意图的表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18513 2025-11-27 cs.LG 57%

Enhancing Training Data Attribution with Representational Optimization

通过表征优化增强训练数据归因

Weiwei Sun, Haokun Liu, Nikhil Kandpal, Colin Raffel, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 AirRep通过优化表征提升训练数据归因效率,实现与先进梯度方法相当的性能,且推理效率提高近两数量级。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20590 2025-11-26 cs.MA cs.AI cs.SE 57%

EnergyTwin: A Multi-Agent System for Simulating and Coordinating Energy Microgrids

EnergyTwin: 一种用于模拟和协调能源微电网的多智能体系统

Jakub Muszyński, Ignacy Walużenicz, Patryk Zan, Zofia Wrona, Maria Ganzha, Marcin Paprzycki, Costin Bădică

机构 * Warsaw University of Technology(华沙技术大学) Systems research Institute Polish Academy of Sciences(波兰科学院系统研究 institute) University of Technology and Arts(技术与艺术大学) University of Craiova(克劳日瓦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 EnergyTwin是一种基于智能体的微电网模拟环境,结合物理建模与预测驱动的滚动时间规划,用于提升微电网的韧性和能源自给率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16334 2025-11-26 cs.CV 57%

Panoptic Captioning: An Equivalence Bridge for Image and Text

全景描述:图像与文本之间的等价桥梁

Kun-Yu Lin, Hongjun Wang, Weining Ren, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 视觉定位与Grounding :InternVL(abstract);分类 cs.CV

AI总结 本文提出全景描述任务,通过PancapEngine和PancapChain方法提升图像与文本的等价描述能力,实验表明其优于现有大语言模型。

Comments NeurIPS 2025; Project page: https://visual-ai.github.io/pancap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08367 2025-11-26 cs.CV 57%

Embodied Crowd Counting

具身人群计数

Runling Long, Yunlong Wang, Jia Wan, Xiang Deng, Xinting Zhu, Weili Guan, Antoni B. Chan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

AI总结 本文提出具身人群计数任务,通过构建大规模交互式模拟器和零样本导航方法,在复杂场景中实现高效人群计数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19430 2025-11-25 cs.CV 57%

Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution

烹饪与清洁同时进行:教授并行任务执行的具身智能体

Dingkang Liang, Cheng Zhang, Xiaopeng Xu, Jianzhong Ju, Zhenbo Luo, Xiang Bai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 GRANT通过结合语言理解、3D定位和效率优化,实现并行任务调度,提升智能体在复杂环境中的任务执行效率。

Comments Accepted to AAAI 2026 (Oral). The code is available at \url{https://github.com/H-EmbodVis/GRANT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18983 2025-11-25 cs.CV 57%

UMCL: Unimodal-generated Multimodal Contrastive Learning for Cross-compression-rate Deepfake Detection

UMCL: 单模生成多模对比学习用于跨压缩率深度伪造检测

Ching-Yi Lai, Chih-Yu Jian, Pei-Cheng Chuang, Chia-Ming Lee, Chih-Chung Hsu, Chiou-Ting Hsu, Chia-Wen Lin

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 UMCL通过单模生成多模对比学习,提升跨压缩率深度伪造检测的鲁棒性和准确性。

Comments 24-page manuscript accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18978 2025-11-25 cs.CV 57%

Zero-shot segmentation of skin tumors in whole-slide images with vision-language foundation models

基于视觉语言基础模型的全切片图像皮肤肿瘤零样本分割

Santiago Moreno, Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech), Universitat Politécnica de Valencia(人类中心技术大学研究机构(HUMAN-Tech)、西班牙巴塞罗那理工大学) Artikode Intelligence S.L.(Artikode Intelligence公司)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本研究提出ZEUS框架,利用视觉语言基础模型实现全切片图像中皮肤肿瘤的零样本分割,减少标注负担并提高分割精度。

Comments Conference manuscript accepted for oral presentation at CASEIB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 57%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18116 2025-11-25 cs.CV 57%

PromptMoE: Generalizable Zero-Shot Anomaly Detection via Visually-Guided Prompt Mixtures

PromptMoE: 通过视觉引导的提示混合实现通用零样本异常检测

Yuheng Shao, Lizhang Wang, Changhao Li, Peixian Chen, Qinyuan Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 PromptMoE通过视觉引导的提示混合方法,实现了通用零样本异常检测,提升了模型对未见异常的泛化能力。

Comments 14 pages, 8 figures. Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18104 2025-11-25 cs.CV 57%

Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning

通过统一多模态伪造学习巩固扩散生成视频检测

Xiaohong Liu, Xiufeng Song, Huayu Zheng, Lei Bai, Xiaoming Liu, Guangtao Zhai

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MM-Det++算法,通过统一多模态学习检测扩散生成视频,结合时空分支和多模态分支,提升视频伪造检测的准确性和泛化能力。

Comments Code and dataset are available at https://github.com/SparkleXFantasy/MM-Det-Plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24466 2025-11-25 cs.CV 57%

SA-Person: Text-Based Person Retrieval with Scene-aware Re-ranking

SA-Person: 基于文本的人检索与场景感知重排序

Yingjia Xu, Jinlin Wu, Daming Gao, Zhen Chen, Yang Yang, Min Cao, Mang Ye, Zhen Lei

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人中心) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Wuhan University(武汉大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SA-Person通过整合个体外观和全局场景上下文,提升基于文本的人检索准确性,提出ScenePerson-13W数据集和两阶段检索框架。

Comments 13 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏