REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding
基于三元组的引用范式用于统一视觉解码
Yan Tai, Luhao Zhu, Yunan Ding, Yiying Dong, Guangtao Zhai, Xiaohong Liu, Guodong Guo
机构
*
School of Computer Science, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学计算机科学学院)
;
Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究院)
;
School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学信息科学与电子工程学院)
专题命中
视觉定位与Grounding
:VLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure
释放大型视觉-语言模型的能力以实现道路基础设施的智能感知
Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong
机构
*
State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室)
;
Wuhan University(武汉大学)
;
Hubei Luojia Laboratory(湖北珞珈实验室)
专题命中
视觉定位与Grounding
:vision-language model(title);vision language model(abstract);grounding(abstract);分类 cs.CV
MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?
MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?
Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun
机构
*
Tsinghua University(清华大学)
;
Nankai University(南开大学)
;
Northwest Polytechnical University(西北工业大学)
;
Chinese Academy of Sciences(中国科学院)
;
Harbin Institute of Technology(哈尔滨工业大学)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
GeoViS: 基于地理奖励的视觉搜索用于遥感视觉定位
Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
National University of Defense Technology(国防科技大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Chongqing University(重庆大学)
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV
ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理
Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo
机构
*
Tsinghua University(清华大学)
;
International Digital Economy Academy(国际数字经济学院)
;
Beihang University(北航)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI
机构
*
Hong Kong Baptist University(香港 Baptist 大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
National University of Singapore(新加坡国立大学)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
Lu Dong, Haiyu Zhang, Han Lin, Ziang Yan, Xiangyu Zeng, Hongjie Zhang, Yifei Huang, Yi Wang, Zhen-Hua Ling, Limin Wang, Yali Wang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Beihang University(北京航空航天大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
;
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV
机构
*
School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
School of Computing and Information Technology, Great Bay University(大亚湾大学计算机与信息科技学院)
;
College of Computer Science, Nankai University(南开大学计算机学院)
;
School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
;
Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)
;
National Engineering Laboratory of Big Data System Computing Technology, Shenzhen University(大数据系统计算技术国家工程实验室)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV
CommentsAccepted by IEEE Transactions on Instrumentation and Measurement (TIM)
Journal refProc. IEEE International Conference on Data Mining Workshops (ICDMW 2025), Workshop on Multimodal AI (MMAI 2025), Los Angeles, USA, December 2025