Fast Reasoning Segmentation for Images and Videos
机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰·霍普金斯大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰·霍普金斯大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * Harvard University(哈佛大学) ; Kyoto University(京都大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
机构 * Boston University(波士顿大学) ; Microsoft Research(微软研究院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
Comments 15 pages, 5 figures
机构 * Xi’an Jiaotong University(西安交通大学) ; University of Science and Technology of China(中国科学技术大学) ; SenseTime Research(商汤科技研究院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025 (The Thirty-Ninth Annual Conference on Neural Information Processing Systems)
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist 大学) ; National University of Singapore(新加坡国立大学) ; Beijing Normal University(北京师范大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI
Comments 28 pages, 14 figures, 19 tables
机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院) ; DEVCOM Army Research Laboratory(国防部陆军研究实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
机构 * The Polytechnic Institute, Zhejiang University(浙江大学Polytechnic学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) ; University of Oxford(牛津大学) ; Ant Group(蚂蚁集团) ; University of Aberdeen(阿伯丁大学) ; ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
机构 * Dept. of Artificial Intelligence(人工智能系) ; Korea University(韩国大学) ; Dept. of Brain and Cognitive Engineering(脑科学与认知工程系)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
Comments 4 pages, 4 figures, 1 table,
机构 * ARC Lab, Tencent PCG(腾讯PCG部门ARC实验室) ; Shanghai Jiao Tong University(上海交通大学) ; University of Macau(澳门大学) ; Dalian University of Technology(大连理工大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
Comments a comprehensive visual spatial reasoning evaluation tool, 25 pages, 16 figures
专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG
机构 * University of International Business and Economics(国际商务经济大学) ; University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Beijing Electronic Science and Technology Institute(北京电子科技研究所) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
Comments 10 pages, 9 figures
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院) ; Sun Yat-sen University(中山大学) ; Baidu Inc.(百度公司) ; Guilin University of Electronic Technology(桂林电子科技大学) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
Comments Accepted by ICCV2025
机构 * Tianjin University(天津大学) ; University of Trento(特伦托大学)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
Comments Accepted by ACMMM2025, Our project webpage: https://tjulcx.github.io/FreeInsert/
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments Technical Report
机构 * The University of Hong Kong(香港大学) ; Tsinghua University(清华大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
Comments 15 pages. Accepted by AAAI 2026 AISI
机构 * Harvard University(哈佛大学) ; MIT Media Lab(麻省理工学院媒体实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
Comments Accepted at the Multimodal Algorithmic Reasoning (MAR) Workshop, NeurIPS 2025
机构 * ByteDance Seed(字节跳动种子) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; UC Santa Cruz(圣克拉拉大学) ; Stanford(斯坦福大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
Comments 28 pages, 15 figures
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
机构 * Mininglamp Technology(Mininglamp技术)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
机构 * Xiamen University(厦门大学) ; Anyang Normal University(安阳师范学院) ; Tencent YouTu Lab(腾讯YouTu实验室) ; Tencent SSV(腾讯SSV)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG
Comments Accepted to NeurIPS 2025
机构 * Department of Horticultural Sciences(园艺科学系) ; Gulf Coast Research and Education Center(墨西哥湾沿岸研究与教育中心) ; University of Florida(佛罗里达大学) ; Department of Agricultural and Biological Engineering(农业与生物工程系) ; Department of Soil, Water, and Ecosystem Sciences(土壤、水与生态系统科学系) ; Citrus Research and Education Center(柑橘研究与教育中心)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
Comments 26 pages, 8 figures, and 2 tables
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG
机构 * MSR(微软研究院) ; UCAS(中国科学院自动化研究所) ; CASIA(中国科学院自动化研究所) ; Cambridge(剑桥大学) ; NJU(南京大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) ; Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院计算与智能研究所) ; Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University(贵州大学文字计算与认知智能教育部工程研究中心) ; Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学) ; ByteDance Seed (China)(字节跳动种子(中国))
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2025;
机构 * Zhongxing Telecom Equipment (ZTE), China(中兴通讯设备(ZTE),中国)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI