Can VLM Pseudo-Labels Train a Time-Series QA Model That Outperforms the VLM?
机构 * Nagoya University(名古屋大学)
专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Nagoya University(名古屋大学)
专题命中 视觉问答 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments ACM Conference on Fairness, Accountability, and Transparency (FAccT 2025)
机构 * DIENS, École Normale Supérieure of Paris, Paris, France(巴黎高等师范学院DIENS) ; Université Paris Cité, LIPADE, F-75006 Paris, France(巴黎大学) ; Be-ys Research, Paris, France(Be-ys研究所)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at Workshop on Machine Learning in Document Analysis and Recognition (ICDAR WML 2025), Wuhan, China
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; School of Computer Science and Technology and Ministry of Education Key Lab For Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院和教育部智能网络与网络安全重点实验室) ; School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学院和教育部智能网络与网络安全重点实验室) ; Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)
专题命中 视觉问答 :vision-language model(abstract);MLLM(abstract);分类 cs.CV
机构 * University of Bristol(布里斯托大学) ; Brown University(布朗大学) ; South China University of Technology(华南理工大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by conference EMNLP2025
机构 * NVIDIA ; MIT(麻省理工学院) ; HKU(香港大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B
机构 * Om AI Research(Om AI研究机构) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 22 pages
机构 * Centre for Responsible Autonomous Systems in Healthcare (CRASH) Lab, Koita Centre for Digital Health(负责任的自主医疗系统中心(CRASH)实验室、Koita数字健康中心) ; Ashoka University(阿什oka大学) ; Independent Researcher(独立研究者) ; Koita Centre for Digital Health(Koita数字健康中心)
专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG
Comments 29 pages, 7 figures, 7 tables, includes Annexure (1). Part of the work accepted at RSNA 2025 (Cutting Edge Oral Presentation)
机构 * Huawei Technologies Canada(华为技术加拿大分公司) ; Huawei Cloud Project Page Code Ego3D-Bench(华为云项目页面代码Ego3D-Bench)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * National Sun Yat-sen University(国立中山大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)
Comments 20 pages, 9 figures
机构 * Michigan State University(密歇根州立大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * University of Manchester(曼彻斯特大学) ; South China University of Technology(华南理工大学)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
Comments Accept by EMNLP2025
机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
机构 * Institute of Cognitive Science, Osnabrück University(认知科学研究所,奥斯纳布吕克大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心) ; Nokia Bell Labs(诺基亚贝尔实验室)
专题命中 视觉推理 :vision language model(abstract);multimodal large language model(abstract);分类 cs.LG
机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen Key Laboratory of Media Security, and SZU-AFS Joint Innovation Center for AI Technology(广东省智能信息处理重点实验室、深圳媒体安全重点实验室及深圳大学-AFS联合人工智能技术创新中心) ; Tencent Youtu Lab(腾讯优图实验室) ; Peking University(北京大学) ; Sun Yat-Sen University(中山大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Xiaomi Robotics Lab(小米机器人实验室) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project page: https://video-zero-shot.github.io/
机构 * ILLC, University of Amsterdam(伊拉斯谟范例学院、阿姆斯特丹大学) ; ILCC, University of Edinburgh(爱丁堡大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Fantasyele
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Under review
机构 * Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) ; Samsung Electronics(三星电子) ; School of Computing, KAIST(KAIST计算机科学学院)
专题命中 视觉推理 :VLM(abstract);分类 cs.AI
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
机构 * Duke University(杜克大学) ; Adobe
专题命中 视觉推理 :grounding(abstract)
Comments Code and data available at https://github.com/linyueqian/VERA
机构 * Georgia Tech(佐治亚理工学院) ; NVIDIA(英伟达)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Independent Researcher(独立研究者)
专题命中 视觉定位与Grounding :vision-language model(title);grounding(title);visual question answering(abstract);分类 cs.AI
专题命中 视觉定位与Grounding :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI
Comments First Peer Reviewed Review Paper for Object Detection with Vision-Language Models (VLMs)
Journal ref Information Fusion, 2025
机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) ; Red Sea Research Center, KAUST(红海研究中心,KAUST) ; Tübingen University(图宾根大学)
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV
Comments 3 figures 8 tables
机构 * Zhejiang University(浙江大学) ; University of Electronic Science and Technology of China(电子科技大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Project: https://zju-real.github.io/ViewSpatial-Page/
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 6 pages, 3 figures