Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
专题命中 视觉问答 :vision-language model(title);visual language model(abstract);visual question answering(abstract);分类 cs.CV
Comments ACL2025 Main (SAC Highlight Award)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(title);visual language model(abstract);visual question answering(abstract);分类 cs.CV
Comments ACL2025 Main (SAC Highlight Award)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Bosch Center for AI(博世人工智能中心)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)
Comments We remove OSG and CogNav from Table. 1 for a fair comparison
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV
Comments Project Website: https://www.anjiecheng.me/sr3d
机构 * Xiaomi Corporation Beijing, China(小米公司北京)
专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV
机构 * Kalyani Government Engineering College(卡利尼政府工程学院) ; Intel Labs(英特尔实验室)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) ; Tsinghua, Beijing, China(清华大学) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
机构 * Hefei University of Technology(合肥工业大学) ; University of Trento(特伦托大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI
机构 * NC AI
专题命中 视觉定位与Grounding :VLM(abstract,comments);vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 19 pages, 1 figure, 14 tables. Technical report for VARCO-VISION-2.0, a Korean-English bilingual VLM in 14B and 1.7B variants. Key features: multi-image understanding, OCR with text localization, improved Korean capabilities
机构 * Dana-Farber Cancer Institute & Tufts University School of Medicine(达纳-法伯癌症研究所及塔夫茨大学医学院) ; Dana-Farber Cancer Institute Brigham and Women’s Hospital & Harvard Medical School(达纳-法伯癌症研究所布里特妇女医院及哈佛医学院)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Purdue University(普渡大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted to EMNLP 2025 (Main). 17 pages, 7 figures
机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进技术学院,西安交通大学利物浦大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)
Comments Accepted at INLG 2025. Camera-ready version
机构 * KAUST(科威特科学与技术王国(KAUST)) ; CIIRC CTU(布拉格技术大学智能信息与计算研究中心(CIIRC CTU)) ; Adobe Research(Adobe研究)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; ISTI-CNR(意大利国家研究委员会ISTI) ; University of Pisa(比萨大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025
机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈拉格普)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.LG
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments EMNLP 2025
机构 * Southern University of Science and Technology, China(南方科技大学,中国) ; Spatialtemporal AI, China(时空AI,中国) ; MBZUAI, UAE(MBZUAI,阿联酋) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV、cs.AI
机构 * Ume \ University, Ume , Sweden
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
Comments 14 pages, 6 figures
机构 * Smart Systems Institute, National University of Singapore(新加坡国立大学智能系统研究所) ; Northeastern University(东北大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments This work has been submitted to the IEEE for possible publication
机构 * University of Nevada Reno(内华达大学拉斯维加斯分校)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV
机构 * Centre for Robotic Autonomy in Demanding and Long-lasting Environments(机器人自主性在恶劣和持久环境中的研究中心) ; Centre for Robotics and AI(机器人与人工智能中心) ; University of Manchester(曼彻斯特大学) ; Amentum Clean Energy Ltd(Amentum清洁能源有限公司)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Fudan University(复旦大学) ; City University of Hong Kong(香港城市大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments This work has been submitted to the IEEE for possible publication
机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理实验室,计算机科学学院,复旦大学) ; The Chinese University of Hong Kong, Shatin, Hong Kong(香港中文大学,沙田,香港) ; The University of Hong Kong, Pokfulam, Hong Kong(香港大学,薄扶林,香港)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments This work has been submitted to the IEEE for possible publication
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
机构 * 1 Institute of Automation, Chinese Academy of Sciences, Beijing, China ; 2 School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China ; 3 Nanjing Artificial Intelligence Research of IA, Nanjing, China ; 4 University of Chinese Academy of Sciences,Nanjing, Nanjing, China ; 5 Nanjing University of Information Science \& Technology, Nanjing, China
专题命中 幻觉与鲁棒性 :grounding(abstract)
Comments Accepted to IJCNN 2025
专题命中 VLM训练与架构 :VLM(abstract)
专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) ; Zhongguancun Academy(中关村学院) ; Southeast Academy of Information Technology, Beijing Institute of Technology(信息技术东南学院,北京理工大学) ; Tsinghua University(清华大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
Comments Under Review