What Makes a Scene ? Scene Graph-based Evaluation and Feedback for Controllable Generation
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Institute of Automation, CAS(中国科学院自动化研究所)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Institute of Automation, CAS(中国科学院自动化研究所)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Microsoft(微软公司)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
机构 * R&D Lab F-Initiatives(F-Initiatives研发实验室) ; Université d’Orleans(奥尔良大学) ; Université Sorbonne Paris Nord(巴黎-索邦大学) ; University of Dubai(迪拜大学) ; IULM University(IULM大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments Under review
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments CVPR 2025. Project website: https://yufu-wang.github.io/phmr-page
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; School of Science and Engineering, The Chinese University of Hong Kong(香港中文大学科学与工程学院) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Network Science Institute, Northeastern University(东北大学网络科学研究所)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments 5 pages, 2 figures; accepted by IEEE VIS 2024 (https://ieeevis.org/year/2024/program/paper_v-short-1177.html)
Journal ref 2024 IEEE Visualization and Visual Analytics (VIS)
机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) ; Nanyang Technological University(南洋理工大学) ; WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学) ; Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :vision language model(abstract);分类 cs.CV
Comments ACL 2025 Findings
专题命中 视觉推理 :VLM(abstract);分类 cs.CV
Comments Best Student Paper Award at IEEE International Conference on Computer Supported Cooperative Work in Design, 2025
机构 * Kai Zhang 1(某机构) ; Xingyu Chen 3(某机构) ; Xiaofeng Zhang 2(某机构)
专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV
机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, and Institute of Artificial Intelligence, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心及人工智能研究所、武汉大学) ; College of Computing & Data Science at Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV
机构 * Shanghai University(上海大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :VLM(abstract);分类 cs.AI
机构 * Embodied AI and Robotics (AIR) Lab New York University Abu Dhabi(embodied AI 和机器人(AIR)实验室 新 York 大学阿布扎赫德)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV
Comments Project website and code: https://dktpt44.github.io/LV-GPT/
机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University(网络安全与工程学院,西安交通大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
Comments 11 pages, 5 figures, 3 tables, submitted to IEEE OJCS
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Alibaba Group(阿里巴巴集团) ; DAMO Academy, Alibaba Group(阿里巴巴集团大模型学院) ; Nanjing Institute of Software Technology(南京软件技术研究所) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; Hohai University(河海大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
Comments Code: https://github.com/zwq2018/embodied_reasoner Dataset: https://huggingface.co/datasets/zwq2018/embodied_reasoner
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV
Comments CVPR 2025
机构 * CASC, Computing, Lawrence Livermore National Laboratory(计算部、劳伦斯利弗莫尔国家实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
机构 * CASIA(中国科学院自动化研究所) ; THU(清华大学) ; KuaiShou(快手) ; NJU(南京大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
Comments Home page: https://github.com/yfzhang114/r1_reward
机构 * School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI
机构 * Department of Electrical Engineering and Automation, Aalto University(艾尔沃斯大学电气工程与自动化系) ; Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
机构 * Intel Labs(英特尔实验室) ; Hugging Face
专题命中 视觉推理 :vision language model(abstract);分类 cs.AI
机构 * University of Rochester(罗切斯特大学) ; Chinese Medicine Guangdong Laboratory(广东中医实验室) ; Southern University of Science and Technology(南方科技大学) ; New York University(纽约大学) ; Datawhale org(Datawhale组织)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
机构 * Amazon Lab126(亚马逊实验室126) ; University of Maryland(马里兰大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
Journal ref IEEE Robotics and Automation Letters (2025)
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) ; Microsoft Research(微软研究院) ; Indian Institute of Technology, Kharagpur(印度克里希纳布尔理工学院)
专题命中 视觉推理 :vision language model(abstract);分类 cs.CV
Comments Accepted in CVPRW 2025. Project page: https://sacrcv.github.io/GeoMeter-website/
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments Preprint
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
机构 * School of Software, Shandong University(软件学院,山东大学) ; Shandong Research Institute of Shandong University(山东大学山东研究院) ; Inspur Technology(Inspur技术公司)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
机构 * School of Computer Science and Engineering, Vellore Institute of Technology(计算机科学与工程学院,维杰里学院技术学院) ; Sustainable Living Labs(可持续生活实验室)
专题命中 视觉推理 :vision language model(abstract);分类 cs.AI
Comments 16 pages, 8 Figures
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments Mistaken resubmission. The original version is at arXiv:2405.01533