Semantic-Preserving Cross-Style Visual Reasoning for Robust Multi-Modal Understanding in Large Vision-Language Models
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Shanghai AI Lab(上海人工智能实验室) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 视觉推理 :visual reasoning(title,abstract);VLM(abstract);visual language model(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学) ; Sun Yat-sen University(中山大学) ; NUS(国立大学)
专题命中 视觉推理 :vision-language model(title);visual language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * Baidu Inc.(百度公司) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Intel Lab, Intel(英特尔实验室)
专题命中 视觉推理 :vision-language model(title);visual reasoning(abstract);MLLM(abstract);分类 cs.AI
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG
Comments 11 pages, updated version
机构 * Department of Computer Science and Informatics, Emory University(计算机科学与信息学系,埃默里大学) ; Department of Computer Science and Department of Electrical and Computer Engineering, University of Southern California(计算机科学系和电气与计算机工程系,南加州大学) ; Department of Computer Science, University of Tokyo(计算机科学系,东京大学) ; Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) ; Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(生物医学工程系,佐治亚理工学院和埃默里大学)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.LG
Comments EMNLP 2025. Project Website: https://vehme.github.io/
机构 * Department of Psychology, Music and Audio Research Laboratory(心理学系、音乐与音频研究实验室) ; Department of Electronic Engineering and Computer Science(电子工程与计算机科学系)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI
Comments Accepted to the NeurIPS 2025 Workshop on AI for Music (AI4Music), 16 pages, 1 figure, 3 tables
机构 * City University of Hong Kong(香港城市大学) ; Tencent(腾讯) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG
Journal ref NeurIPS 2025
机构 * Adobe Research(Adobe研究机构) ; University of Michigan(密歇根大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025; First three authors contributed equally. Project page: https://veggie-gen.github.io/
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The University of Tokyo(东京大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2025
机构 * Lappeenranta-Lahti University of Technology LUT(拉普兰塔-拉赫蒂技术大学) ; Nanyang Technological University(南洋理工大学) ; Brno University of Technology(布拉格技术大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ACMMM 2025
Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (2025)
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Zhongguancun Academy(中关村学院) ; Shanghai Innovation Institute(上海创新研究院) ; Lehigh University(莱特大学)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by NeurIPS 2025
机构 * VILA Lab, Department of Machine Learning, MBZUAI(VILA实验室,机器学习系,MBZUAI)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2025. Code at: https://github.com/VILA-Lab/M-Attack
机构 * Wuhan University(武汉大学) ; ByteDance(字节跳动)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 视觉推理 :visual question answering(abstract);分类 cs.AI、cs.LG
Comments Accepted at NeurIPS 2025. 34 pages, 7 figures
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Project Page: vaynexie.github.io/CannyEdit/; MindSpore Code: github.com/mindspore-lab/mindone/tree/master/examples/canny_edit; PyTorch Code: github.com/vaynexie/CannyEdit
机构 * Emerald High School(埃默尔德高中)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) ; Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院计算与智能研究所) ; Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University(贵州大学文字计算与认知智能教育部工程研究中心) ; Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学) ; ByteDance Seed (China)(字节跳动种子(中国))
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2025;