On the Faithfulness of Visual Thinking: Measurement and Enhancement
机构 * Wuhan University(武汉大学) ; ByteDance(字节跳动)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Wuhan University(武汉大学) ; ByteDance(字节跳动)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 视觉推理 :visual question answering(abstract);分类 cs.AI、cs.LG
Comments Accepted at NeurIPS 2025. 34 pages, 7 figures
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Project Page: vaynexie.github.io/CannyEdit/; MindSpore Code: github.com/mindspore-lab/mindone/tree/master/examples/canny_edit; PyTorch Code: github.com/vaynexie/CannyEdit
机构 * Emerald High School(埃默尔德高中)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Apple(苹果公司)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.LG
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Renmin University of China(中国人民大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments This work is in progress
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI
机构 * Greenwich Vietnam FPT University(越南格林威治FPT大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments 25 pages, 3 figures
机构 * Seoul National University(首尔国立大学) ; Oracle(Oracle公司) ; Yonsei University(延世大学) ; Intel Labs(英特尔实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at NeurIPS 2025 (poster). This is the camera-ready version
机构 * DP Technology(DP技术公司) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
机构 * University of Waterloo(滑铁卢大学) ; Sea AI Lab(Sea AI 实验室) ; University of Toronto(多伦多大学) ; Shanghai University(上海大学) ; HKUST(香港科技大学) ; M-A-P ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments 32 pages, 5 figures, 13 tables
机构 * Stanford University(斯坦福大学) ; Jet Propulsion Laboratory(喷气推进实验室) ; California Institute of Technology(加州理工学院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Department of Health Outcomes and Biomedical Informatics, University of Florida(健康结果与生物医学信息学系,佛罗里达大学) ; Department of Urology, University of Florida(泌尿外科系,佛罗里达大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Tsinghua University(清华大学) ; ByteDance Seed(字节跳动种子) ; Princeton University(普林斯顿大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments I would like to formally request the withdrawal of my manuscript from arXiv. After a further internal review, I realized that the dataset used in this study contains personal or sensitive information that may inadvertently compromise individuals' privacy
机构 * University of Science and Technology of China(科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments ACM Multimedia 2025 Oral Code: https://github.com/ZhiyuanHan-Aaron/MoSEAR Project Page: https://zhiyuanhan-aaron.github.io/MoSEAR-page/
机构 * THU(清华大学) ; PKU(北京大学) ; Ant Group(蚂蚁集团)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments preprint, under review
机构 * University of Central Florida(中央佛罗里达大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Stanford University(斯坦福大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Meta FAIR ; Cornell University(康奈尔大学) ; Stony Brook University(石溪大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * XLANG Lab, The University of Hong Kong(香港大学XLANG实验室) ; Moonshot AI ; Stanford University(斯坦福大学) ; University of Waterloo(滑铁卢大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Updata author list, modify first page format, correct typos
机构 * VUNO Inc.(VUNO公司) ; KAIST(韩国科学技术院) ; POSTECH(POSTECH大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments 34 pages, 30 figures, preprint
机构 * ILLC, University of Amsterdam(伊拉斯谟范例学院、阿姆斯特丹大学) ; ILCC, University of Edinburgh(爱丁堡大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Fantasyele
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Under review
机构 * Oracle AI
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted in EMNLP 2025
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Project:https://github.com/InternLM/Spark
机构 * SETLabs Resarch GmbH(SETL实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 11 pages, 3 figures
机构 * Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Bytedance(字节跳动)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI