CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language Models
机构 * EverEx ; Yonsei University(延世大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments ICCV 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * EverEx ; Yonsei University(延世大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments ICCV 2025
机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所人工智能安全重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Trustworthy Technology and Engineering Laboratory, Huawei(华为可信技术与工程实验室)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
Comments Accepted to VISION'25 - ICCV 2025 workshop