When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Bosch Center for AI(博世人工智能中心)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract)
Comments We remove OSG and CogNav from Table. 1 for a fair comparison
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV
Comments Project Website: https://www.anjiecheng.me/sr3d
机构 * Xiaomi Corporation Beijing, China(小米公司北京)
专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV
机构 * Kalyani Government Engineering College(卡利尼政府工程学院) ; Intel Labs(英特尔实验室)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV