RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2024 camera ready; source code to be released at: https://github.com/shantanuj/IPRM_Iterative_and_Parallel_Reasoning_Mechanism
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract)
Comments Paper has been submitted to The ASME Journal of Computing and Information Science in Engineering (JCISE)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract)
专题命中 视觉推理 :multimodal large language model(title,abstract);LLaVA(abstract)
Comments CoRL 2024
专题命中 视觉推理 :visual language model(title,abstract);visual reasoning(abstract)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :vision language model(title,abstract);visual reasoning(abstract)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract)
Comments 8 pages, 6 figures, submitted to IROS 2024
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at TMLR 2024. Project Page: https://shikun.io/projects/prismer Code: https://github.com/NVlabs/prismer
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by 2nd MATH-AI Workshop at NeurIPS'22
Journal ref Adv. Artif. Intell. Mach. Learn.(2023), 3(1):839-852
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2022 (oral); First two authors contributed equally; Code: https://github.com/NVlabs/Bongard-HOI
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Journal ref Information Fusion, Volume 91, March 2023, Pages 713-736
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments The first two authors contributed equally to this work
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments EMNLP 2022 long paper
专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2022
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2021. Project page: http://vrdp.csail.mit.edu/
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments 22 pages, 5 figures
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICCV 2021
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to CVPR 2021. Resources including the TRANCE dataset and the code can be found at our homepage https://hongxin2019.github.io/TVR
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
Comments International Conference on Robotics and Automation (ICRA) 2020
专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2019 paper. Supplementary: http://wellyzhang.github.io/attach/cvpr19zhang_supp.pdf Project: http://wellyzhang.github.io/project/raven.html
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG
基于理由引导学习的多模态情感识别
专题命中 视觉推理 :MLLM(summary_cn,abstract);分类 cs.AI
AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。
Comments ICASSP 2026
空间记忆智能体:用于空间智能的基于经验的过程记忆
机构 * Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。
Comments Under Review
MMArch:基于建筑证据的多模态推理基准测试
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。
EffectLearner:面向真实世界视频物体移除的世界感知物体-效应推理
专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 该研究提出EffectLearner框架,结合VLM物体-效应推理器与DiT视频擦除器,构建专属数据集EffectWorld并采用渐进式训练,在视频物体移除任务上实现更优性能。
Comments Project: https://morleyolsen.github.io/EffectLearner/
超越单摄像头:体育视频理解中的智能多视角推理
机构 * Zhejiang University(浙江大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。