Unifying Vision-Language Representation Space with Single-tower Transformer
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
Comments AAAI 2023, 11 pages
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
Comments AAAI 2023, 11 pages
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments NeSy 2022, 16th International Workshop on Neural-Symbolic Learning and Reasoning, Cumberland Lodge, Windsor, UK
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
Comments 10 pages, 3 figures
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at Complex Networks 2021
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
Journal ref 2020 International Conference on Robotics and Automation
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
Comments 20 pages, 18 figures, 2 tables
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments ICCV 2019, 10 pages, 9 figures
Journal ref International Conference on Computer Vision, 2019
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 2 figures
Journal ref IJCAI 2019
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
Comments CNLVR,NLVR. Accepted to ACL 2018
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Accepted in IJCAI-17
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments 23 pages; CVPR 2017 submission; see https://guesswhat.ai
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments To appear in AAAI 2016
专题命中 视觉推理 :vision-language model(abstract,comments);分类 cs.AI
Comments large language models, large vision-language model, reasoning, non-ideal conditions, reinforcement learning
超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析
机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。
OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。
从语音到掩码轨迹的运动感知推理:2026年第8届LSVOS挑战赛MeViS音频赛道亚军方案
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 该研究提出Speech2MaskTrack方案,整合语音识别、运动定位等技术,在第8届LSVOS挑战赛MeViS音频赛道获亚军,实现语音引导的参考视频对象分割任务。
基于几何与知识基础的大语言模型推理的任务驱动型3D可打印性辅助
机构 * Colorado School of Mines(科罗拉多矿业学院)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 该研究提出一种基于几何与知识基础的LLM推理的任务驱动型3D可打印性辅助框架,可生成多维度结构化打印建议,经实验验证其可提升可打印性、任务适用性及材料选择准确率。
DesignAgent3D:通过类设计师多模态推理实现交互式3D场景编辑
机构 * University of Michigan(密歇根大学) ; University of Notre Dame(圣母大学) ; Yale University(耶鲁大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 DesignAgent3D是一种交互式多模态智能体框架,通过类设计师的规划-感知-行动范式解决文本引导3D场景编辑的缺陷,在NeRF和3D Gaussian Splatting上均优于现有方法,实现了更优的语义对齐、空间定位精度和多视图一致性。
Traj-VLN:通过自回归轨迹生成学习像素空间交互
机构 * Southern University of Science and Technology(南方科技大学) ; Peng Cheng National Laboratory(鹏城国家实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。
SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查
机构 * University of South Florida(佛罗里达州立大学) ; University of California, Davis(加州大学戴维斯分校)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。
迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体
机构 * College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院) ; James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) ; School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院) ; Magnesium Research Center, Kumamoto University(熊本大学镁研究中心) ; Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系) ; State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 本文综述以LLM为核心的智能系统演进,提出整合LLMs、KBs、RA与具身性的概念框架,明确高效LLM部署等五大挑战,为开发复杂动态环境下的自适应多模态智能体提供路线图。
Journal ref International Journal of Hydromechatronics 9(2) (2026) 250-316
CAViAR:用于真实场景细粒度事故推理的因果视频数据集
机构 * NEC Laboratories, America(美国NEC实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。
Comments Accepted to ECCV 2026 Workshop DriveX
持续推理环境:诊断与利用持续RLVR中的共享推理
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI)) ; Beijing Institute of Technology(北京理工大学) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室、北京大学智能科学与技术学院)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG
AI总结 本研究提出持续推理环境,针对持续RLVR中顺序训练性能低于MTRL的问题,提出CPR方法利用共享推理,使模型平均达到MTRL级性能。