ChartNet: Visual Reasoning over Statistical Charts using MAC-Networks
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.LG
Journal ref International Joint Conference on Neural Networks (IJCNN) 2019
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.LG
Journal ref International Joint Conference on Neural Networks (IJCNN) 2019
专题命中 视觉推理 :visual reasoning(title);分类 cs.AI、cs.LG
Comments Accepted at IJCAI19 Neural-Symbolic Learning and Reasoning Workshop (https://sites.google.com/view/nesy2019/home)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV、cs.LG
Comments In Proc of ECCV 2018
Co-RL:多智能体强化学习中多样群体涌现的无监督推理
机构 * University of Exeter(埃克塞特大学) ; ByteDance(字节跳动) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; UC San Diego(加州大学圣迭戈分校)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。
Comments 30 pages, 5 figures, 11 tables
放大并不意味着具有预测性:思考模型中的推理行为
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。
Comments Published in COLM 2026
当提示忽略结构时:基于图的属性推理用于校准视觉语言模型
机构 * Birla Institute of Technology and Science, Pilani(贝拉科技与科学学院皮拉尼分校) ; TCS Research(塔塔咨询服务公司研究院)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 研究视觉语言模型测试时自适应中可靠置信度估计问题,提出ARGTCA方法,将(类,属性)对表示为符号属性图节点,用对比目标训练图注意力网络,引入两种属性选择策略,实验证明该方法能有效降低校准误差。
人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 视觉推理 :VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。
Comments Under review, 47 pages, 14 figures, 22 tables
WorldScape Policy 2.0:通过推理增强记忆实现可控的世界行动建模
专题命中 视觉推理 :VLM(abstract,abstract_cn);grounding(abstract)
AI总结 研究针对现有世界行动模型的局限,提出WorldScape Policy 2.0,用推理增强记忆,构建相关数据集,实现从高级指令自主规划及基于细粒度文本等的可控执行,在模拟和现实平台实验中展现出在多方面的卓越能力。
思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理
机构 * Tencent(腾讯) ; Peking University(北京大学)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。
Comments 22 pages, 12 figures, 9 tables
主动观察者的测试
机构 * University of Southern California(南加州大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 研究多模态大语言模型是否具备主动观察能力,引入ActiveVision基准测试,发现前沿模型表现不佳,即便能编写视觉代码差距仍存,表明当前模型缺乏主动视觉观察,呼吁构建闭合感知 - 推理循环的架构和训练目标。
Comments 17 pages, 8 figures, 4 tables. Project page: https://activevision.dev
面向机器人血管内导丝导航的视觉-语言程序化推理与上下文感知奖励建模
机构 * Department of Control Science and Engineering, College of Electronic and Information Engineering, and Shanghai Institute of Intelligent Science and Technology, Tongji University(同济大学电子与信息工程学院控制科学与工程系,以及上海智能科学与技术研究院) ; Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院电子工程系) ; Shanghai Operation Robot Co., Ltd.(上海微创医疗机器人(集团)股份有限公司)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 提出视觉-语言程序化推理框架,利用多模态大模型实时理解视觉上下文,动态调整奖励权重,实现单策略适应复杂血管导航任务,提升可靠性与效率。
Comments This paper has been accepted by IEEE/RSJ IROS 2026. 7 pages, 4 figures, 2 tables
EVLA:一种用于物理接地驾驶推理与控制的电感知多模态助手
机构 * College of Computer Science and Technology(计算机科学与技术学院)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出EVLA框架,融合视觉、文本与实时电动动力总成状态,通过统一共状态编码器和电感知结构化推理链,生成上下文感知且能量最优的驾驶决策,在驾驶问答基准上显著优于基线模型。
Comments 17 pages
从识别到理解:利用LLM解锁认知时间序列推理
机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) ; Zhejiang University(浙江大学) ; Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);grounding(abstract)
AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。
基于热启发的扩散模型实现从视觉和语言的多机器人运动规划
机构 * Department of Artificial Intelligence, Yonsei University(燕山大学人工智能学院) ; School of Mechanical Engineering, Yonsei University(燕山大学机械工程学院)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 提出LHD框架,结合CLIP语义先验与碰撞避免扩散核,实现语言条件化的多机器人无碰撞轨迹规划,在成功率上优于先前方法并降低延迟。
Comments 8 pages, 6 figures, accepted by IEEE Robotics and Automation Letters (RA-L)
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7118-7125, June 2026
连接短视频与直播:推理引导的多模态大语言模型用于跨域表示学习
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 针对短视频到直播的跨域推荐冷启动问题,提出推理引导的跨域表示学习框架RGCD-Rep,利用多模态大语言模型生成结构化推理知识并蒸馏到轻量模型,通过两阶段训练学习可迁移的物品表示,在快手部署后显著提升核心业务指标。
Comments 9 pages
HCSG:以人类为中心的语义-几何推理用于视觉-语言导航
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tsinghua University(清华大学) ; University of Science and Technology Beijing(北京科技大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 HCSG提出了一种以人类为中心的框架,通过结合几何预测和语义解释,提升动态环境中视觉-语言导航的安全性和社交智能。
AlphaGRPO:通过分解性可验证奖励解锁UMMs中的自反思多模态生成
机构 * The University of Hong Kong(香港大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 AlphaGRPO通过分解性可验证奖励提升多模态生成能力,实现文本到图像生成和自反思修正,验证了自反思强化方法在生成高质量输出中的有效性。
Comments ICML2026
IGV-RRT:面向动态环境主动目标搜索的先验-实时观测融合
机构 * The School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) ; Department of Data and Systems Engineering, HKU(数据与系统工程系,香港大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract)
AI总结 本文提出IGV-RRT框架,结合先验场景知识与实时目标相关性估计,通过双层语义映射模块和实时规划器提升动态环境中目标搜索效率。
用草图思考:通过逻辑重建实现光学解压
机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) ; University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) ; Key Laboratory of Computing Power Network(计算功率网络重点实验室) ; Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。
轨迹可 traversability 的推理:语言引导的越野3D轨迹规划
机构 * Department of Automotive Engineering, Hanyang University, Seoul, Republic of Korea(韩雅大学汽车工程系,首尔,大韩民国)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出语言精修框架与偏好优化策略,通过动作对齐监督和地形感知优化,提升越野3D轨迹规划的合规性与地形一致性。
DAT:双重视觉与带宽感知的自适应传输,用于边缘-云计算系统中高效多模态大语言模型推理
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract)
AI总结 本文提出DAT方法,通过轻量级边缘模型过滤非目标帧并触发MLLM推理,结合高效微调策略和多流自适应传输优化,实现高效多模态大语言模型推理,提升语义生成质量与低延迟警报性能。
Comments 10 pages, 6 figures. Submitted to ACM Multimedia 2026
可调节的视觉-语言-动作策略用于具身推理和分层控制
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract)
AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。
SPHINX:一个用于视觉感知与推理的合成环境
机构 * Rochester Institute of Technology(罗彻斯特理工学院) ; University of Washington(华盛顿大学)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 SPHINX通过生成具有可验证解的谜题,评估视觉感知与推理能力,发现大模型表现不足,RLVR方法显著提升性能。
VueBuds:集成摄像头的无线耳机实现视觉智能
专题命中 视觉推理 :vision language model(abstract);VLM(abstract);visual reasoning(abstract)
AI总结 VueBuds通过集成摄像头的无线耳机实现视觉智能,利用低功耗单色摄像头和视觉语言模型进行实时场景理解与文本阅读,其性能与智能眼镜相当。
Comments CHI 2026
Perception-R1: 通过视觉感知奖励提升多模态大语言模型的多模态推理能力
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; iFLYTEK AI Research(iFLYTEK人工智能研究院) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 Perception-R1通过引入视觉感知奖励提升多模态大语言模型的多模态推理能力
Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; Meituan(美团)
专题命中 视觉推理 :vision language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。
Comments Published as a conference paper at ICLR 2026!
基于框架的思考:视觉上下文和测试时扩展如何增强视频推理
机构 * University of Cambridge(剑桥大学) ; Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) ; Hong Kong University of Science(香港科学大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Peking University(北京大学)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。
Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)
PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract)
AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。
GLM-4.5V 和 GLM-4.1V-Thinking:迈向具有可扩展强化学习的多功能推理
机构 * Zhipu AI & Tsinghua University(智谱AI与清华大学)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 GLM-4.5V和GLM-4.1V-Thinking通过可扩展强化学习提升多模态推理能力,实现多任务高性能表现。
MM-PoE:通过多模态模型的排除过程进行多选推理
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。