Enhance Reasoning Ability of Visual-Language Models via Large Language Models
专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.AI
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV
Comments To appear in CVPR2022
专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at IJCAI 2020 Main Track. Sole copyright holder is IJCAI. Code is available at https://github.com/tgc1997/RMN
Journal ref IJCAI 2020, Pages 745-752
专题命中 视觉推理 :VLM(abstract,comments);vision-language model(abstract)
Comments Appendix and details can be found in project website: https://aha-vlm.github.io/
专题命中 视觉推理 :multimodal large language model(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments LogicVista benchmarks the logical reasoning of multimodal large language models in visual tasks
为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)
AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。
权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习
专题命中 视觉推理 :VLM(abstract,abstract_cn)
AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。
Comments 9 pages, 4 figures, and 3 tables
CADEngBench:它看起来像CAD,但真的能用吗?——参数化设计、装配推理与物理仿真的评估
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出CADEngBench双轨基准,从参数化设计、装配推理等维度评估8种多模态代码模型,发现编辑现有CAD更易,复杂编辑与匹配FEA仍难,装配预测存在缺陷,强调CAD评估需关注工程行为而非外观。
深度学习在几何问题求解中的应用综述
机构 * Renmin University of China(中国人民大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文综述了深度学习在几何问题求解中的应用,涵盖相关任务、方法、评估指标及未来方向,旨在提供实践参考以推动该领域发展。
Comments ACL 2026 Main Conference
TRAM:利用轨迹衍生辅助记忆增强多模态推理
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract)
AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。
SoM-1K:用于材料力学能力的千题基准数据集
机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) ; Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) ; Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) ; School of Architecture, University of Miami(迈阿密大学建筑学院) ; Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)
专题命中 视觉推理 :vision language model(abstract,abstract_cn)
AI总结 该研究推出含1065道题的SoM-1K多模态基准,评估8种基础模型的材料力学能力,提出DoI提示策略,发现当前模型表现差,LLMs配DoI优于VLMs配图像,为工程AI提供基准并强调多模态推理需求。
SAGE: 可扩展的代理基于地面评估用于作物疾病诊断
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract)
AI总结 本文提出SAGE框架,通过构建大规模作物疾病图像-症状数据集,结合自动管道生成基于源的症状描述,并引入自主视觉推理代理提升疾病诊断准确性。
Journal ref CVPR 2026 Workshop on Emerging Directions in Data for Multimodal Foundation Models
桥接语义与运动学:零样本机器人操作的模块化框架
机构 * Atlantic Technological University(大西洋理工大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn)
AI总结 提出一种模块化免训练框架,通过视觉感知、语义路由和任务编排三阶段,实现零样本语言引导的机器人操作,在两种零样本实验中达到62%端到端成功率。
Comments Accepted to RO-MAN 2026
关注细节的机器人批评家
机构 * Columbia University(哥伦比亚大学) ; Toyota Research Institute(丰田研究所)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn)
AI总结 针对大视觉语言模型在机器人操作中难以区分微小视觉差异的问题,提出通过成功与失败轨迹构建成对进展监督来微调批评家,提升细粒度推理和失败检测能力,并在真实和仿真任务中分别提高策略成功率11%和5.9%。
ThinkingVLA:用于机器人操作的交叉视觉与语言推理
机构 * Fudan University(复旦大学)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract)
AI总结 提出ThinkingVLA,通过统一的多Transformer架构实现前向与逆向推理交织,显著提升长时域操作任务性能。
GRACE:基于上下文忠实推理的步骤级基准
机构 * Nanyang Technological University(南洋理工大学) ; VinUniversity
专题命中 视觉推理 :grounding(abstract,abstract_cn)
AI总结 提出GRACE,首个带人工标注的步骤级忠实性基准,通过数据驱动错误分类法评估上下文推理中的链式思维步骤,并证明步骤级忠实信号可提升下游准确性和推理可靠性。
UniT:统一多模态思维链测试时扩展
机构 * Stanford University(斯坦福大学) ; Meta Superintelligence Labs(Meta超级智能实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。
Comments CVPR 2026
MET-Bench:用于评估视觉语言与推理模型局限性的多模态实体追踪
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract)
AI总结 提出MET-Bench多模态实体追踪基准,发现视觉语言模型在图像实体追踪上显著弱于文本,主要源于视觉推理缺陷,强化学习可提升模态内性能但跨模态迁移不足。
Comments ICML 2026
MentisOculi: 揭示心智图像推理的局限性
机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MentisOculi基准,通过多步推理问题测试前沿模型利用视觉表示辅助推理的能力,发现视觉策略普遍无法提升性能,且统一多模态模型存在生成错误累积和无法利用真实可视化的问题。
Comments 9 pages, 8 figures, Accepted at ICML 2026
EVE: 一种生成策略的生成-验证系统
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Toyota Research Institute(丰田研究院) ; Symbotic Inc.(Symbotic公司)
专题命中 视觉推理 :VLM(abstract,abstract_cn)
AI总结 本文提出EVE系统,通过生成-验证框架在测试时提升预训练生成策略的性能,利用零样本视觉语言模型验证者进行动作优化,无需额外训练。
StressDream: 引导视频世界模型实现鲁棒的策略评估与改进
机构 * Carnegie Mellon University(卡内基梅隆大学) ; NVIDIA Research(NVIDIA研究) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。
Comments Project page: https://junwon.me/StressDream/
JUDO: 一种面向工业异常问答的多模态推理框架
机构 * Sungkyunkwan University(成均馆大学) ; Seoul National University(首尔国立大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出JUDO框架,通过结合领域知识和上下文提升多模态推理能力,以解决工业异常检测中模型缺乏领域知识的问题,实验表明其在MMAD基准上优于Qwen2.5-VL-7B和GPT-4o。
Comments Published at ICLR 2026
IterSIMP-σ:评估LLM辅助的应力感知拓扑优化中的空间干预
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)
AI总结 本文研究多模态大语言模型(LLM)是否能作为可检查的空间提案模块用于应力感知拓扑优化。IterSIMP-σ保持SIMP优化器作为最小化合规性的有限元求解器,并在其周围放置一个确定性的应力传递、门控评估器和混合LLM/规则解释器。每次求解后,密度和von Mises应力场被渲染;解释器提出排名的空间干预;确定性的安全措施接受、拒绝或停止每个动作。主要动作是软密度种子,所选元素在下一次求解前被初始化为高密度,但在最优标准更新时仍保持自由。我们评估该循环在16问题2D控制器-政策基准、6问题探索性3D扩展、被动固体和输入消融、应力阈值敏感性以及固定体积归因研究中,比较LLM提案与确定性最大应力热点种子、随机应力区域种子和基于规则的控制。2D控制器-政策基准显示保留合规性差异较小(软种子LLM的几何均值低1.9%),但此诊断不显著(W=33,双侧p=0.382)且不是固定体积可行最终比较。在固定体积研究中,LLM条件完成了44/48次尝试评估;25/44次完成评估产生了全部门通过的保留状态。与基于规则的控制的可行最终评分分为4/4/1,确定性精确热点种子仍具竞争力。接受的LLM空间动作有每步记录的平均归一化种子到热点距离为0.221。结果支持IterSIMP-σ作为可检查的LLM辅助设计自动化框架用于空间干预,但尚未作为证据表明LLM视觉推理能改进应力约束优化。
Comments 44 pages, 19 figures, 14 tables
具有90万规模日本全国学业能力评估学生响应分布的多模态基准
机构 * Osaka Kyoiku University(大阪教养大学) ; University of Tokyo(东京大学) ; NII LLMC(日本国家信息与通信技术研究所大语言模型中心)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)
AI总结 本文提出一个基于日本全国学业能力评估的多模态数据集,包含真实考试布局、图表和教育文本,用于评估多模态大语言模型的性能,通过精确匹配准确率和字符级F1分数分析不同学科间的差异。
通过间接奖励解锁零样本地理推理
机构 * University at Buffalo(布法罗大学) ; Microsoft(微软)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出Geo-R1方法,利用间接可验证奖励提升地理推理能力,在多个下游任务中实现卓越的零样本迁移性能。
Comments ICML 2026
CaTS-Bench:语言模型能否描述时间序列?
机构 * Sapienza University of Rome(罗马大学) ; UC San Diego(圣地亚哥大学) ; ItalAI Labs(意大利AI实验室)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。
Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix
K-CARE:基于知识的对称上下文锚定与类比原型推理用于电商相关性
专题命中 视觉推理 :grounding(abstract,abstract_cn)
AI总结 K-CARE通过结合外部知识与类比推理,解决电商搜索中因知识边界缺失导致的相关性问题,显著提升性能。
PaperMind:多模态大语言模型中科学论文代理推理与批判的基准测试
专题命中 视觉推理 :grounding(abstract,abstract_cn)
AI总结 PaperMind通过整合多模态信息和跨源推理,评估科学论文的综合推理能力,揭示多模态大语言模型在科学推理和批判中的性能差距。
OMHBench: 多模态多跳推理的基准测试
机构 * Hanyang University(翰阳大学) ; NAVER Cloud(NAVER云) ; Knowledge Work Inc.(知识工作公司) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Sony AI(索尼人工智能)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract)
AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。
Comments ACL 2026 Findings
倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; CUHK MMLab(香港中文大学多媒体实验室) ; Fudan University(复旦大学)
专题命中 视觉推理 :grounding(abstract,abstract_cn)
AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。