arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-03 至 2025-12-03 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 5 篇

2508.15690 2025-12-03 cs.AI cs.LG cs.MM 81%

GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning

GRAFT:用于文本对齐的图和表推理——一个结构化指令遵循和视觉推理的基准

Abhigya Verma, Sriram Puttagunta, Seganrasan Subramanian, Sravan Ramachandran

机构 * ServiceNow

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GRAFT基准通过结构化图表和表格及多步骤问题,评估大语言模型在视觉文本对齐、指令遵循和视觉推理方面的综合能力。

Comments 25 pages, 10 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02340 2025-12-03 cs.AI cs.CV 73%

Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective

多视角视觉空间推理的推理路径与潜在状态分析:从认知科学视角

Qiyao Xue, Weichen Liu, Shiqi Wang, Haoming Wang, Yuyang Wu, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ReMindView-Bench从认知科学视角评估VLMs在多视角空间推理中的表现,揭示其在跨视角对齐和视角取向方面的不足。

Comments 23 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01830 2025-12-03 cs.CV 70%

OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic

OpenREAD: 基于LLM作为批评者的开放性推理端到端自动驾驶框架

Songyan Zhang, Wenhui Huang, Zhan Chen, Chua Jiahao Collister, Qihang Huang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学) Harvard University, USA(哈佛大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 OpenREAD通过端到端强化微调框架,结合LLM作为批评者,提升自动驾驶中的推理与规划能力,实现从高层推理到低层轨迹规划的全面优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02942 2025-12-03 cs.CV cs.AI 62%

Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench

基于视频科学基准的视频生成科学理解与推理评估

Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02699 2025-12-03 cs.AI 57%

Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding

学习优先关注什么:模态重要性引导的推理用于可靠的多模态情感理解

Hyeongseop Rha, Jeong Hun Yeo, Junil Won, Se Jin Park, Yong Man Ro

机构 * Integrated Vision and Language Lab, KAIST, South Korea(韩国成均馆大学集成视觉与语言实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出MIGR框架,通过模态重要性引导推理,提升多模态情感理解的可靠性,实验表明能有效减少情感不一致的解释实例。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏