arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-05 至 2025-11-05 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 5 篇

2511.02415 2025-11-05 cs.CV 83%

ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension

Duo Xu, Hao Cheng, Xin Lin, Zhen Xie, Hao Wang

机构 * Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments 23 pages, EMNLP25 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01999 2025-11-05 cs.RO cs.AI 70%

TRACE: Textual Reasoning for Affordance Coordinate Extraction

Sangyun Park, Jin Kim, Yuchen Cui, Matthew S. Brown

机构 * ABB Robotics(ABB机器人公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments ICCV 2025. *Equal contribution. †Corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20241 2025-11-05 cs.LG cs.AI 62%

DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning

Qi Cao, Ruiyi Wang, Ruiyi Zhang, Sai Ashish Somayajula, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 28 pages, 10 figures, to appear in NeurIPS 2025 (Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02794 2025-11-05 cs.AI cs.MA 57%

When One Modality Sabotages the Others: A Diagnostic Lens on Multimodal Reasoning

Chenyu Zhang, Minsol Kim, Shohreh Ghorbani, Jingyao Wu, Rosalind Picard, Patricia Maes, Paul Pu Liang

机构 * Harvard University(哈佛大学) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted at the Multimodal Algorithmic Reasoning (MAR) Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02779 2025-11-05 cs.CV 57%

When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought

Yiyang Zhou, Haoqin Tu, Zijun Wang, Zeyu Wang, Niklas Muennighoff, Fan Nie, Yejin Choi, James Zou, Chaorui Deng, Shen Yan, Haoqi Fan, Cihang Xie, Huaxiu Yao, Qinghao Ye

机构 * ByteDance Seed(字节跳动种子) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Santa Cruz(圣克拉拉大学) Stanford(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏