arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-05 至 2026-01-05 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 3 篇

2503.19936 2026-01-05 cs.CV 83%

VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs

VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院) School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院) School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 VisualQuest通过风格化图像和针对性问题,评估多模态大语言模型在抽象视觉推理上的能力,发现Gemini和GPT-4o在不同任务上表现突出,揭示多模态理解的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01006 2026-01-05 cs.CV cs.AI cs.LG 75%

GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

GLM-4.5V 和 GLM-4.1V-Thinking:迈向具有可扩展强化学习的多功能推理

V Team, Wenyi Hong, Wenmeng Yu, Xiaotao Gu, Guo Wang, Guobing Gan, Haomiao Tang, Jiale Cheng, Ji Qi, Junhui Ji, Lihang Pan, Shuaiqi Duan, Weihan Wang, Yan Wang, Yean Cheng, Zehai He, Zhe Su, Zhen Yang, Ziyang Pan, Aohan Zeng, Baoxu Wang, Bin Chen, Boyan Shi, Changyu Pang, Chenhui Zhang, Da Yin, Fan Yang, Guoqing Chen, Haochen Li, Jiale Zhu, Jiali Chen, Jiaxing Xu, Jiazheng Xu, Jing Chen, Jinghao Lin, Jinhao Chen, Jinjiang Wang, Junjie Chen, Leqi Lei, Letian Gong, Leyi Pan, Mingdao Liu, Mingde Xu, Mingzhi Zhang, Qinkai Zheng, Ruiliang Lyu, Shangqin Tu, Sheng Yang, Shengbiao Meng, Shi Zhong, Shiyu Huang, Shuyuan Zhao, Siyan Xue, Tianshu Zhang, Tianwei Luo, Tianxiang Hao, Tianyu Tong, Wei Jia, Wenkai Li, Xiao Liu, Xiaohan Zhang, Xin Lyu, Xinyu Zhang, Xinyue Fan, Xuancheng Huang, Yadong Xue, Yanfeng Wang, Yanling Wang, Yanzi Wang, Yifan An, Yifan Du, Yiheng Huang, Yilin Niu, Yiming Shi, Yu Wang, Yuan Wang, Yuanchang Yue, Yuchen Li, Yusen Liu, Yutao Zhang, Yuting Wang, Yuxuan Zhang, Zhao Xue, Zhengxiao Du, Zhenyu Hou, Zihan Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Zhipu AI & Tsinghua University(智谱AI与清华大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GLM-4.5V和GLM-4.1V-Thinking通过可扩展强化学习提升多模态推理能力,实现多任务高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00694 2026-01-05 cs.AI 57%

A Vision-and-Knowledge Enhanced Large Language Model for Generalizable Pedestrian Crossing Behavior Inference

一种融合视觉与知识的大型语言模型用于可推广的行人过街行为推断

Qingwen Pu, Kun Xie, Hong Yang, Guocong Zhai

专题命中 视觉推理 :LLaVA(abstract);分类 cs.AI

AI总结 本研究提出PedX-LLM,融合视觉与知识的大型语言模型,用于可推广的行人过街行为推断,通过整合视觉特征和领域知识提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏