arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-21 至 2025-10-21 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 10 篇

2510.16907 2025-10-21 cs.AI cs.CL 83%

VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents

Kangrui Wang, Pingyue Zhang, Zihan Wang, Yaning Gao, Linjie Li, Qineng Wang, Hanyang Chen, Chi Wan, Yiping Lu, Zhengyuan Yang, Lijuan Wang, Ranjay Krishna, Jiajun Wu, Li Fei-Fei, Yejin Choi, Manling Li

机构 * Northwestern University(西北大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Microsoft(微软) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17274 2025-10-21 cs.CV 79%

Enhanced Motion Forecasting with Plug-and-Play Multimodal Large Language Models

Katie Luo, Jingwei Ji, Tong He, Runsheng Xu, Yichen Xie, Dragomir Anguelov, Mingxing Tan

机构 * Computer and Information Sciences Department, Cornell University(康奈尔大学计算机与信息科学系) Waymo LLC(Waymo公司) UC Berkeley(伯克利大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

Comments In proceedings of IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14671 2025-10-21 cs.CV 70%

UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens

Ruichuan An, Sihan Yang, Renrui Zhang, Zijun Shen, Ming Lu, Gaole Dai, Hao Liang, Ziyu Guo, Shilin Yan, Yulin Luo, Bocheng Zou, Chaoqun Yang, Wentao Zhang

机构 * Peking University(北京大学) Xi’an JiaoTong University(西安交通大学) CUHK(香港中文大学) Intel Labs, China(中国英特尔实验室) Nanjing University(南京大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17354 2025-10-21 cs.CL cs.AI cs.IR cs.LG 62%

Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation

Chenghao Zhang, Guanting Dong, Xinyu Yang, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

Comments This work is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17157 2025-10-21 cs.CV cs.AI 62%

GACO-CAD: Geometry-Augmented and Conciseness-Optimized CAD Model Generation from Single Image

Yinghui Wang, Xinyu Zhang, Peng Du

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16772 2025-10-21 cs.CV cs.AI 62%

Region in Context: Text-condition Image editing with Human-like semantic reasoning

Thuy Phuong Vu, Dinh-Cuong Hoang, Minhhuy Le, Phan Xuan Tan

机构 * Greenwich Vietnam FPT University(越南格林威治FPT大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16643 2025-10-21 cs.CV cs.AI cs.RO 62%

Structured Interfaces for Automated Reasoning with 3D Scene Graphs

Aaron Ray, Jacob Arkin, Harel Biggie, Chuchu Fan, Luca Carlone, Nicholas Roy

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16540 2025-10-21 cs.CV cs.AI 62%

Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions

Jihoon Kwon, Kyle Min, Jy-yong Sohn

机构 * Seoul National University(首尔国立大学) Oracle(Oracle公司) Yonsei University(延世大学) Intel Labs(英特尔实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted at NeurIPS 2025 (poster). This is the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00568 2025-10-21 cs.CV 57%

CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning

Ke Niu, Zhuofan Chen, Haiyang Yu, Yuwen Chen, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16641 2025-10-21 cs.CV 57%

MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models

Young-Jun Lee, Byung-Kwan Lee, Jianshu Zhang, Yechan Hwang, Byungsoo Ko, Han-Gyu Kim, Dongyu Yao, Xuankun Rong, Eojin Joo, Seung-Ho Han, Bowon Ko, Ho-Jin Choi

机构 * KAIST(韩国科学技术院) WHU(华中科技大学) NAVER CMU(卡内基梅隆大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

Comments Project website: https://passing2961.github.io/multiverse-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏