arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26289 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4507 篇

2603.14052 2026-03-23 cs.CV cs.MA 57%

A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

一种多智能体感知-行动联盟用于高效长视频推理

Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV 57%

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR 57%

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 57%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18495 2026-03-20 cs.AI 57%

Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning

跨领域演示到代码的神经符号反事实推理

Jooyoung Kim, Wonje Choi, Younguk Song, Honguk Woo

机构 * Department of Computer Science and Engineering, Sungkyunkwan University(Sungkyunkwan 大学计算机科学与工程系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出NeSyCR框架,通过神经符号反事实推理解决跨领域机器人编程中的过程不匹配问题,提升任务成功率31.14%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17360 2026-03-19 cs.CV 57%

MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval

MCoT-MVS:基于多模态链式推理的多级视觉选择用于组合图像检索

Xuri Ge, Chunhao Wang, Xindi Wang, Zheyun Qin, Zhumin Chen, Xin Xin

机构 * Shandong University(山东大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出MCoT-MVS方法,通过多模态链式推理提取参考图像的多级视觉特征,结合注意力机制与文本提示,提升组合图像检索的准确性和鲁棒性。

Comments Accepted by The Web Conference 2026 (WWW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16822 2026-03-18 cs.AI 57%

Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Surg$Σ$: 一种大规模多模态数据和基础模型的光谱,用于外科智能

Zhitao Zeng, Mengya Xu, Jian Jiang, Pengfei Guo, Yunqiu Xu, Zhu Zhuo, Chang Han Low, Yufan He, Dong Yang, Chenxi Lin, Yiming Gu, Jiaxin Guo, Yutong Ban, Daguang Xu, Qi Dou, Yueming Jin

机构 * NUS(新加坡国立大学) CUHK(香港中文大学) SJTU(上海交通大学) NVIDIA(英伟达)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出Surg$Σ$,通过大规模多模态数据和基础模型提升外科智能,解决现有框架任务特定、泛化能力差的问题,展示统一语义设计和结构化推理标注的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16463 2026-03-18 cs.AI cs.HC 57%

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理

Yu Liu, Lei Zhang, Haoxun Li, Hanlei Shi, Yuxuan Ding, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16189 2026-03-18 cs.CV 57%

Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

通过多任务多奖励强化学习实现SVG-LLMs的可靠推理

Haomin Wang, Qi Wei, Qianli Ma, Shengyuan Ding, Jinhui Yin, Kai Chen, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CTRL-S框架,通过多任务多奖励优化提升SVG生成的结构连贯性和视觉保真度,实验表明其在任务成功率和SVG代码质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14497 2026-03-18 cs.CV cs.RO 57%

WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning

WorldVLM:结合世界模型预测与视觉语言推理

Stefan Englmeier, Katharina Winter, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用科学大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 WorldVLM结合视觉语言模型与世界模型,通过统一架构提升自动驾驶中的环境预测与决策能力,解决空间理解受限问题。

Comments 8 pages, 6 figures, 5 tables; submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15467 2026-03-17 cs.CV 57%

Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task

通过4D逃脱房间任务评估大模型的时间意识和跨模态主动感知

Yurui Dong, Ziyue Wang, Shuyun Lu, Dairu Liu, Xuechen Liu, Fuwen Luo, Peng Li, Yang Liu

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出4D逃脱房间任务,用于评估大模型在时间变化和不可逆条件下跨模态感知和时间意识的能力,发现模型在多模态整合中存在模态偏差和能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15008 2026-03-17 cs.CV 57%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14935 2026-03-17 cs.CV 57%

Video-CoE: Reinforcing Video Event Prediction via Chain of Events

Video-CoE:通过事件链强化视频事件预测

Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出Video-CoE方法,通过构建时间事件链提升视频事件预测的准确性,实验表明其优于现有主流大语言模型。

Comments 21 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01893 2026-03-17 cs.CV 57%

Generative Visual Chain-of-Thought for Image Editing

生成式视觉链式思维用于图像编辑

Zijin Yin, Tiankai Hang, Yiji Cheng, Shiyi Zhang, Runze He, Yu Xu, Chunyu Wang, Bing Li, Zheng Chang, Kongming Liang, Qinglin Lu, Zhanyu Ma

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 本文提出GVCoT框架,通过生成空间线索实现视觉推理与编辑,解决复杂场景下的编辑定位问题,提出GVCoT-Edit-Instruct数据集和SREdit-Bench基准,实验表明其在图像编辑任务中表现优异。

Comments Project page: https://pris-cv.github.io/GVCoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20722 2026-03-17 cs.AI 57%

Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning

缓冲区很重要:在大语言模型推理中释放离策略强化学习的潜力

Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

AI总结 本文提出BAPO框架,通过动态选择训练批次和保证策略改进下限,提升大语言模型训练效率,实验显示在数学、规划和视觉推理任务中平均提升12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13956 2026-03-17 cs.AI 57%

EviAgent: Evidence-Driven Agent for Radiology Report Generation

EviAgent:基于证据的放射学报告生成代理

Tuoshi Qi, Shenshen Bu, Yingfei Xiang, Zhiming Dai

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 EviAgent通过引入多维视觉专家和检索机制,解决放射学报告生成中的透明性与证据支持问题,实验表明其在多个数据集上优于通用和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05530 2026-03-17 cs.RO cs.CV 57%

ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation

ProFocus:面向视觉-语言导航的前瞻性感知与聚焦推理

Wei Xue, Mingcheng Li, Xuecheng Wu, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 ProFocus通过大语言模型与视觉-语言模型的协作,实现前瞻性感知和聚焦推理,提升视觉-语言导航任务的效率与准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06117 2026-03-17 cs.LG 57%

The Active Discoverer Framework: Towards Autonomous Physics Reasoning through Neuro-Symbolic LaTeX Synthesis

主动发现框架:通过神经符号LaTeX合成实现自主物理推理

Hyunjun Jeon

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 本文提出主动发现框架,通过神经符号LaTeX合成实现自主物理推理,解决神经网络在大规模计算中的精度问题,并验证其在物理常数推导中的有效性。

Comments V4 Coming S00N :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 57%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 视觉推理 :grounding(abstract);分类 cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13884 2026-03-17 cs.CV 57%

SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis

SCoCCA: 通过典型相关分析进行多模态稀疏概念分解

Ehud Gordon, Meir Yossef Levi, Guy Gilboa

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13759 2026-03-17 cs.CV 57%

QTrack: Query-Driven Reasoning for Multi-modal MOT

QTrack: 基于查询的多模态 MOT 推理

Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。

Comments Project Page: https://gaashlab.github.io/QTrack/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13412 2026-03-17 cs.CV 57%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13185 2026-03-16 cs.CV 57%

Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos

从单目视频生成时空世界场景图

Rohith Peddi, Saurabh, Shravan Shanmugam, Likhitha Pallapothula, Yu Xiang, Parag Singla, Vibhav Gogate

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。

Comments https://github.com/rohithpeddi/WorldSGG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22645 2026-03-16 cs.CV 57%

GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes

GeoZero:从零开始激励地理空间场景的推理

Di Wang, Shunyu Liu, Wentao Jiang, Fengxiang Wang, Yi Liu, Xiaolei Qin, Zhiming Luo, Chaoyang Zhou, Haonan Guo, Jing Zhang, Bo Du, Dacheng Tao, Liangpei Zhang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。

Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06119 2026-03-16 cs.CV 57%

Omni-Video: Democratizing Unified Video Understanding and Generation

Omni-Video:统一视频理解与生成的普及

Zhiyu Tan, Hao Yang, Luozheng Qin, Jia Gong, Mengping Yang, Hao Li

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Omni-Video框架,通过改进多模态大语言模型生成连续视觉线索,结合轻量架构和高效训练方案,实现视频理解、生成与编辑的统一模型。

Comments Technical report, project page: https://howellyoung-s.github.io/OmniVideo_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12166 2026-03-13 cs.CV 57%

LatentGeo: Learnable Auxiliary Constructions in Latent Space for Multimodal Geometric Reasoning

LatentGeo: 在潜在空间中学习可学习的辅助构造以进行多模态几何推理

Haiying Xu, Zihan Wang, Song Dai, Zhengxuan Zhang, Kairan Dou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nankai University(南开大学) Communication University of China(中国传媒大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 LatentGeo通过学习潜在空间中的连续视觉表示,解决多模态几何推理中辅助构造的表示问题,采用三阶段课程和强化学习方法提升几何推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13823 2026-03-13 cs.CV 57%

Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings

Embed-RL: 用于推理驱动的多模态嵌入的强化学习

Haonan Jiang, Yuji Wang, Yongjie Zhu, Xin Lu, Wenyu Qin, Meng Wang, Pengfei Wan, Yansong Tang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出基于嵌入引导强化学习的推理驱动多模态嵌入框架,通过生成证据可追溯的推理链提升多模态嵌入质量,实现跨模态语义一致性增强和细粒度匹配能力提升。

Comments Correcting errors and improving organizational logic

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11423 2026-03-13 cs.CV 57%

Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding

超越单样本:面向视频理解的可靠多样本蒸馏

Songlin Li, Xin Zhu, Zechao Guan, Peipeng Chen, Jian Yao

机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11137 2026-03-13 cs.LG cs.CL 57%

Scaling Reasoning Efficiently via Relaxed On-Policy Distillation

通过放松的在线策略蒸馏高效扩展推理能力

Jongwoo Ko, Sara Abdali, Young Jin Kim, Tianyi Chen, Pashmina Cameron

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.LG

AI总结 REOPOLD通过放松在线策略蒸馏的约束,提升模型训练效率和推理扩展能力,尤其在视觉推理任务中表现突出。

Comments Code will be available soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10294 2026-03-12 eess.SY cs.AI cs.SY 57%

Simulation-in-the-Reasoning (SiR): A Conceptual Framework for Empirically Grounded AI in Autonomous Transportation

推理中的模拟(SiR):面向自主交通系统经验导向AI的概念框架

Wuping Xin

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 SiR通过将领域模拟器嵌入LLM推理循环,为自主交通系统提供经验导向的AI框架,提升策略验证与优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏