arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 450 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 450 篇

2607.09068 2026-07-13 cs.CV cs.AI 新提交 73%

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

OmniMapBench:对多样化地图文档进行以视觉为中心的推理基准测试

Yang Chen, Yunwen Li, Yufan Shen, Minghao Liu, Tianyu Zheng, Bin Fu, Qunshu Lin, Zhi Yu, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对LVLMs文档理解中视觉推理基准测试不足的问题,提出OmniMapBench,含2096个问答对,设计了视觉依赖指数(VDI)量化基准属性,评估25个LVLMs发现性能差距大,推动了以视觉为中心的推理进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04147 2026-07-07 cs.CV cs.AI 新提交 73%

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

HCSU:用于细粒度历史书法风格理解的数据集和基准测试

Yinsheng Yao, Yan Liu, Chen Ye

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。

Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02927 2026-07-07 cs.CV cs.AI 新提交 73%

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

VideoSearcher:通过强化学习利用多工具智能推理助力视频深度研究

Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

机构 * Stephengzk

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对视频理解局限,提出VideoSearcher框架,统一多任务于单推理轨迹,用强化学习算法BiSPO优化推理轨迹,构建新基准,实验表明其在多基准中显著优于开源基线。

Comments Technical report. Project page: https://stephen-gzk.github.io/VideoSearcher-website/ ; Code: https://github.com/Stephen-gzk/VideoSearcher ; Model & Data on HuggingFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31672 2026-07-07 cs.CV cs.AI 新提交 73%

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

WorldRoamBench:交互式世界模型长时稳定性的开放世界基准

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, Baoquan Chen

机构 * AMAP CV Lab, Alibaba Group(阿里巴巴集团AMAP CV实验室) Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出WorldRoamBench基准,从动作、视觉、物理和记忆四维度评估交互式世界模型的长时稳定性,包含600+测试用例,揭示现有模型在所有维度均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31599 2026-07-01 cs.CV cs.AI 新提交 73%

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

通过双流强化学习实现令牌稀疏的医学多模态推理

Kaitao Chen, Weiqian Zhao, Jiamin Wu, Qihao Zheng, Shangquan Sun, Chunfeng Song, Xiaosong Wang, Mu Zhou, Mianxin Liu

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出双流强化学习框架ViToS,通过主动视觉令牌剪枝实现令牌稀疏的医学多模态推理,在七个医学基准上减少77%令牌并提升性能。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22565 2026-06-23 cs.CL cs.AI cs.CV 新提交 73%

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

轻看,重思:多模态思维链推理能做什么和不能做什么

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文系统探究多模态思维链推理在12个感知与推理任务上的表现,发现CoT对感知任务有副作用,但对数学、科学等多图像推理有效,且现有开源多模态推理模型提升有限,视觉推理仍是瓶颈。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14766 2026-06-16 cs.CV cs.AI cs.MA 新提交 73%

XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems

XMedFusion:面向自主医疗系统的知识引导多模态感知与推理框架

Hamza Riaz, Arham Haroon, Maha Baig, Muhammad Dawood Rizwan, Muhammad Naseer Bajwa, Muhammad Moazam Fraz

机构 * National University of Sciences and Technology (NUST)(巴基斯坦国立科技大学) University of Oxford(牛津大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出XMedFusion模块化AI框架,通过视觉感知、知识图谱构建和检索引导生成等智能体协同,增强放射学报告生成的视觉基础与临床发现捕捉能力,在公共数据集上显著优于基线模型。

Comments Accepted at the 2026 International Conference on Robotics and Automation in Industry (ICRAI)

Journal ref 2026 International Conference on Robotics and Automation in Industry (ICRAI), pp. 1-6, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12047 2026-06-11 cs.CV cs.AI stat.ML 新提交 73%

Metadata-Aware Multi-Prompt Reasoning for Zero-Shot Accident Understanding

元数据感知的多提示推理用于零样本事故理解

Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran

机构 * Netradyne

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出三阶段流水线,通过视觉-语言相似性、元数据驱动的多提示推理和开放词汇检测,实现零样本事故视频的时序定位、语义分类和空间定位,显著提升性能。

Comments Accepted at the AUTOPILOT Workshop, CVPR 2026 (non-archival). Workshop Paper ID 15

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10267 2026-06-10 cs.RO cs.AI cs.LG 新提交 73%

What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents

机器人策略编排的关键因素:分层VLA智能体的系统研究

Jiaheng Hu, Mohit Shridhar, Caden Lu, Dhruv Shah, Hao-Tien Lewis Chiang, Jie Tan, Annie Xie

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 系统研究分层视觉-语言-动作(Hi-VLA)系统的设计原则,通过统一框架分析规划器、控制器及接口机制对短时、长时及推理密集型任务性能的影响,提出构建更强健分层VLA智能体的实用原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03187 2026-08-05 cs.NE 新提交 71%

NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 视觉推理 :multimodal large language model(title)

AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24471 2026-07-28 cs.CL 新提交 71%

Grounding latent algorithm routing in transformer reasoning

在变压器推理中为潜在算法路由建立基础

Xiangbo Zhang, Xiaoxu Ma

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :grounding(title)

AI总结 研究变压器能否围绕不同归纳偏差族组织情节级适应,通过潜在算法路由及ROUTEBENCH基准实验,发现从零训练的密集仅解码器变压器能开发类似路由的内部变量,缩小最优路由差距,但未建立通用路由。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18504 2026-08-20 cs.AI 新提交 70%

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

UMER:通过感知对的判别推理统一嵌入与排序以实现通用多模态检索

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对通用多模态检索的需求,提出UMER框架,通过感知对的判别推理联合学习对比式嵌入与判别式排序,在MMEB-V2基准上实现最优性能且支持可调整预算的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18111 2026-08-20 cs.AI 新提交 70%

Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry

求解不等于绘图:奥林匹克几何图解推理基准

Hsien Xin Peng, Anthony Kim, Alvin Li, Calvin Supasanya, Shivank Garg, Kevin Zhu

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对基础模型图解推理能力评估缺口,构建含954道奥林匹克几何题的基准,发现模型求解与绘图能力存在显著差距,绘图平均编译成功率仅36.14%。

Comments ICML 2026, AI4MATH Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17414 2026-08-19 cs.CV cs.PL 新提交 70%

REChart: Reasoning-Efficient Chart Editing with Large Reasoning Models

REChart:基于大型推理模型的推理高效图表编辑方法

Yuanbang Liu, Chenxi Ruan, Yihan Hou, Qiong Luo, Wei Zeng

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 REChart是两阶段训练框架,通过过程级监督提升图表编辑的保真度与推理效率,在两个基准上实现同规模开源模型最优性能,推理token用量降低79.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12282 2026-08-13 cs.AI 新提交 70%

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

VAKRA:评估工具使用策略下跨API与检索的多跳推理能力

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

机构 * IBM(国际商业机器公司(IBM))

专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10908 2026-08-12 cs.CV cs.CL 新提交 70%

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

顺序很重要:LVLMs作为图像序列时间推理的评判者

Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes

机构 * University of Bologna(博洛尼亚大学) NOVA School of Science and Technology(NOVA科技学院) NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。

Comments 34 pages, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09435 2026-08-11 cs.AI 新提交 70%

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

听、看与跟踪:面向全模态大模型的时空视听声音事件推理

Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08935 2026-08-11 cs.AI 新提交 70%

Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis

用于检索增强推理、物体感知与损伤分析的集成多模态AI系统

Kalelo Dukuray, Israel Pina, Evan Perez, Erika Ardiles-Cruz, Jie Wei

机构 * City College of New York(纽约城市学院) Air Force Research Lab(空军研究实验室)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本研究提出整合RAG、热谱感知等技术的多模态AI系统,用于损伤评估,通过多模块对比实验验证了其在提升推理准确性、鲁棒性及跨场景检测方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28640 2026-08-03 cs.CL cs.CV 新提交 70%

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs

TokenSwap:多模态大语言模型中模态差距的基准测试与缩减

Andong Hua, Colton Bishop, Igor Mordatch, Arian Hosseini, Jindong Gu, Aleksandra Faust, Rebecca Roelofs, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出TokenSwap方法构建基准TokenSwap-Bench,发现42个多模态大语言模型普遍存在模态差距,推理模型差距更小,训练中引入TokenSwap可有效缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26910 2026-07-30 cs.CV 新提交 70%

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Dresden Research Center(华为德累斯顿研究中心)

专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。

Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24904 2026-07-29 cs.CV cs.CL 新提交 70%

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

机构 * Microsoft(微软)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。

Comments Project page: https://microsoft.github.io/Mage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交 70%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交 70%

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20197 2026-07-23 cs.CV 新提交 70%

RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing

RS-RIE-Bench:推理引导的遥感图像编辑基准测试

Zihan Qin, Boao Xu, Zhao Dong, Yingping Sun, Ziheng Jiao, Junying Wang, Hongwei Wang

机构 * Huawei(华为)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16401 2026-07-21 cs.CV 新提交 70%

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04057 2026-07-07 cs.CV cs.RO 新提交 70%

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes

PreSIST:开放世界场景中视觉-语言信息的对象持久性预测

Amanda Adkins, Tarunvidyut Ravisankar, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) National Science Foundation(美国国家科学基金会) ARO(美国陆军研究办公室) Amazon(亚马逊公司) JP Morgan(摩根大通公司)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 研究长期部署机器人对环境变化的推理,提出PreSIST方法,通过对象属性和场景上下文估计实例级持久性先验,结合概率持久性过滤器预测对象未来姿态,有两种变体,实验表明优于基线。

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03748 2026-07-07 cs.AI 新提交 70%

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

将交错多模态推理作为统一决策过程进行衔接

Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02907 2026-07-07 cs.CV cs.CL 新提交 70%

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维

Peiming Li, Yifan Wang, Xiaotian Zhang, Zhiyuan Hu, Shiyu Li, Zheng Wei, Yang Tang

机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01784 2026-07-03 cs.CV 新提交 70%

SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video

SpaceEra++: 面向视频中3D空间推理的统一框架

Weili Guan, Haoyu Zhang, Meng Liu, Qianlong Xiang, Yaowei Wang, Liqiang Nie

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Pengcheng Laboratory(鹏城实验室) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) City University of Hong Kong(香港城市大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出SpaceEra++框架,通过ScenePick帧采样策略缓解输入不足,并利用SpaceAlign对齐绝对坐标与相对空间关系增强推理,在多个基准上超越强基线。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25701 2026-06-25 cs.CV 新提交 70%

Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

Falcon: X射线中组合推理的功能组装与语言

Yonathan Michael, Mohamad Alansari, Natnael Takele, Andreas Henschel, Naoufel Werghi

机构 * Khalifa University(哈利法大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对X射线安检中威胁来自分散组件功能兼容性的问题,提出Falcon框架,通过结构化安全状态表示实现组合威胁推理,并构建Falcon-X基准验证其有效性。

Comments Accepted at ECCV2026; Project Page: https://yonathan-kiflom.github.io/FALCON/page/

详情

展开后加载摘要…

URL PDF HTML 收藏