arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2606.02951 2026-06-03 cs.RO cs.AI cs.CL cs.CV cs.HC 73%

SCOPE: Real-Time Natural Language Camera Agent at the Edge

SCOPE:边缘实时自然语言相机代理

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra

机构 * Armada AI

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出SCOPE模块化代理,用于自然语言控制的PTZ相机,在边缘部署实现实时感知、规划与控制,并通过仿真和物理实验评估延迟、准确性和错误模式。

Comments 9 pages, 4 figures, 6 tables. Accepted at HRI '26 (21st ACM/IEEE International Conference on Human-Robot Interaction), Edinburgh, Scotland, March 16--19, 2026. Code: https://github.com/HindsboNikolaj/SCOPE

Journal ref Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00931 2026-06-02 cs.CV cs.AI 73%

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好

Fangzhou Lin, Peiran Li, Lingyu Xu, Wenjing Chen, Qianwen Ge, Shuo Xing, Mingyang Wu, Xiangbo Gao, Siyuan Yang, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhen Dong, Ming-Hsuan Yang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达) UCSB(加州大学圣塔芭芭拉分校) UC Merced(加州大学默塞德分校)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。

Comments 26 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26779 2026-06-02 cs.CV cs.AI 73%

Limits of Spatial Imagery Reasoning in Frontier LLM Models

前沿大语言模型在空间意象推理中的局限性

Sergio Y. Hayashi, Nina S. T. Hirata

机构 * Institute of Mathematics and Statistics – University of São Paulo(数学统计研究所 – 圣保罗大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究通过引入外部“意象模块”辅助3D模型旋转任务,发现即使外包整体3D状态维护,前沿模型仍缺乏基础视觉空间原语,导致准确率最高仅62.5%。

Comments 25 pages. v2: Title updated; added a section on object/spatial imagery and propositional reasoning; added new experimental results for the single-object rotation probe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13602 2026-06-02 cs.CV cs.LG 73%

Towards Sparse Video Understanding and Reasoning

迈向稀疏视频理解与推理

Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Dolby Laboratories(杜比实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 提出一种多轮视频问答代理,通过稀疏帧选择、状态摘要和早期停止机制,在减少帧数和令牌数的同时提升准确率。

Comments Accepted to CVPR 2026. Project page: https://sparsevideounderstanding.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30557 2026-06-01 cs.CV cs.AI cs.CL 73%

Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?

看见不等于知道:视觉语言模型是否知道何时不回答空间问题(以及为什么)?

Yue Zhang, Zun Wang, Han Lin, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Google Research(谷歌研究)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型在空间推理中过度自信回答的问题,提出SpatialUncertain框架,通过遮挡和视角歧义两种挑战,评估模型是否知道何时应弃权以及如何寻找可靠证据。

Comments Website: https://zhangyuejoslin.github.io/spatialuncertain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30318 2026-05-29 cs.GR cs.AI cs.CV 73%

Before the Shutter: Aesthetic and Actionable Portrait Photography Planning in 3D Scenes

快门之前:3D场景中美学的且可执行的人像摄影规划

Ruixiang Jiang, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出在3D场景中生成人像姿态、相机、照明和曝光方案的方法,通过构建摄影场景图实现美学引导的规划,生成视觉上引人注目且几何与光度可行的人像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27959 2026-05-29 cs.CV cs.AI 73%

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning

ROVER: 面向对象中心视觉证据的路由用于基于多图像推理

Guannan Lv, Ren Nie, Hongjian Dou, Tingting Gao

机构 * Kuaishou Technology(快手科技)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出ROVER,一种轻量级可学习插件,通过对象中心差分注意力聚合上下文、蒸馏图像内线索并路由历史感知证据,实现高效全局视觉证据路由,在多图像推理中提升答案和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08146 2026-05-27 cs.CV cs.AI 73%

VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning

VT-Bench:视觉-表格多模态学习的统一基准

Zi-Yi Jia, Zi-Jian Cheng, Xin-Yue Zhang, Kun-Yang Yu, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出首个视觉-表格多模态基准VT-Bench,涵盖9个领域14个数据集,评估23个模型,揭示视觉-表格学习的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18603 2026-05-27 cs.AI cs.CV 73%

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB:通过视觉链式框推理增强文档理解

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04981 2026-05-26 cs.CV cs.LG 73%

Compositional Semantics for Open Vocabulary Spatio-semantic Representations

开放词汇时空语义表示的组合语义

Robin Karlsson, Francisco Lepe-Salazar, Kazuya Takeda

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科) Ludolab TIER IV

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 提出潜在组合语义嵌入z*作为可查询时空语义记忆的知识表示,证明其存在性、最优性及可发现性,并引入充分相似性推理方法提升重叠语义推理性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23116 2026-05-25 cs.CV cs.AI 73%

CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection

CoReVAD: 一种无需训练的视频异常检测上下文推理框架

Hyeongmuk Lim, Youngbum Hur

机构 * Department of Industrial Engineering, Inha University, Incheon, Republic of Korea(韩国釜山大学工业工程系)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 提出CoReVAD框架,利用单一冻结视觉语言模型直接生成异常分数和时间描述,通过局部响应清洗和全局时序上下文精炼实现无需训练的视频异常检测,在UCF-Crime和XD-Violence数据集上取得竞争性能并提供可解释解释。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09349 2026-05-25 cs.CV cs.AI cs.CL 73%

Visually-Guided Policy Optimization for Multimodal Reasoning

视觉引导的多模态推理策略优化

Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) SYSU(南方科技大学) BUPT(北京邮电大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型在推理中视觉关注不足和时序遗忘问题,提出视觉引导策略优化(VGPO)框架,通过视觉注意力补偿机制和双粒度优势重加权策略增强视觉聚焦,提升多模态推理性能。

Comments Accepted to ACL 2026, https://github.com/wzb-bupt/VGPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17171 2026-05-25 cs.CV cs.LG 73%

FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle

FireScope: 基于思维链预言机的野火风险栅格预测

Mario Markov, Stefan Maria Ailuro, Luc Van Gool, Konrad Schindler, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出FireScope框架,利用视觉语言模型结合强化学习和视觉监督,通过推理轨迹生成野火风险栅格,在跨大陆泛化中取得显著性能提升。

Comments CVPR 2026, Project Page: https://firescope.ai/research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22109 2026-05-22 cs.AI cs.CV cs.CY 73%

Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?

感知还是偏见:大语言模型能否超越个性的第一印象?

Caixin Kang, Tianyu Yan, Sitong Gong, Mingfang Zhang, Liangyang Ouyang, Ruicong Liu, Bo Zheng, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI 研究所东京) Dalian University of Technology(大连理工大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了多模态大语言模型(MLLMs)在感知个性方面的能力,提出了一种新的任务Grounded Personality Reasoning(GPR),并构建了一个新的数据集MM-OCEAN,通过三重评估体系揭示了MLLMs在人格推理中的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20784 2026-05-21 cs.AI cs.LG 73%

Interaction Locality in Hierarchical Recursive Reasoning

层次递归推理中的交互局部性

Yosuke Miyanishi, Tetsuro Morimura

机构 * CyberAgent Inc.(CyberAgent公司)

专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出交互局部性框架,用于测量信息流是否在附近单元或语义段内传输或跨越,通过在HRM和TRM等层次递归推理模型上应用,验证了局部执行与全局规划的可重复测量框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18194 2026-05-19 cs.AI cs.CV 73%

Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks

超越笛卡尔错觉:在感知瓶颈下测试双阶段多模态理论 of Mind

Yajing Zhou, Xiangyu Kong

机构 * College of Computer Science, Beijing Information Science and Technology University(北京信息科技大学计算机学院)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在感知瓶颈下的双阶段空间推理能力,提出了一种基于锚点的具身体验空间分解链式推理方法,以解决空间对称性和视角模糊性问题,从而提升多模态理论 of Mind 的表现。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16481 2026-05-19 cs.CV cs.AI 73%

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解

Aiden Yiliu Li, Nels Numan, Anthony Steed

机构 * University College London(伦敦大学学院)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16416 2026-05-19 cs.CV cs.AI 73%

CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

CAVE:一种用于碎片化视觉证据推理的结构化信用分配方法

Tengda Guo, Jie Leng, Hanlei Li, Yaoyuan Liang, Qingyue Zhang, Dian Yang, Mingyu Zhang, Yuhua Fu, Shao-Lun Huang

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 CAVE通过结构化过程-奖励机制提升碎片化视觉推理能力,引入三个互补信号优化推理步骤,提升模型可靠性与鲁棒性。

Comments 24 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14068 2026-05-19 cs.CV cs.LG 73%

CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves

CurveBench:一种用于嵌套乔丹曲线精确拓扑推理的基准

Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian, Naser Talebizadeh Sardari

机构 * Maastricht University(马斯特里赫特大学) Cornell University(康奈尔大学) TU Wien(维也纳技术大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 CurveBench是一个用于从视觉输入中进行层次拓扑推理的基准,包含756张非相交的乔丹曲线图像,通过结构预测任务恢复由曲线诱导的根树结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI 73%

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14704 2026-05-15 cs.CV cs.AI cs.RO 73%

SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

SceneFunRI:为任务驱动的功能物体定位推理不可见区域

Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Delta Robotics Innovation Center(Delta机器人创新中心)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SceneFunRI通过半自动化流程构建了855个实例的基准,要求模型根据任务指令和常识推理推断不可见功能物体的位置,现有模型在推理稳定性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12586 2026-05-14 cs.CV cs.AI cs.DB 73%

3D Primitives are a Spatial Language for VLMs

3D基元是一种视觉语言模型的空间语言

Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

机构 * Unity Technologies

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过3D基元作为中间表示来提升视觉语言模型的空间理解能力,通过SpatialBabel基准、Code-CoT推理策略和S³-FT自监督微调三种贡献,展示了基元在空间任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11462 2026-05-13 cs.CV cs.AI 73%

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

SpatialForge: 从开放世界2D图像中提升3D感知空间推理

Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu

机构 * Lingnan University(岭南大学) XPENG Robotics(小鹏机器人)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialForge,通过大规模合成数据提升空间推理能力,构建了包含1000万对空间问答的大型数据集,验证了2D数据扩展对3D空间推理的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09900 2026-05-12 cs.AI cs.CL cs.CV 73%

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

为视觉语言模型解开 Gordian 结:图式结理作为一项难题基准

Hao Liu, Jicheng Liu

机构 * Department of Psychology(心理学系) New York University(纽约大学) Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 KnotBench 基准,通过 858,318 张图像与 Regina 签名验证,评估 VLMs 在结图识别、预测和跨模态接地任务中的能力,发现模型在结操作模拟上存在显著不足。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15879 2026-05-12 cs.CV cs.AI cs.CL 73%

GRIT: Teaching MLLMs to Think with Images

GRIT: 教授大语言模型通过图像思考

Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) UC Santa Barbara(加州大学圣芭芭拉分校) eBay

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 GRIT提出一种基于图像和文本的 grounded reasoning 方法,通过强化学习实现高效训练,使大语言模型生成视觉基础的推理链。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11509 2026-05-08 cs.CL cs.AI cs.CV 73%

Multimodal Fact-Level Attribution for Verifiable Reasoning

多模态事实级归因用于可验证推理

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MuRGAt基准,用于评估多模态事实归因能力,要求模型在复杂推理中生成明确推理和精确引用,揭示强模型在正确推理下仍易产生幻觉,且增加推理深度或结构化归因会降低准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/meetdavidwan/murgat

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10941 2026-05-01 cs.CV cs.AI 73%

Mull-Tokens: Modality-Agnostic Latent Thinking

Mull-Tokens: 通用模态的潜在思考

Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

机构 * Google(谷歌) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mull-Tokens,一种无需模态切换的潜在令牌,用于空间、时间等多模态推理,通过预训练和微调在四个挑战性基准上实现3%-16%的提升。

Comments Project webpage: https://arijitray.com/multimodal_thinking/, Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27472 2026-05-01 cs.AI cs.LG cs.RO 73%

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

PRTS:通过对比表示实现的原始推理与任务系统

Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 PRTS通过目标引导强化学习重构预训练过程,学习统一嵌入空间以评估物理可行性,提升机器人任务执行与长期规划能力。

Comments 38 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26288 2026-05-01 cs.CV cs.AI 73%

CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读

Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz

机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) Department of Radiology(放射科) Department of Pediatrics(儿科) Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Biomedical Data Science(生物医学数据科学部)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。

Comments 51 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 73%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏