arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-04 至 2026-02-04 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2602.02453 2026-02-04 cs.AI 83%

Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling

用漫画思考:通过结构化视觉叙事增强多模态推理

Andong Chen, Wenxin Zhu, Qiuyu Ding, Yuchen Song, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出用漫画作为中间视觉表示,通过结构化视觉叙事提升多模态推理效率和性能。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03038 2026-02-04 cs.CV cs.AI 79%

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

Bongards在感知与推理边界上的问题:程序还是语言?

Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

机构 * Cornell University(康奈尔大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种神经符号方法,利用大语言模型和贝叶斯优化解决Bongard问题,通过生成参数化程序化表示来提升视觉推理能力。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03026 2026-02-04 cs.AI cs.MA 79%

Visual Reasoning over Time Series via Multi-Agent System

通过多智能体系统进行时间序列的视觉推理

Weilin Ruan, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MAS4TS通过多智能体系统实现时间序列的视觉推理,利用分析-推理-执行范式,结合视觉语言模型和工具链,提升时间序列任务的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20272 2026-02-04 cs.CV 78%

Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning

Ground-R1: 通过强化学习激励基于地面的视觉推理

Meng Cao, Haoze Zhao, Can Zhang, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 Ground-R1 通过 Scale Relative Policy Optimization 方法,解决 LVLM 在视觉证据 grounding 方面的偏差问题,提升推理准确性和证据 grounding 能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03210 2026-02-04 cs.CV 78%

VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers

VIRAL: 通过类比在扩散变换器中实现视觉上下文推理

Zhiwen Li, Zhongjie Duan, Jinyan Ye, Cen Chen, Daoyuan Chen, Yaliang Li, Yingda Chen

机构 * School of Data Science and Engineering, East China Normal University, Shanghai, China(数据科学与工程学院,东华大学,上海,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 VIRAL通过类比和扩散变换器实现视觉上下文推理,解决视觉任务异质性问题,提升开放域编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19263 2026-02-04 cs.CV 78%

DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning

DWIM: 向工具感知的视觉推理迈进:通过差异感知的工作流生成与指令遮蔽微调

Fucai Ke, Vijay Kumar B G, Xingjian Leng, Zhixi Cai, Zaid Khan, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi, Manmohan Chandraker

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 DWIM通过差异感知的工作流生成与指令遮蔽微调,提升工具感知的视觉推理性能。

Comments ICCV 2025

Journal ref In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02559 2026-02-04 cs.AI cs.CV cs.LG cs.MA 62%

Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers

基于经验的多智能体系统是无需训练的上下文感知地球观测者

Pengyu Dai, Weihao Xuan, Junjue Wang, Hongruixuan Chen, Jian Song, Yafei Ou, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP) Hokkaido University(北海道大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GeoEvolver通过结构化交互使LLM代理无需训练即可获得地球观测专业知识,提升复杂任务的成功率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03781 2026-02-04 cs.RO 50%

A Scene Graph Backed Approach to Open Set Semantic Mapping

基于场景图的开放集合语义映射方法

Martin Günther, Felix Igelbrink, Oscar Lima, Lennart Niecksch, Marian Renz, Martin Atzmueller

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于场景图的开放集合语义映射方法,通过实时更新三维语义场景图,实现大规模环境中的稳定、可验证的映射结构,提升感知与高层推理的一致性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11442 2026-02-04 cs.CV 50%

MultiMAE for Brain MRIs: Robustness to Missing Inputs Using Multi-Modal Masked Autoencoder

MultiMAE用于脑部MRI:通过多模态掩码自编码器提高对缺失输入的鲁棒性

Ayhan Can Erdur, Christian Beischl, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(辐射肿瘤科,技术大学慕尼黑医院,慕尼黑,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(医疗与医学人工智能教研室,技术大学慕尼黑(TUM)) TUM University Hospital, Munich, Germany(技术大学慕尼黑医院,慕尼黑,德国) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(图像引导诊断与治疗人工智能教研室,技术大学慕尼黑(TUM)) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,伦敦,英国) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑合作伙伴站点,慕尼黑,德国) Institute of Radiation Medicine (IRM), Department of Radiation Sciences (DRS), Helmholtz Center Munich, Munich, Germany(辐射医学研究所(IRM),辐射科学部门(DRS),慕尼黑海德堡中心,慕尼黑,德国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 MultiMAE通过多模态掩码自编码器提升脑部MRI在缺失输入下的鲁棒性,实现分割和分类任务的性能提升。

Comments Official implementation: https://github.com/chris-beischl/multimae-for-brain-mri

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03371 2026-02-04 cs.CV 50%

Multi-Resolution Alignment for Voxel Sparsity in Camera-Based 3D Semantic Scene Completion

基于体素稀疏性的多分辨率对齐方法用于基于摄像头的3D语义场景补全

Zhiwen Yang, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出多分辨率对齐方法,通过多分辨率特征对齐和关键分布一致性损失缓解基于摄像头的3D语义场景补全中的体素稀疏性问题。

Comments 15 pages, 6 figures, accepted by TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00708 2026-02-04 cs.RO 50%

USS-Nav: Unified Spatio-Semantic Scene Graph for Lightweight UAV Zero-Shot Object Navigation

USS-Nav: 一体化空间语义场景图用于轻量级无人机零样本物体导航

Weiqi Gai, Yuman Gao, Yuan Zhou, Yufan Xie, Zhiyang Liu, Yuze Wu, Xin Zhou, Fei Gao, Zhijun Meng

机构 * School of Aeronautic Science and Engineering, Beihang University, Beijing 100191, China(北京航空航天大学航空科学与工程学院) State Key Laboratory of Industrial Control Technology, Zhejiang University, Hangzhou 310027, China(浙江大学工业控制技术状态重点实验室) Differential Robotics, Hangzhou 311121, China(杭州差分机器人)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 USS-Nav通过构建一体化空间语义场景图,实现轻量级无人机在未知环境中的高效零样本物体导航,提升计算效率和实时更新能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14943 2026-02-04 cs.HC 50%

State of the Art of LLM-Enabled Interaction with Visualization

大语言模型赋能的可视化交互现状

Mathis Brossier, Tobias Isenberg, Konrad Schönborn, Jonas Unger, Mario Romero, Johanna Björklund, Anders Ynnerman, Lonni Besançon

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文系统回顾了大语言模型与可视化交互的研究现状,分析了6个维度的48篇论文,突出了新兴设计模式和评估挑战,旨在指导未来LLM增强的可视化研究和系统设计。

Comments Submitted to STARs of EuroVis'26

详情

展开后加载摘要…

URL PDF HTML 收藏