arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 7 篇

2601.06801 2026-01-13 cs.AI cs.LG 81%

Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy

通过delta思考:通过微分视觉推理策略激励强化学习

Shujian Gao, Yuan Wang, Jiangtao Yan, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过微分视觉推理策略增强强化学习的视觉理解能力,提升多模态任务性能。

Comments 24 pages, 10 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06461 2026-01-13 cs.CR cs.CV cs.ET 78%

VIPER Strike: Defeating Visual Reasoning CAPTCHAs via Structured Vision-Language Inference

VIPER Strike: 通过结构化视觉-语言推理击败视觉推理验证码

Minfeng Qi, Dongyang He, Qin Wang, Lefeng Zhang

机构 * City University of Macau(澳门城市大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 ViPer通过结构化视觉-语言推理框架,有效解决视觉推理验证码问题,实现高达93.2%的成功率,优于现有方法,同时提出TSR策略提升防御效果。

Comments Accepted by Usenix Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05640 2026-01-13 cs.CV 67%

SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving

SGDrive: 场景到目标层次化世界认知用于自动驾驶

Jingyu Li, Junjie Wu, Dongnan Hu, Xiangkai Huang, Bin Sun, Zhihui Hao, Xianpeng Lang, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Li Auto Inc.(利汽车公司) Tongji University(同济大学) University of Surrey(Surrey大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SGDrive通过构建驾驶特定的知识层次结构,改进了视觉语言模型在自动驾驶中的轨迹规划能力,实现了在导航模拟基准上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06437 2026-01-13 cs.CL 57%

Time Travel Engine: A Shared Latent Chronological Manifold Enables Historical Navigation in Large Language Models

时间旅行引擎:共享的潜在时间流形使大型语言模型能够进行历史导航

Jingmin An, Wei Liu, Qian Wang, Fang Fang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 时间旅行引擎通过共享的潜在时间流形,使大型语言模型能够导航历史,揭示语言模型中时间进程的连续几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07143 2026-01-13 cs.HC 50%

EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent

EZBlender:基于计划与反应代理的高效3D编辑

Hao Wang, Wenhui Zhu, Shao Tang, Zhipeng Wang, Xuanzhao Dong, Xin Li, Xiwen Chen, Ashish Bastola, Xinhao Huang, Yalin Wang, Abolfazl Razi

专题命中 视觉空间推理 :planning(abstract)

AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22976 2026-01-13 cs.CV 50%

From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D

从二维空间到三维空间:教视觉语言模型感知和推理三维世界

Jiahui Zhang, Yurui Chen, Yanpeng Zhou, Yueming Xu, Ze Huang, Jilin Mei, Junhui Chen, Yu-Jie Yuan, Xinyue Cai, Guowei Huang, Xingyue Quan, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出了一种基于2D空间数据生成和标注的管道,构建了SPAR-7M数据集和SPAR-Bench基准,通过训练和微调提升视觉语言模型在三维空间感知和推理中的性能。

Comments Project page: https://logosroboticsgroup.github.io/SPAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06652 2026-01-13 cs.RO 50%

Follow the Signs: Using Textual Cues and LLMs to Guide Efficient Robot Navigation

跟随标识:利用文本线索和大语言模型引导高效的机器人导航

Jing Cao, Nishanth Kumar, Aidan Curtis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出利用大语言模型和符号模式提升机器人在稀疏环境中高效导航的能力,通过文本线索预测目标位置并优化路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏