arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 25 篇

2608.29583 2026-09-01 cs.SE 新提交 89%

Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency

驱动思考:VLA推理-轨迹一致性的运行时监测

Tian Yu, Lu Feng, Sebastian Elbaum

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(title);chain-of-thought(abstract);planning(abstract)

AI总结 本文研究VLA的CoT能否支持AV的运行时监测,构建了DriveAlignBench数据集,提出带GPT-5.5的车道相关F-LLM监测器,F1达0.75并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30650 2026-09-01 cs.AI cs.CL 新提交 81%

Geometry of Divergence: Tracking Hidden-State Trajectories for Adaptive Multi-Turn Reasoning

散度几何:追踪隐状态轨迹以实现自适应多轮推理

Jie Liang, Zhengxin Yu, Hamid Nasiri, Peter Garraghan

机构 * Lancaster University(兰卡斯特大学) University of Huddersfield(哈德斯菲尔德大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究将多轮推理建模为LLM的隐状态轨迹,提出时间曲率与方差斜率两种几何信号,分解推理动作链,提升τ-Bench任务成功率并降低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28701 2026-09-01 cs.CV 新提交 78%

TopoAgent: A Structure-Aware Perception-to-Reasoning Framework for Diagram-to-Graph Topology Extraction with Large Vision-Language Models

TopoAgent:基于大型视觉语言模型的感知到推理的结构感知框架,用于图到图拓扑提取

Bangwei Guo, Xujiang Zhao, Yanchi Liu, Wei Cheng, Shengyu Chen, Dongyue Li, Masaharu Morimoto, Takayuki Kuroda, Dimitris Metaxas, Haifeng Chen

机构 * Rutgers University(罗格斯大学) Meta NEC Labs America(美国NEC实验室) University of Electro-Communications(电气通信大学) NEC Corporation(日本电气公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究针对图到图拓扑提取任务构建了TopoBench-180基准,并提出TopoAgent框架,结合感知、结构先验与推理,在基准上性能优于现有模型,填补了多模态结构化理解的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-09-01 cs.CV 版本更新 78%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30156 2026-09-01 cs.CL 新提交 77%

Reactivating Test-Time Scaling for Plane Geometry Problem Solving

重新激活平面几何问题求解的测试时缩放能力

Xiaoqiang Kang, Shengen Wu, Maizhen Ning, Xiaobo Jin, Kaizhu Huang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) University of Liverpool(利物浦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hithink Research(海天瑞声研究院) Digital Innovation Research Center, Duke Kunshan University(昆山杜克大学数字创新研究中心)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 该研究针对平面几何问题求解中测试时缩放失效的问题,提出多轨迹合成、感知增强训练及共识引导多轨迹集成方法,提升了不同模型规模下的几何问题求解性能,且采样成本最高降低8倍。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30751 2026-09-01 cs.AI cs.CV 新提交 74%

Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models

自回归马赛克:探测仅文本语言模型的二维空间推理能力

Ashwin Nedungadi, Stefan Oehmcke, Stefan Lüdtke

机构 * Institute for Visual & Analytic Computing (VAC), University of Rostock(罗斯托克大学视觉与分析计算研究所(VAC))

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 该研究引入AM-Bench基准,发现仅文本LLMs的二维空间表现取决于模型和输出介质,无法仅用代码生成能力解释,其开放式布局表现存在显著差异。

Comments WACV 2027 Submission Pre-Print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-09-01 cs.CL cs.CV 版本更新 74%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 视觉空间推理 :reasoning(title);分类 cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

Comments 27 pages. Accepted to EMNLP 2026 (Main Conference); camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18364 2026-09-01 cs.AI cs.GR cs.MA 版本更新 70%

Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

基于LLM的Manim动画生成的训练与代理推理策略

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出ManimTrainer和ManimAgent,结合监督微调与强化学习,提升文本到代码到视频的转换性能,通过ManimBench评估17种模型,结果显示GRPO和RITL-DOC策略显著提升动画生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28678 2026-09-01 cs.CV cs.GR 新提交 67%

Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs

评估用于可缩放矢量图形生成的约束迭代优化方法(基于现成的视觉语言模型)

Matthew Perlman, James Beetham, Niels Da Vitoria Lobo, Amrit Singh Bedi, Mubarak Shah

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Central Florida(中佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract)

AI总结 本研究评估结合视觉反馈、结构化编辑与约束解码的约束迭代优化方法,探索用现成VLMs生成SVG的能力,发现约束解码提升编译成功率但VLMs存在视觉推理不足的局限。

Comments Accepted to Pacific Graphics 2026 Poster Track. 2 Pages. 2 Figures. 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2026-09-01 cs.CV cs.AI cs.CL 版本更新 62%

Error-Driven Scene Editing for 3D Grounding in Large Language Models

面向大语言模型中3D grounding的错误驱动场景编辑

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对3D大语言模型的空间grounding偏差问题,提出错误驱动框架DEER-3D,通过结构化循环生成针对性反事实训练示例,在多基准上实现4%-6%的性能增益。

Comments Accepted by ECCV 2026. Code: this https URL (https://github.com/zhangyuejoslin/Deer-3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30935 2026-09-01 cs.RO cs.AI 新提交 57%

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0:激发视觉语言模型的空间智能以实现通用具身导航

Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 LightNav-0 是激发 VLM 空间智能的通用具身导航模型,单模型支持多导航任务,在仿真基准和真实场景中均实现最优性能,具备强泛化能力。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30426 2026-09-01 cs.CL 新提交 57%

Learning to Reason and Use Tools through Unsupervised Fine-Tuning in Task-Oriented Dialog Systems

面向任务的对话系统中通过无监督微调学习推理与使用工具

Markel Ferro, Oier Lopez de Lacalle

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU HiTZ中心 - Ixa)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对任务导向对话系统的动态信息检索缺陷,提出适配ReAct框架的无监督微调方法,使LLMs可访问外部知识,其微调后的8B模型性能超越70B上下文系统,在SIMMC数据集上表现优异。

Comments Accepted to SEPLN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30396 2026-09-01 cs.AI cs.RO 新提交 57%

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

将基础模型搭建为物理世界智能体以推动长时程导航前沿

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Inc(阿里巴巴集团) Zhongguancun Academy(中关村学院) Adelaide University(阿德莱德大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NavMCP框架,结合VLM推理智能体与NFM执行器实现长时程导航,在多个具身问答基准及Unitree Go2机器人上取得优于基线的性能,验证了该方法的有效性。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30307 2026-09-01 cs.CV cs.AI 新提交 57%

ScenePilot: Grow-and-Repair Policy for Text-Driven 3D Indoor Scene Generation

ScenePilot:面向文本驱动的3D室内场景生成的生长-修复策略

Jiawei Zhang, Hongsong Wang, Pan Zhou

机构 * Southeast University(东南大学) Singapore Management University(新加坡管理大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 ScenePilot是一种检索增强的生长-修复框架,通过HRAP模块检索布局先验、RMR模块进行轻量修复,实现了高效的文本驱动3D室内场景生成,提升了物理合理性等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29114 2026-09-01 cs.RO cs.AI 新提交 57%

CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation

CGFM-Nav:用于语义引导的终身多模态具身导航的认知图场记忆

Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对视觉与语言导航中环境表征的不足,提出CGFM及基于其的CGFM-Nav框架,在GOAT-Bench实验中提升了导航的成功率与SPL,验证了方法的有效性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28707 2026-09-01 cs.CL cs.CV 新提交 57%

ReVA: A Region-Aware Visual Assistant for Visually Grounded Question Answering

ReVA:面向视觉接地问答的区域感知视觉助手

Anoop Senthil

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对多模态大语言模型视觉问答中存在的物体幻觉问题,提出区域感知模型ReVA,通过双桥接结构融合整图与区域特征,在POPE数据集上将平均F1提升至82.85%,有效改善了视觉接地效果。

Comments 11 pages. Code: this https URL (https://github.com/anoop675/reva)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23491 2026-09-01 cs.CV cs.CL 版本更新 57%

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation

PlanCraft:用于受建筑师启发的渐进式3D住宅场景生成的草图绘制、细化和布置

Pengyu Zeng, Yuqin Dai, Jun Yin, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Shuai Lu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对自动住宅平面图生成中忽视的设计渐进性及二维平面图重要性问题,提出PlanCraft,通过SketchPlan提供训练信号,PlanCraft-Diff细化草图,PlanCraft-Agent布置场景,实验显示其在FID及空间合理性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-09-01 cs.CV cs.AI 版本更新 57%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

Comments Accepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16690 2026-09-01 cs.CL cs.CV 版本更新 57%

EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

EMemBench: 交互式评估VLM代理情景记忆的基准测试

Xinze Li, Ziyue Zhu, Siyuan Liu, Yubo Ma, Yuhang Zang, Yixin Cao, Aixin Sun

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 EMemBench通过交互式游戏评估VLM代理的情景记忆,发现归纳和空间推理在视觉设置中仍是瓶颈,且持续记忆对文本游戏有明显提升,但对VLM代理的提升不一致。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31005 2026-09-01 cs.CV 新提交 50%

From Intent to Evidence: Policy-Steered Multi-Strategy Retrieval for Long-Video Agents

从意图到证据:面向长视频智能体的策略引导多策略检索

Can Zhang, Baofeng Zhang, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Ruirui Li

机构 * Beijing University of Chemical Technology(北京化工大学) Baidu, Inc.(百度公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对长视频智能体现有统一证据获取方式的缺陷,提出无需训练的VESTA智能体,通过策略引导多策略检索等机制,在多个长视频基准上取得了显著性能提升。

Comments 15 pages, 5 figures, 6 tables (main paper with appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29733 2026-09-01 cs.CV 新提交 50%

XDG: Accelerated Visual Disambiguation

XDG:加速视觉消歧

Gonglin Chen, Ben Southall, Hanyuan Xiao, Wenbin Teng, Haolin Xiong, Tianwen Fu, Junyi Ouyang, Kshitij Singh Minhas, Supun Samarasekera, Rakesh Kumar, Yajie Zhao

机构 * USC Institute for Creative Technologies(南加州大学创意技术研究所) University of Southern California(南加州大学) SRI International(SRI国际公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 XDG是适配可扩展SfM的高效视觉消歧模型,通过微调Depth Anything 3并复用其相机令牌实现配对分类,在保持精度的同时将推理速度提升超3倍,大幅缩短大规模场景消歧耗时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28784 2026-09-01 cs.CV 新提交 50%

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28699 2026-09-01 cs.CV 新提交 50%

Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG

超越视觉边界:为电影检索增强生成(RAG)重新思考场景分割

Dong-Hee Kim, Seonwoo Choi, Changbeen Kim, Jungmyung Wi, Juyeon Ko, Youngju Choi, Il Hyeon Mun, Hyunwoo J. Kim, Donghyun Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文针对电影RAG场景,发现现有场景分割方法不如均匀时间分块,提出以叙事为核心的NarraScene数据集,其生成的片段作为检索单元可提升下游电影理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28697 2026-09-01 cs.RO 新提交 50%

Multi-Group Pipe Routing under Permanent Geometric Occupancy: Problem, Benchmark, and Classical Baselines

永久几何占用下的多组管道路由:问题、基准及经典基线

Deng Quan

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对增材制造中多组流道永久占用体积的路由问题,提出带几何双见证冲突的形式化方法、可控难度的3D基准及CBS等经典基线,验证了CBS性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26509 2026-09-01 cs.CV 版本更新 50%

Conditional Diffusion for 3D CT Volume Reconstruction from 2D X-rays

基于条件扩散的3DCT体积重建从2DX光

Martin Rath, Morteza Ghahremani, Yitong Li, Ashkan Taghipour, Marcus Makowski, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Western Australia (UWA)(西澳大利亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出AXON框架,通过多阶段扩散模型直接从真实X光重建高保真3DCT体积,采用粗到细策略和ControlNet优化,支持双平面X光输入并提升诊断分辨率。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏