arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-17 至 2026-08-17 共收录 84 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2608.14277 2026-08-17 cs.CL cs.AI 新提交 81%

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

SimpleOPD:适用于长上下文推理的、简单的与分词器无关的在线策略蒸馏

Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Shengji Tang, Zhilin Wang, Runzhe Zhan, Lei Bai, Ganqu Cui, Fangchen Yu, Yafu Li, Peng Ye, Ning Ding, Yu Cheng

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出SimpleOPD方法,通过共享文本空间对齐令牌、引入学生参考KL损失并屏蔽特殊终止令牌优势,将长上下文模型SU-01的推理能力迁移至多类学生模型,在数学及科学基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01014 2026-08-17 cs.CL cs.AI 版本更新 81%

Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

Cloud-ScPO:面向大语言模型推理的半监督偏好优化的隐状态几何

Yuzhou Liu, Xiyang Hu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Cloud-ScPO框架,利用少量标注集构建参考云,结合拓扑引导的偏好挖掘与自一致性,在GSM8K等数据集上较ScPO提升LLM数学推理性能。

Comments 14 pages, 2 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12348 2026-08-17 cs.DB cs.AI 版本更新 77%

Can Large Language Models Reason about Event-Time Stream-Processing Semantics?

StreamReason-Bench:大型语言模型能否推理事件时间流处理语义?

Zhuoxi Wang, Shibo Zheng, Haoyu Zhang

专题命中 数学推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究构建了StreamReason-Bench基准测试,发现LLM在事件时间流处理语义推理任务上表现不佳,思维链可提升其性能,难点在于事件时间与延迟数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13607 2026-08-17 cs.AI cs.CL cs.LG 新提交 75%

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

没有通用信号可预测版本更新下的样本级大语言模型退化

Jia Sheng, Yiwei Lu

机构 * University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何用推理时信号预测LLM版本更新导致的样本级退化,对比单模型与跨版本信号,发现信号有效性具任务依赖性且无通用最优信号,部分跨版本信号可支持选择性回退,从业者可据此选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14407 2026-08-17 cs.AI 新提交 57%

The Past and Future of AI Scientists

AI科学家的过去与未来

Ross D. King

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文综述AI科学家的过去与未来,指出其核心挑战是多技术集成,现有技术已支持构建更通用系统,其有望变革科学,诺贝尔图灵挑战目标进展超前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14212 2026-08-17 cs.AI 新提交 57%

APTER: Adaptive Post-Training with Expert-Grounded Rubrics

APTER:基于专家准则的自适应后训练

Xukai Wang, Liangqi Li, Zhiyue Xu, Jingang Zhou, Xiaoyu Shi, Jiansheng Cai, Bo Zhang, Zhe Li, Xu-Yao Zhang

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字科技)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 APTER是将结构化领域知识融入专业复杂推理评估、优化与诊断的框架,通过专家准则生成查询级准则并用于自适应后训练,在数学、医学领域三代模型上均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2604.01413 2026-08-17 cs.CL cs.AI 版本更新 81%

Adaptive Stopping for Multi-Turn LLM Reasoning

多轮LLM推理中的自适应停止

Xiaofan Zhou, Huy Nguyen, Bo Yu, Chenxi Liu, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Augustana College(奥古斯塔纳学院) University of Utah(犹他大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MiCP框架,通过分配不同误差预算实现多轮推理中的自适应停止,同时保证覆盖率,减少轮次、推理成本和预测集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13567 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

Modular Cognitive Architecture Emerges in Large Language Models

大型语言模型中出现的模块化认知架构

Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究探究大型语言模型是否会出现类似人类大脑的模块化认知架构,经对4个认知领域46项任务的回路分析,发现其会形成相似模块化架构,表明模块化可能是智能系统的基本属性。

Comments https://pengrui-han.github.io/LLM_Modularity_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21339 2026-08-17 cs.SE cs.PL 版本更新 50%

KBSpec: LLM-driven Formal Specification Generation with Evolving Domain Knowledge Base

KBSpec:基于演化领域知识库的LLM驱动形式化规约生成

Wenhan Wang, Zeyu Sun

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出KBSpec方法,利用外部官方文档和内部验证器反馈的双源知识增强LLM,通过自演化知识库持续更新成功轨迹,无需调参或标注数据,在JML规约生成上验证通过率提升10-25%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2606.16316 2026-08-17 cs.IR cs.AI cs.LG 版本更新 81%

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Yuchen Zhuang, Wenqi Shi, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14375 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

错误但有用:多智能体消息中超越答案正确性的轨迹价值

Chih-Hsuan Yang, Anjir Ahmed Chowdhury, Cheng-Hau Yang, Weijian Zheng, Fernando Llorente, Xiaolong Ma, Xinyang Li, Eliu A. Huerta, Ian T. Foster, Rajeev Thakur

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出DHD协议,发现多智能体错误消息含有用信息,错误但有帮助的消息普遍存在,其轨迹价值可辅助决策,答案正确性不决定轨迹价值。

Comments 24 pages, 9 figures. Includes an appendix and an ancillary reproducibility artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15808 2026-08-17 q-bio.QM cs.AI cs.CV cs.LG 62%

Foundation Models in Biomedical Imaging: Turning Hype into Reality

生物医学影像中的基础模型:从 hype 到现实

Amgad Muneer, Kai Zhang, Ibraheem Hamdi, Rizwan Qureshi, Muhammad Waqas, Shereen Fouad, Hazrat Ali, Syed Muhammad Anwar, Jia Wu

机构 * Department of Imaging Physics, The University of Texas MD Anderson Cancer Center(影像物理系,德克萨斯大学MD安德森癌症中心) Center for Secure Artificial Intelligence for Healthcare (SAFE), McWilliams School of Biomedical Informatics, UTHealth Houston(安全人工智能用于医疗保健中心(SAFE),麦威廉斯生物医学信息学学院,UTHealth休斯顿) Female Medicine in Machine Learning, Massachusetts Institute of Technology(机器学习中的女性医学,麻省理工学院) Department of Computer Science, Salim Habib University(计算机科学系,Salim Habib大学) School of Computer Science and Digital Technologies, Aston Centre for Artificial Intelligence Research and Application, Aston University(计算机科学与数字技术学院,阿斯顿人工智能研究与应用中心,阿斯顿大学) Division of Computing Science and Mathematics, University of Stirling(计算科学与数学系,斯特灵大学) School of Medicine and Health Sciences, George Washington University(医学与健康科学学院,乔治·华盛顿大学) Sheikh Zayed Institute for Pediatric Surgical Innovation, Children’s National Hospital(谢赫扎耶德儿童外科创新研究所,儿童医院) Department of Thoracic/Head and Neck Medical Oncology, The University of Texas MD Anderson Cancer Center(胸腔/头颈医学肿瘤科,德克萨斯大学MD安德森癌症中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了基础模型在生物医学影像中的应用,提出REAL-FM框架以评估模型的实际临床价值,指出基础模型在因果推理和安全性方面存在不足,强调需要协调的专业AI系统。

Comments 9 figures and 3 tables

Journal ref Nature Biomedical Engineering 10, 1557-1575 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13958 2026-08-17 cs.AI cs.CY cs.LO 新提交 57%

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

用Wolfram语言实现计算法以用于人工智能治理

James K. Wiles

机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。

Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at https://github.com/Zaffer/research-computational-law

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 11 篇

2608.13612 2026-08-17 cs.AI cs.SE 新提交 79%

SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data

SemPlan:面向企业数据的基于大语言模型(LLM)查询的结构化语义规划基准测试

Bruno Santos Teixeira

机构 * Universidade Federal de Ouro Preto (UFOP)(欧鲁普雷图联邦大学(UFOP))

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究构建了SemPlan基准测试,对比四种架构在企业数据LLM查询语义规划中的表现,发现结构化语义规划架构(A3)正确率最高,不同架构在正确率、策略合规性、成本等方面存在权衡。

Comments 11 pages, 3 figures, 9 tables. Submitted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14466 2026-08-17 cs.RO cs.IT cs.LG math.IT 新提交 79%

Expected Free Energy-based Informative Path Planning for Robotic Mars Exploration

基于期望自由能的火星探测机器人信息路径规划

Ajith Anil Meera, Pablo Lanillos, Wouter Kouw

机构 * TU Eindhoven(埃因霍温理工大学) Cajal Centre for Neuroscience, Spanish National Research Council(西班牙国家研究委员会卡哈尔神经科学中心)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出将主动推理的期望自由能作为统一准则,用于预算约束下的机器人信息路径规划,其规划方法在火星探测场景中可同时实现精准地图构建与高价值区域定位,性能优于信息论基准方法。

Comments accepted for IWAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12751 2026-08-17 cs.AR cs.AI 版本更新 79%

SynAct: A Reasoning-Acting Large Language Model Agent for Adaptive Synthesis Optimization

SynAct:用于自适应综合优化的推理-行动大语言模型智能体

Fangzhou Liu, Peiyi Han, Jiawei Liu, Yuan Pu, Zhuolun He, Rongliang Fu, Tsung-Yi Ho, Bei Yu

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SynAct是一种自适应闭环LLM推理-行动智能体,通过结合电路状态、工具知识与历史经验发布针对性命令,在14个商用设计实验中将平均WNS降至引导式综合的27%,实现高效自适应逻辑综合优化。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01236 2026-08-17 cs.RO cs.AI 版本更新 79%

LLM-Advisor: An LLM Advisor for Cost-efficient Path Planning across Multiple Terrains

LLM-Advisor: 一种用于多地形高效路径规划的LLM基准

Ling Xiao, Toshihiko Yamasaki

机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) Department of Information and Communication Engineering, The University of Tokyo(东京大学信息与通信工程系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 LLM-Advisor利用大型语言模型优化多地形路径规划,提升路径成本效率,适用于现实场景。

Comments This paper has been accepted by IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14312 2026-08-17 cs.CL 新提交 70%

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE:面向智能体强化学习的前沿优化、奖励驱动的环境合成方法

Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.CL

AI总结 Envs-FORGE是面向智能体RL的奖励驱动环境合成方法,通过MILP选动作生成训练环境,在多模型及数据集上显著提升Pass@1等指标。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11753 2026-08-17 cs.CL 版本更新 70%

Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks

代理聚合用于长周期代理任务的并行扩展

Yoonsang Lee, Howard Yen, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿大学语言与智能实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出AggAgent,通过将并行轨迹视为环境,有效解决长周期代理任务中轨迹信息聚合问题,提升性能并降低开销。

Comments COLM 2026. Code is available at https://github.com/princeton-pli/AggAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14246 2026-08-17 cs.AI 新提交 57%

Polaris : Multi Agentic System for Conversational Enterprise Analytics

Polaris:用于对话式企业分析的多智能体系统

Varuni H K, Soham Sarkar, Jay Kumar, Goutham Krishnan, Tanvi Johari, Avinash Bharadwaj, Santosh Hegde

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出名为Polaris的多智能体框架,通过动态任务协调(DTC)层与ReAct风格智能体结合,实现对话式企业分析,在结构化企业数据集上验证了其高语义保真度与答案相关性,为大规模可信端到端商业智能提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16509 2026-08-17 cs.RO cs.LG 版本更新 57%

Learning-Guided Sparsification of Dynamic Graphs in Robotic Exploration

基于学习的动态图稀疏化在机器人探索算法中的应用

Adithya V. Sastry, Bibek Poudel, Weizi Li

机构 * Independent Researcher(独立研究者) University of Tennessee, Knoxville(田纳西大学,基洛尼尔) University of California, Riverside(加州大学河滨分校)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于Transformer的框架,利用PPO算法在机器人探索中稀疏化动态图,减少冗余信息,提升性能,实验表明该方法能有效降低图规模并提高探索一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13791 2026-08-17 eess.IV cs.CV 新提交 50%

VLM- and LLM-Driven Multi-Agent System for PET Image Denoising

基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统

Boxiao Yu, Savas Ozdemir, Yang Xing, Fumio Hashimoto, Jiong Wu, Yizhou Chen, Axel Rominger, Ruogu Fang, Kuangyu Shi, Tinsu Pan, Kuang Gong

专题命中 规划推理 :reasoning(abstract)

AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14309 2026-08-17 cs.CV q-bio.TO 新提交 50%

Spatial Message Passing in Language Space for Pathology Image Interpretation

面向病理图像解读的语言空间空间消息传递

Jing-Cheng Yang, Hao-Jung Wang, Jinhao Du, Yang Hu, Ming-shan Tsai, Jens Rittscher, Bin Li

机构 * National Taiwan University(台湾大学) University of Oxford(牛津大学) ZYTCA Limited(ZYTCA有限公司)

专题命中 规划推理 :reasoning(abstract)

AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。

Comments Accepted at MICCAI 2026 Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11461 2026-08-17 cs.RO 版本更新 50%

CoViLLM: An Adaptive Human-Robot Collaborative Assembly Framework Using Large Language Models

CoViLLM:一种利用大语言模型的自适应人机协作装配框架

Jiabao Zhao, Jonghan Lim, Hongliang Li, Ilya Kovalenko

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出CoViLLM框架,结合深度相机定位、人类操作员分类和大语言模型,实现定制化和新产品的自适应装配,通过NIST装配任务板验证,实验表明该框架提升了人机协作的灵活性。

Comments 6 pages, 7 figures. Accepted to ASME MSEC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 6 篇

2604.08990 2026-08-17 cs.CV 版本更新 82%

ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning

ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别

Shifeng Liu, Zhengye Zhang, Sirui Zhao, Xinglong Mao, Zhehan Kan, Zhixiang Wei, Shiwei Wu, Chaoyou Fu, Tong Xu, Enhong Chen

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14160 2026-08-17 cs.RO 新提交 67%

OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation

OccPlanner:面向像素目标导航的目标感知占用条件扩散规划器

Binling Huang, Nianjin Ye, Xi Yang, Liang Hu, Zhou Huang, Shuang Wei, Longrui Yang, Yanchi Chen, Lanpeng Jia

机构 * Changhong Intelligent Robot(长虹智能机器人) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 该研究针对像素目标导航的3D目标定位与无碰撞规划难题,提出OccPlanner模型,引入L3ROcc生成监督,在仿真中大幅提升导航成功率,还验证了其仿真到真实的迁移适配性。

Comments Technical report. 11 pages, 6 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13921 2026-08-17 cs.AI 新提交 57%

When Personal Memory Has No Single Answer: Evaluating LLM Agents under Irreducible Conflict

当个人记忆没有唯一答案时:评估大语言模型智能体在不可约冲突下的表现

Lu Yang, Shusheng Xu, Zhuoran Li, Tongkai Yang, Longbo Huang

机构 * Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的记忆冲突问题,提出了基准TANGLE并评估其表现,发现现有方法存在缺陷,进而提出冲突感知行动策略CAAP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09430 2026-08-17 cs.RO cs.AI 版本更新 57%

AtomBridge: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments

Sci-VLA:用于科学实验中长周期任务的代理VLA推理插件

Yiwen Pang, Bo Zhou, Changjin Li, Xuanhao Wang, Shengxiang Xu, Deng-Bao Wang, Peng Cheng, Shimin Di, Jingkuan Song, Min-Ling Zhang

机构 * School of Computer Science and Engineering & School of Software Engineering & School of Artificial Intelligence, Southeast University, Nanjing, China(计算机科学与工程学院、软件工程学院、人工智能学院,东南大学,南京,中国) Pattern Learning and Mining Lab, Southeast University, Nanjing, China(模式学习与挖掘实验室,东南大学,南京,中国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的代理VLA推理插件,用于提升科学实验中长周期任务的执行效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 50%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21114 2026-08-17 cs.CV 版本更新 50%

CVT-Bench: Probing Spatial-State Integrity through Counterfactual Viewpoint Transformations

CVT-Bench:反事实视角变换揭示多模态大语言模型中不稳定的空间表征

Shanmukha Vellamcheti, Uday Kiran Kothapalli, Disharee Bhowmick, Sathyanarayanan N. Aakur

机构 * CSSE Department, Auburn University(计算机科学与工程系,阿伯杜大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CVT-Bench通过控制诊断基准评估多模态大语言模型在反事实视角变换下的关系一致性,发现尽管单视角准确率高,但系统在反事实视角变换下存在系统性退化,揭示了表征结构对反事实空间推理的重要性。

Comments Reframed CVT-Bench around spatial-state integrity, added real-world benchmark derived from 3dSGG, context controls and other minor changes. 21 pages, 10 figures, 15 tables. Project page: https://shanmukha-here.github.io/CVT-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏