arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-26 至 2026-08-26 共收录 133 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 24 篇

2608.24011 2026-08-26 cs.CL cs.AI 新提交 73%

SAGE: From Direct Answering to Evidence-Grounded Inference for Chinese Ancient Document Understanding

SAGE:面向中国古代文献理解的从直接回答到证据导向推理

Yuchuan Wu, Xuan Luo, Yinglian Zhu, Meng Fang, Xiangyang Xue, Bin Li

机构 * Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有大型视觉语言模型(LVLMs)在古代文献理解中证据支撑不足的问题,本文提出SAGE多智能体框架,通过多阶段证据导向推理实现任务规划、证据获取与验证,在AncientDoc基准上优于基线,搭载Qwen3.5-9B的SAGE性能超更大单体模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23622 2026-08-26 cs.AI cs.CL cs.MA cs.SE 新提交 73%

LLM Agents Perform Controlled Experiments Using Simulation Models

大语言模型智能体使用模拟模型开展对照实验

Yuchen Xia, Michael Weyrich, Nasser Jazdi, Johannes Stümpfle, Johannes Sigel, Akshay Narla, Gavin K. Reynolds, Anna Jawor-Baczynska, Pol Llopart

机构 * Institute for Industrial Automation and Software Engineering(工业自动化与软件工程研究所) University of Stuttgart(斯图加特大学) AstraZeneca(阿斯利康)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出多智能体框架,将LLM与高保真模拟模型结合,使LLM智能体可开展制药工艺设计的对照实验,生成更具体可操作的优化建议,在工业场景中表现更优。

Comments Accepted at the 31st IEEE International Conference on Emerging Technologies and Factory Automation ETFA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24585 2026-08-26 cs.AI 新提交 70%

Pivot-and-Station Multi-Agent Path Finding: Solvability, Complexity, and Algorithms

枢轴与站点多智能体路径寻径:可解性、复杂性与算法

Andrea Di Nezza, Mihir Patel, Fabio Fagnani, Sara Bernardini

机构 * Politecnico di Torino(都灵理工大学) University of Oxford(牛津大学)

专题命中 规划推理 :planning(abstract,abstract_cn);分类 cs.AI

AI总结 针对需访问枢轴后停放的多智能体路径寻径问题,研究人员证明其可解性条件、最小化相关时间指标的NP难性,并提出PPP算法,大幅提升基准实例求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-08-26 cs.AI 版本更新 70%

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Yusheng Li, Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00282 2026-08-26 cs.CL cs.AI cs.LG 版本更新 67%

Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations

大语言模型还能自我解释吗?探讨量化对自我解释的影响

Qianli Wang, Nils Feldhus, Pepa Atanasova, Fedor Splitt, Simon Ostermann, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) University of Copenhagen(哥本哈根大学) Saarland Informatics Campus(萨尔州信息学校园) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨量化对大语言模型自我解释质量及可信度的影响,发现量化会导致中等程度的下降,但不影响其作为压缩技术的有效性。

Comments EMNLP 2026 Findings; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23791 2026-08-26 eess.AS cs.AI 新提交 57%

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

EmoTra-TTS:用于语音合成的流畅句内情感转换

Tianchi Liu, Zeyang Song, Tianrui Wang, Zhipeng Li, Chenglin Xu, Yiwen Guo

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 EmoTra-TTS针对现有情感TTS系统与情感时间特性不匹配的问题,采用多遍流混合管道、双阶段VAD条件及方向-幅度解耦注入,实现流畅句内情感转换,且性能优于SOTA基线与商业系统。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24221 2026-08-26 cs.SE cs.CL cs.PL 新提交 57%

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration

DeepRepoQA:基于深度智能体探索的代码仓库问答系统

Weihan Peng, Yuling Shi, Yingwei Ma, Longfei Yun, Beijun Shen, Xiaodong Gu

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-26 cs.AI 新提交 57%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24022 2026-08-26 cs.CR cs.AI 新提交 57%

What Guides the Agent? Adjudicating Unauthorized Behavior via Localizing Behavior-Guiding Instructions

智能体的决策依据是什么?通过定位行为引导指令来裁决未授权行为

Yichao Gao, Yumo Zhang, Yunhao Yao, Haohua Du, Puhan Luo, Ruiqi Li, Zhiqiang Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM智能体易受动态注入攻击的问题,提出Attnlocate框架,通过目标检测定位行为引导指令以裁决未授权行为,在多场景下表现优异且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23611 2026-08-26 cs.SE cs.AI 新提交 57%

REFINE: A Multi-Agent LLM Approach for Evidence-Guided Code Refactoring

REFINE:一种用于证据引导代码重构的多智能体大语言模型方法

Muhammad Waseem, Aakash Ahmad, Pekka Abrahamsson

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究提出多智能体方法REFINE,结合静态分析、LLM等技术生成Java代码重构候选,在450个文件上使异味降低超68%,效果优于直接提示基线,但存在残留风险需人工审查。

Comments Preprint. 450 Java files from 15 open-source systems; 1,350 model-pass outputs across three LLM configurations. The accompanying replication package will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23035 2026-08-26 cs.AI 版本更新 57%

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09159 2026-08-26 cs.AI cs.MA 版本更新 57%

CoMMa: Contribution-Aware Medical Multi-Agents for Decentralized Oncology Decision Support

从博弈论视角出发的贡献感知医疗多智能体:CoMMa

Yichen Wu, Kailong Fan, Sangjoon Park, Yuhan Liu, Zhiyi Shi, Sekeun Kim, Dania Daye, Hana Farzaneh, Xiang Li, Raul Uppot, Yujin Oh, Quanzheng Li

机构 * Center for Advanced Medical Computing(先进医学计算中心) Department of Radiology, Massachusetts General Hospital(放射科,马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology, Yonsei University College of Medicine(放射肿瘤科,延世大学医学院) Yonsei University(延世大学) Institute for Innovation in Digital Healthcare(数字医疗创新研究所) Interventional Radiology Academic Medical Centers, Mass General Brigham(介入放射学学术医疗中心,马萨诸塞总医院 Brigham)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 CoMMa从博弈论视角提出一种去中心化医疗多智能体框架,通过确定性嵌入投影实现贡献感知的信用分配,提升肿瘤学决策支持的准确性和稳定性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00704 2026-08-26 cs.LG 版本更新 57%

QiMeng-ChipV-RTL: Exploiting Information Locality for IP-level Verilog Generation

LocalV: 利用信息局部性进行IP级Verilog生成

Hanqi Lyu, Di Huang, Yaoyu Zhu, Kangcheng Liu, Bohan Dou, Chongxiao Li, Pengwei Jin, Shuyao Cheng, Rui Zhang, Zidong Du, Qi Guo, Xing Hu, Yunji Chen

机构 * University of Science(科学大学) SKL of Processors, Institute of Computing Technology, CAS(处理器研究所,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 LocalV通过利用模块化硬件设计中的信息局部性,解决IP级Verilog生成中的长文档处理、长代码生成和调试挑战,实现更高的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24430 2026-08-26 cs.CV 新提交 50%

Vision Language Model Fusion for Explainable Face Recognition

用于可解释人脸识别的视觉语言模型融合

Ana Estrada-Real, Lydia Alapatt, Christoph Busch, Christian Rathgeb

机构 * Hochschule Darmstadt(达姆施塔特应用科学大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究提出多视觉语言模型(VLM)融合框架,结合相似度分数、文本解释与人脸图像,提升了人脸识别准确率,同时生成更丰富稳健的可解释决策,助力开发负责任的可解释人脸识别系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13830 2026-08-26 cs.IR 版本更新 50%

A Tale of Two Graphs: Separating Knowledge Exploration from Outline Structure for Open-Ended Deep Research

双图之 tale:分离知识探索与大纲结构以实现开放性深度研究

Zhuofan Shi, Ming Ma, Zekun Yao, Fangkai Yang, Jue Zhang, Dongge Han, Victor Rühle, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 规划推理 :planning(abstract)

AI总结 本文提出DualGraph架构,通过分离知识与写作结构,提升开放性深度研究的效率和深度,实验表明其在报告深度、广度和事实准确性上优于现有方法。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 13 篇

2601.16520 2026-08-26 cs.CV cs.AI cs.CL 版本更新 84%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24039 2026-08-26 cs.RO cs.AI 新提交 83%

Design-to-Plan: A Large Language Model-Based Multi-Agent Framework for Manufacturing Process Planning from 3D CAD Models and 2D Engineering Drawings

Design-to-Plan:基于大语言模型的多智能体框架,用于从3D CAD模型和2D工程图生成制造工艺规划

Muhammad Tayyab Khan, Lequn Chen, Wenhe Feng, Seung Ki Moon

机构 * Singapore Institute of Manufacturing Technology (SIMTech), Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究院(新加坡科学、技术与研究局)) Advanced Remanufacturing and Technology Centre (ARTC), Agency for Science, Technology and Research (A*STAR)(先进再制造与技术中心(新加坡科学、技术与研究局)) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与宇航工程学院)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究提出Design-to-Plan多智能体框架,结合LLM与确定性模块,实现从3D CAD及2D图纸到制造工艺规划的端到端自动化,经300个基准案例验证,性能优异且令牌用量显著降低。

Comments Submitted to Elsevier Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21170 2026-08-26 cs.CV cs.AI 版本更新 83%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Daniel Kurzawe, Jan Philip Wahle, Bela Gipp

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23809 2026-08-26 cs.LG cs.AI cs.CL 新提交 82%

Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders

利用几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性

Igor Bogdanov, Changcheng Huang

机构 * Carleton University(卡尔顿大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以MGSM数据集探究多语言LLM跨语言推理的特征机制,提出GI-SAE方法,发现跨语言特征共享依赖模型架构,GI-SAE主要放大现有跨语言结构且模型特异性明显。

Comments Accepted as a poster at the ICML 2026 Workshop on Mechanistic Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-26 cs.CL cs.AI 版本更新 62%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24103 2026-08-26 cs.AI 新提交 57%

ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

ACE:用于多幻灯片演示自动化的自修正智能体画布编辑器

JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

机构 * Seoul National University(首尔大学) Miridih(米里迪)

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI

AI总结 针对LLM智能体编辑演示文档的布局破坏与有效输出被误判问题,提出带CARE路由器和自修正循环的ACE,其性能优于对比方法,获盲评者偏好。

Comments 26 pages, 12 figures, EMNLP 2026 Industry Track (Main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24037 2026-08-26 cs.CL 新提交 57%

Curved Inference II: Sleeper Agent Geometry - Extending Interpretability Beyond Probes

曲线推理 II:休眠智能体几何——将可解释性扩展至探测技术之外

Rob Manson

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文扩展了Anthropic的休眠智能体研究,提出曲线推理框架,引入语义表面积度量,通过多轮上下文窗口分析自然欺骗推理的几何特征,为线性检测失效时提供了可扩展的无监督检测路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-26 cs.RO cs.AI cs.CV 版本更新 57%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables, Code is available at: [ this https URL (https://github.com/XuPeng23/AeroDPO) ]

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-08-26 cs.AI physics.flu-dyn 版本更新 57%

Self-Evolving Scientific Agent Designs Physically-Reasoned Whitebox Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交 50%

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23869 2026-08-26 cs.CV 新提交 50%

Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition

Gen2Physics:通过多视图材料分解将生成的三维网格与物理特性关联

Mauro Comi, Jordi Serrano Berbel, Kevis-Kokitsi Maninis, Philipp Henzler, Manuel Sanchez

机构 * University of Bristol(布里斯托大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Gen2Physics是一个将生成的三维网格与物理特性关联的自动化框架,通过多视图材料分解实现,其材料分割精度较现有方法提升超一倍,还能输出水密性各材料子网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23853 2026-08-26 cs.CV 新提交 50%

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构

Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30972 2026-08-26 cs.CV 版本更新 50%

BiSegMamba: Efficient Bidirectional Tri-Oriented Mamba for 3D Medical Image Segmentation

BiSegMamba: 用于3D医学图像分割的高效双向三向Mamba

Bakht Zada, Chao Tong, Qile Su, Shuai Zhang

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北航虚拟现实技术与系统国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出BiSegMamba,一种基于双向三向Mamba的高效3D医学图像分割网络,通过渐进压缩主干、多尺度空间混合器、双向正交Mamba块和自适应方向融合,在降低计算成本的同时提升分割精度。

Comments Code is available at: this https URL (https://github.com/bakhtzadaabshare/BiSegMamba)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 9 篇

2608.23956 2026-08-26 cs.AI 新提交 83%

Recursive Agentic Reasoning

递归智能体推理

Shengxin Zhang, Xiaomin Wu, Xiyang Wu, Jing Xie

机构 * Google(谷歌) University of Maryland(马里兰大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文将测试时推理方法统一为递归算子,通过共享框架对比发现BRANCH算子在多场景下提升准确率,且配对评估是测试时计算评估的标准协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24338 2026-08-26 cs.AI 新提交 80%

Selective Regenerative Decoding: Trajectory-Level Intervention for Inference-Time Reasoning

选择性再生解码:推理时推理的轨迹级干预

Sophia Xiao Pu, Yumo Xu, Sailik Sengupta, Millennium Bismay, Ruixue Lian, James Gung, Yi-an Lai, Arshit Gupta

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Netflix(网飞公司) Amazon Science(亚马逊科学研究院) Meta

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出选择性再生解码(SRD),通过对候选轨迹做片段级干预,在低计算量下以更少生成代币达到Best-of-N准确率,提升样本效率,开辟了推理时推理的准确率-计算权衡新领域。

Comments Large Language Model, Test-Time Decoding Technique, Reasoning, 20 pages; Submitted to ARR

详情

展开后加载摘要…

URL PDF HTML 收藏