arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-26 至 2026-08-26 共收录 73 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2608.24658 2026-08-26 cs.AI 新提交 79%

Parason: Revealing Subtask and Trial Parallelism in LLM Reasoning

Parason:揭示大语言模型推理中的子任务并行与试错并行

Zhengyang Zhang, Zijian Zhang, Jiaxuan Gao, Shusheng Xu, Yi Wu, Song Han, Ligeng Zhu

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Parason揭示LLM推理的子任务与试错并行,用上下文无关文法转换轨迹,经PA-GRPO训练,在数学基准上实现约1.7倍加速且保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24300 2026-08-26 cs.LG cs.AI 新提交 62%

Contrastive Branch Policy Optimization

对比分支策略优化

Ying Wang, Changlin Qiu, Bang Lin, Linbo Jin, Wen Jiang, Zhe Sun, Jingli Yang

机构 * Alibaba Group(阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对工具集成智能体训练的细粒度信用分配问题,提出CBPO解耦分支采样的预算分配与信用转化,在十个基准上优于现有方法,获两个领域及两种模型规模下最高宏平均准确率。

Comments 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23867 2026-08-26 cs.MA cs.CL 新提交 57%

Markets, Not Planners: Decentralized Orchestration of LLM Agents with Private Information

市场而非规划者:利用私有信息对大语言模型智能体进行去中心化协调

Xiao Liu, Haoyang Li, Songwei Li, Hongbo Fang, Fengli Xu, Feng Shi, James Evans

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对中心化LLM智能体协调的瓶颈与易操控问题,提出去中心化的AgentLance重复劳动力市场机制,经多类任务验证,其匹配专长、转向廉价智能体的表现优于基线方法,还可通过修正市场失灵进一步提升效率。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23632 2026-08-26 cs.AI cs.SE 新提交 57%

Function-Level Execution Feedback for Code Preference Optimization

用于代码偏好优化的函数级执行反馈

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。

Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2608.23644 2026-08-26 cs.AI 新提交 57%

Ethical LLM-Assisted Research: A Framework for Responsible Delegation, Verification, and Epistemic Value

伦理大语言模型辅助研究:负责任委托、验证与认知价值框架

Kalin Stoyanov

机构 * University of Chemical Technology and Metallurgy(化工技术与冶金大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文构建了伦理LLM辅助研究的规范性框架,明确其伦理边界由充分验证与可问责人类所有权决定,提出认知审计概念以实现AI辅助推理的透明可审查性。

Comments This is a substantially revised version of submit/7664457. I have extensively revised the manuscript to clarify its scholarly contribution, strengthen the formal framework and literature grounding, and remove or reformulate claims that were not sufficiently supported

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2608.23961 2026-08-26 cs.SE cs.AI cs.CL 新提交 79%

Evaluating Language Models on Cross-Language Code Functional Equivalence

评估语言模型在跨语言代码功能等价性上的表现

Hui Sun, Anderson Uchôa, Rohit Gheyi, Wesley K. G. Assunção

专题命中 逻辑推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建PolyHuman跨语言代码数据集,评估GPT-o4-mini等LLMs的代码功能等价性判断能力,发现其存在难度依赖错误、语言敏感性及运行不稳定等局限,无法可靠捕获功能等价性。

Comments 20 pages. To appear in the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), LIPIcs vol. 394, Article No. 41

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24369 2026-08-26 cs.AI 新提交 70%

Do Recipes Have Personas? Characterizing and Generating Creator Style in Attributed Procedural Graphs

食谱是否具有人设?在带属性的过程图中刻画与生成创作者风格

Lei Jiang

机构 * Microsoft(微软公司)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对大语言模型生成同质化逻辑的问题,构建了映射特定创作者的烹饪执行图数据集,提出结构化两阶段模型,可精准刻画与生成创作者的过程风格,集成方法能融合语义推理与拓扑控制优势。

Comments Accepted at the 29th International Conference on Discovery Science (DS 2026). 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24824 2026-08-26 cs.AI 新提交 57%

Constrained Entity Selection under Partial Knowledge for LLM-Based Knowledge Graph QA

基于部分知识的约束实体选择:面向大语言模型的知识图谱问答

Emanuel Kitzelmann

机构 * Brandenburg University of Applied Sciences(勃兰登堡应用技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有大语言模型知识图谱问答方法的缺陷,提出CES-PK方法,通过轻量符号约束验证LLM生成的候选答案,在Hetionet上验证,实现精确率提升且保持召回率。

Comments 8 pages, 2 tables. Submitted manuscript. Revised version published in KI 2026: Advances in Artificial Intelligence, LNCS 16830

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 12 篇

2608.24310 2026-08-26 cs.AI 新提交 79%

OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning

OPDSearch+:用于搜索增强推理的带RL优化的在线策略蒸馏

Qinglin Ye, Zhiyuan Gu, Jingjie Xia, Yiheng Zhang, Kaiyan Zhao, Shunchao Zheng, Yuhang Mu, Wenchao Du, Yiming Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) Wuhan University(武汉大学) Georgia Institute of Technology(佐治亚理工学院) Northwestern Polytechnical University(西北工业大学) University of Hong Kong(香港大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 OPDSearch+是无需教师微调的搜索增强推理蒸馏范式,利用冻结的现成指令模型分两阶段优化3B模型,在7个QA基准上优于所有3B RL基线,HotpotQA和2WikiMultihopQA分别提升13.1%、8.5%。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24237 2026-08-26 cs.AI 新提交 79%

STRIVE: Multi-Agent Structured Temporal Reasoning with Integrated Verification for Longitudinal Radiology Report Generation

STRIVE:面向纵向放射报告生成的集成验证多智能体结构化时序推理

Junyeong Maeng, Eunsong Kang, Heung-Il Suk

机构 * Korea University(高丽大学) Kangwon National University(江原国立大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 STRIVE将临床推理分解为多智能体并引入两阶段验证,在Longitudinal-MIMIC数据集上实现纵向放射报告生成的最佳临床效能,纵向变化一致性较最强基准提升超一倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24048 2026-08-26 cs.SD cs.AI 新提交 79%

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

不止聆听,尝试规划:面向长音频会议理解的基于图的检索-生成智能体

Quanwei Tang, Dong Zhang, Shoushan Li, Guodong Zhou

机构 * Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 针对长音频会议理解任务的问答数据集稀缺及现有语音模型的声学信息丢失、长期记忆差问题,构建LongAudioQA数据集,提出基于图的GRGA模型,利用智能体规划实现检索与答案生成。

Comments ACL Findings 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24011 2026-08-26 cs.CL cs.AI 新提交 73%

SAGE: From Direct Answering to Evidence-Grounded Inference for Chinese Ancient Document Understanding

SAGE:面向中国古代文献理解的从直接回答到证据导向推理

Yuchuan Wu, Xuan Luo, Yinglian Zhu, Meng Fang, Xiangyang Xue, Bin Li

机构 * Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有大型视觉语言模型(LVLMs)在古代文献理解中证据支撑不足的问题,本文提出SAGE多智能体框架,通过多阶段证据导向推理实现任务规划、证据获取与验证,在AncientDoc基准上优于基线,搭载Qwen3.5-9B的SAGE性能超更大单体模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23622 2026-08-26 cs.AI cs.CL cs.MA cs.SE 新提交 73%

LLM Agents Perform Controlled Experiments Using Simulation Models

大语言模型智能体使用模拟模型开展对照实验

Yuchen Xia, Michael Weyrich, Nasser Jazdi, Johannes Stümpfle, Johannes Sigel, Akshay Narla, Gavin K. Reynolds, Anna Jawor-Baczynska, Pol Llopart

机构 * Institute for Industrial Automation and Software Engineering(工业自动化与软件工程研究所) University of Stuttgart(斯图加特大学) AstraZeneca(阿斯利康)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出多智能体框架,将LLM与高保真模拟模型结合,使LLM智能体可开展制药工艺设计的对照实验,生成更具体可操作的优化建议,在工业场景中表现更优。

Comments Accepted at the 31st IEEE International Conference on Emerging Technologies and Factory Automation ETFA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24585 2026-08-26 cs.AI 新提交 70%

Pivot-and-Station Multi-Agent Path Finding: Solvability, Complexity, and Algorithms

枢轴与站点多智能体路径寻径:可解性、复杂性与算法

Andrea Di Nezza, Mihir Patel, Fabio Fagnani, Sara Bernardini

机构 * Politecnico di Torino(都灵理工大学) University of Oxford(牛津大学)

专题命中 规划推理 :planning(abstract,abstract_cn);分类 cs.AI

AI总结 针对需访问枢轴后停放的多智能体路径寻径问题,研究人员证明其可解性条件、最小化相关时间指标的NP难性,并提出PPP算法,大幅提升基准实例求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23791 2026-08-26 eess.AS cs.AI 新提交 57%

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

EmoTra-TTS:用于语音合成的流畅句内情感转换

Tianchi Liu, Zeyang Song, Tianrui Wang, Zhipeng Li, Chenglin Xu, Yiwen Guo

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 EmoTra-TTS针对现有情感TTS系统与情感时间特性不匹配的问题,采用多遍流混合管道、双阶段VAD条件及方向-幅度解耦注入,实现流畅句内情感转换,且性能优于SOTA基线与商业系统。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24221 2026-08-26 cs.SE cs.CL cs.PL 新提交 57%

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration

DeepRepoQA:基于深度智能体探索的代码仓库问答系统

Weihan Peng, Yuling Shi, Yingwei Ma, Longfei Yun, Beijun Shen, Xiaodong Gu

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-26 cs.AI 新提交 57%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24022 2026-08-26 cs.CR cs.AI 新提交 57%

What Guides the Agent? Adjudicating Unauthorized Behavior via Localizing Behavior-Guiding Instructions

智能体的决策依据是什么?通过定位行为引导指令来裁决未授权行为

Yichao Gao, Yumo Zhang, Yunhao Yao, Haohua Du, Puhan Luo, Ruiqi Li, Zhiqiang Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM智能体易受动态注入攻击的问题,提出Attnlocate框架,通过目标检测定位行为引导指令以裁决未授权行为,在多场景下表现优异且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23611 2026-08-26 cs.SE cs.AI 新提交 57%

REFINE: A Multi-Agent LLM Approach for Evidence-Guided Code Refactoring

REFINE:一种用于证据引导代码重构的多智能体大语言模型方法

Muhammad Waseem, Aakash Ahmad, Pekka Abrahamsson

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究提出多智能体方法REFINE,结合静态分析、LLM等技术生成Java代码重构候选,在450个文件上使异味降低超68%,效果优于直接提示基线,但存在残留风险需人工审查。

Comments Preprint. 450 Java files from 15 open-source systems; 1,350 model-pass outputs across three LLM configurations. The accompanying replication package will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24430 2026-08-26 cs.CV 新提交 50%

Vision Language Model Fusion for Explainable Face Recognition

用于可解释人脸识别的视觉语言模型融合

Ana Estrada-Real, Lydia Alapatt, Christoph Busch, Christian Rathgeb

机构 * Hochschule Darmstadt(达姆施塔特应用科学大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究提出多视觉语言模型(VLM)融合框架,结合相似度分数、文本解释与人脸图像,提升了人脸识别准确率,同时生成更丰富稳健的可解释决策,助力开发负责任的可解释人脸识别系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 7 篇

2608.24039 2026-08-26 cs.RO cs.AI 新提交 83%

Design-to-Plan: A Large Language Model-Based Multi-Agent Framework for Manufacturing Process Planning from 3D CAD Models and 2D Engineering Drawings

Design-to-Plan:基于大语言模型的多智能体框架,用于从3D CAD模型和2D工程图生成制造工艺规划

Muhammad Tayyab Khan, Lequn Chen, Wenhe Feng, Seung Ki Moon

机构 * Singapore Institute of Manufacturing Technology (SIMTech), Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究院(新加坡科学、技术与研究局)) Advanced Remanufacturing and Technology Centre (ARTC), Agency for Science, Technology and Research (A*STAR)(先进再制造与技术中心(新加坡科学、技术与研究局)) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与宇航工程学院)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究提出Design-to-Plan多智能体框架,结合LLM与确定性模块,实现从3D CAD及2D图纸到制造工艺规划的端到端自动化,经300个基准案例验证,性能优异且令牌用量显著降低。

Comments Submitted to Elsevier Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23809 2026-08-26 cs.LG cs.AI cs.CL 新提交 82%

Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders

利用几何不变稀疏自编码器发现大语言模型中的跨语言推理不变性

Igor Bogdanov, Changcheng Huang

机构 * Carleton University(卡尔顿大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以MGSM数据集探究多语言LLM跨语言推理的特征机制,提出GI-SAE方法,发现跨语言特征共享依赖模型架构,GI-SAE主要放大现有跨语言结构且模型特异性明显。

Comments Accepted as a poster at the ICML 2026 Workshop on Mechanistic Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24103 2026-08-26 cs.AI 新提交 57%

ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

ACE:用于多幻灯片演示自动化的自修正智能体画布编辑器

JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

机构 * Seoul National University(首尔大学) Miridih(米里迪)

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI

AI总结 针对LLM智能体编辑演示文档的布局破坏与有效输出被误判问题,提出带CARE路由器和自修正循环的ACE,其性能优于对比方法,获盲评者偏好。

Comments 26 pages, 12 figures, EMNLP 2026 Industry Track (Main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24037 2026-08-26 cs.CL 新提交 57%

Curved Inference II: Sleeper Agent Geometry - Extending Interpretability Beyond Probes

曲线推理 II:休眠智能体几何——将可解释性扩展至探测技术之外

Rob Manson

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文扩展了Anthropic的休眠智能体研究,提出曲线推理框架,引入语义表面积度量,通过多轮上下文窗口分析自然欺骗推理的几何特征,为线性检测失效时提供了可扩展的无监督检测路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交 50%

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23869 2026-08-26 cs.CV 新提交 50%

Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition

Gen2Physics:通过多视图材料分解将生成的三维网格与物理特性关联

Mauro Comi, Jordi Serrano Berbel, Kevis-Kokitsi Maninis, Philipp Henzler, Manuel Sanchez

机构 * University of Bristol(布里斯托大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Gen2Physics是一个将生成的三维网格与物理特性关联的自动化框架,通过多视图材料分解实现,其材料分割精度较现有方法提升超一倍,还能输出水密性各材料子网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23853 2026-08-26 cs.CV 新提交 50%

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构

Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 7 篇

2608.23956 2026-08-26 cs.AI 新提交 83%

Recursive Agentic Reasoning

递归智能体推理

Shengxin Zhang, Xiaomin Wu, Xiyang Wu, Jing Xie

机构 * Google(谷歌) University of Maryland(马里兰大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文将测试时推理方法统一为递归算子,通过共享框架对比发现BRANCH算子在多场景下提升准确率,且配对评估是测试时计算评估的标准协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24338 2026-08-26 cs.AI 新提交 80%

Selective Regenerative Decoding: Trajectory-Level Intervention for Inference-Time Reasoning

选择性再生解码:推理时推理的轨迹级干预

Sophia Xiao Pu, Yumo Xu, Sailik Sengupta, Millennium Bismay, Ruixue Lian, James Gung, Yi-an Lai, Arshit Gupta

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Netflix(网飞公司) Amazon Science(亚马逊科学研究院) Meta

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出选择性再生解码(SRD),通过对候选轨迹做片段级干预,在低计算量下以更少生成代币达到Best-of-N准确率,提升样本效率,开辟了推理时推理的准确率-计算权衡新领域。

Comments Large Language Model, Test-Time Decoding Technique, Reasoning, 20 pages; Submitted to ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24087 2026-08-26 cs.LG cs.AI stat.ML 新提交 73%

Knowing When to Ask for Help: Bayesian Self-Escalation in Hierarchical LLM Agents

何时请求帮助:分层大语言模型智能体中的贝叶斯自我升级

Nadeem Shaikh

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM智能体提出贝叶斯自我升级策略,将生成中委派建模为贝叶斯最优停止问题,经模拟和真实代码级联验证,其升级机制在同等成本下优于事后路由,能力信念区分度随生成提升。

Comments 21 pages, 5 figures. Code and data: this https URL (https://github.com/nadeem-shaikh/llm-self-escalation). Associated record: this https URL (https://doi.org/10.5281/zenodo.21330787)

详情

展开后加载摘要…

URL PDF HTML 收藏