arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 160 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2608.26166 2026-08-28 cs.HC cs.AI 新提交 88%

Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning

以用户为中心的思维链推理提升大语言模型可解释性

Philipp Schröppel

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 本研究提出以人为本的LLM推理轨迹构建方法,采用类XML标签编码,在保持数学推理性能的同时提升可解释性,显著改善用户感知的有用性与易用性,助力高风险AI部署的人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27265 2026-08-28 cs.CL 新提交 87%

SCIT: Testing Causal Cache Carriers in Latent Chain-of-Thought Models

SCIT:测试潜在思维链模型中的因果缓存载体

Yi Ding, Lijun Huang, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本研究提出SCIT因果协议,测试潜在思维链模型的缓存载体,发现反事实算术主要通过值缓存后缀轨迹传递,且载体机制随模型规模和类型存在差异。

Comments accept by emnlp2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26442 2026-08-28 cs.AI cs.CL 新提交 84%

Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI

不要过度思考,不要思考不足:面向智能体人工智能的自适应推理

Md Jueal Mia, M. Hadi Amini

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对智能体AI中推理分配不当导致的过度/思考不足问题,在MATH-500和GAIA基准上验证相关失败模式,为自适应推理机制研究提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22203 2026-08-28 cs.LG cs.AI cs.CL 版本更新 82%

From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning

从准确率到鲁棒性:数学推理中基于规则与基于模型的验证器研究

Yuzhen Huang, Weihao Zeng, Xingshan Zeng, Qi Zhu, Junxian He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以数学推理为案例,分析了基于规则与基于模型的验证器在静态评估和RL训练中的表现,发现两类验证器分别存在误拒和奖励黑客问题,为开发更优RL奖励系统提供了参考。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-28 cs.LG cs.CL 版本更新 81%

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21057 2026-08-28 cs.CL 版本更新 79%

TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping

TRACES:用于适应性成本高效提前停止的推理步骤标记

Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院) ADAPT Research Centre(ADAPT研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TRACES通过实时标记推理步骤,实现大语言模型推理的适应性成本高效提前停止,通过监控特定步骤类型提升数学和知识推理任务的效率与准确性。

Comments Accepted at the Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26950 2026-08-28 cs.AI cs.CL 新提交 73%

From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

从原子到智能体:迈向大语言模型智能体数学能力的可解释评估

Jiayi Kuang, Yinghui Li, Yunze Song, Keyu Chen, Zhifeng Shen, Yangning Li, Yidong Wang, Di Yin, Ruizhi Qiao, Xing Sun, Kai Jin, Ying Shen, Liang Lin, Philip S. Yu

机构 * Sun Yat-sen University(中山大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Pengcheng Laboratory(鹏城实验室)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25160 2026-08-28 cs.CV cs.AI cs.CL 版本更新 73%

GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts

GSM8K-V:视觉语言模型能否在视觉语境下解决小学级数学应用题

Fan Yuan, Yuchen Yan, Yifan Jiang, Haoran Zhao, Tao Feng, Jinyan Chen, Yanwei Lou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了多图像视觉数学基准GSM8K-V,评估34个VLMs发现其存在显著模态差距,最优模型仅达59%准确率,瓶颈为隐式视觉推理错误,且视觉数学优化模型在此无提升。

Comments 59 pages, 7 figures, Project Page: this https URL (https://zju-real.github.io/GSM8K-V) Code: this https URL (https://github.com/ZJU-REAL/GSM8K-V) Datasets: this https URL (https://huggingface.co/datasets/ZJU-REAL/GSM8K-V) Accepted at EMNLP 2026 Main Conference. Updated to the camera-ready version with additional experiments, analyses, and revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10402 2026-08-28 cs.CL cs.AI 版本更新 62%

Harnessing the Collective Intelligence of AI Agents in the Wild for New Discoveries

利用野外AI代理的集体智慧实现新发现

Federico Bianchi, Yongchan Kwon, Aneesh Pappu, James Zou

机构 * Together AI Stanford University(斯坦福大学)

专题命中 数学推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出EinsteinArena平台,通过开放分布式环境中的自主代理交互,在数学问题中实现12项新最优结果,展示了集体AI驱动研究的范式。

Comments Updated to correct a mistake

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27448 2026-08-28 cs.CL 新提交 57%

TTPO: Test-Time Policy Optimization

TTPO:测试时策略优化

Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对大语言模型测试时训练的伪标签缺陷,提出 TTPO 方法,通过不对称目标函数与 token 级选择优化,在无标签下实现了与标签监督 OPSD 相当的性能,提升了模型数学推理能力并增强了跨任务泛化性。

Comments Project Page: this https URL (https://zju-real.github.io/TTPO) Code: this https URL (https://github.com/ZJU-REAL/TTPO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27420 2026-08-28 cs.CL 新提交 57%

Boosting LLM Exploration via Weak-Model Guidance in RLVR

通过RLVR中的弱模型引导增强大语言模型探索能力

Xingyu Shen, Huishuai Zhang, Peng Li, Yinchun Wang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) National Engineering Research Center of New Electronic Publishing Technologies(国家新型电子出版技术工程研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出弱模型引导的RLVR方法,通过弱模型的部分推理轨迹增强LLM探索,缓解熵崩溃,在数学基准上提升大k值下的推理性能与覆盖范围。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02357 2026-08-28 cs.CV cs.AI 版本更新 57%

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

多模态智能体真的从工具使用中受益吗?能力增益的系统性研究

Jiawei Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, Minpeng Liao

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 通过对比工具增强与无工具的多模态智能体在多项任务上的表现,发现工具使用并未带来一致的性能提升,智能体更多是学会了工具调用模式而非真正利用工具扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 10 篇

2608.26602 2026-08-28 cs.SE cs.CL 新提交 74%

The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning

千图假说:仓库级代码推理中任务条件关系实例化的可检验假说

Fei Ding

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL

AI总结 针对仓库级代码推理的上下文限制与关系图维护问题,该研究提出带任务条件关系实例化的仅实体外部接口,经DeepSeek-V4-Flash和SWE-bench Verified评估,双层索引方案在零预构建边时成功率达95.6%。

Comments 9 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15740 2026-08-28 cs.FL cs.AI cs.SE 版本更新 70%

HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement

HybridProver:结合大语言模型驱动的证明合成与精化增强定理证明

Jilin Hu, Jianyu Zhang, Yongwang Zhao, Talia Ringer

机构 * College of Computer Science and Technology Zhejiang University(浙江大学计算机科学与技术学院) Siebel Center for Computer Science University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学中心)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出HybridProver框架,以证明草图为中间表示集成两种定理证明范式,在miniF2F Isabelle基准上使7B模型成功率达73.8%,优于此前最优水平。

Comments Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26187 2026-08-28 cs.CL cs.AI cs.LG cs.LO 新提交 67%

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models

当规范补全出错时:大型语言模型中跃迁的形式化与测量

Dai Shi, Xiaoyu Li, José Miguel Hernández-Lobato

机构 * University of Cambridge(剑桥大学) University of New South Wales(新南威尔士大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对大型语言模型的“跃迁”进行形式化定义与测量,发现模型在第二步会放弃默认补全完成跃迁,更高难度失败源于推理预算或约束问题,而非回归默认,为相关争论提供了新依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26176 2026-08-28 cs.AI cs.CL 新提交 62%

Knowledge Cards: Structured Knowledge for AI Systems

知识卡片:面向AI系统的结构化知识

Liliana Ferreira

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有AI文档制品未覆盖输入输出间知识层的问题,提出可捕获概念相关结构化知识的Knowledge Card,已在能源等领域构建原型并发布公共草案。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26310 2026-08-28 cs.AI 新提交 57%

FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence

FaithSieve:基于忠实形式证据的数学证明细粒度评估

Ziyu Wang, Qiming Dai, Yishan Wu, Zaiwen Wen

机构 * Peking University(北京大学) School of Mathematical Sciences(数学科学学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出Lean辅助框架FaithSieve,通过分解数学证明为细粒度单元并结合忠实形式证据,在两个专家验证数据集上提升了首个错误定位的精确评估准确率。

Comments 32 pages, 3 figures; preprint with appendix and supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26291 2026-08-28 cs.AI q-bio.NC 新提交 57%

Assessing mentalization in humans and large language models

评估人类与大型语言模型的心智化能力

Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang

机构 * University of Birmingham(伯明翰大学) Virginia Tech(弗吉尼亚理工大学) University of Oxford(牛津大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究以两项经济博弈结合认知计算建模,对比测试DeepSeek等四款LLM智能体与人类参与者,发现不同LLM心智化能力有差异,GPT-5表现优于人类,证实认知计算建模可用于评估人机比较智能。

Comments 46 pages, 4 figures, 2 tables. Supplementary information available on request from the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26160 2026-08-28 cs.AI 新提交 57%

SAREF-based Ontology for Distributed AI Workflows across the Edge-Fog-Cloud Continuum

面向边-雾-云连续体的基于SAREF的分布式AI工作流本体

Viorica Rozina Chifu, Tudor Cioara, Vasile Ofrim, Liana Toderean, Ionut Anghel, Laura Daniele, Cornelis Bouter

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种符合SAREF的本体,扩展SAREF4SYST本体加入AI相关概念,经智能电网场景验证,可实现边-雾-云环境下分布式AI工作流的语义互操作,部署成功率90%-100%,平均编排决策时间低于80ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07167 2026-08-28 cs.AI 版本更新 57%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16978 2026-08-28 cs.MA 版本更新 56%

Lark: Biologically Inspired Neuroevolution for Multi-Stakeholder LLM Agents

Lark:生物启发的多利益相关者大语言模型代理神经进化

Rikhil Tanugula, Dheeraj Chintapalli, Sunkalp Chandra

专题命中 代码与定理证明 :reasoning(abstract,comments)

AI总结 Lark通过结合大语言模型推理与进化型多智能体系统,解决冗余与利益相关者权衡问题,采用四机制提升策略生成效率与透明度,实验显示其在30轮评估中表现优异且成本可控。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26108 2026-08-28 cs.SE 新提交 50%

Agentic AI Containment Architecture for Security Hardening

用于安全加固的智能体AI containment架构

Mohamed ElBendary

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。

Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 9 篇

2608.26836 2026-08-28 cs.AI cs.CL 新提交 91%

SymbolLKG: Towards Verifiable Logical Reasoning via Logical Knowledge Graph and Symbolic Solvers

SymbolLKG:基于逻辑知识图谱与符号求解器的可验证逻辑推理研究

Haizhao Fan, Yuchi Xiong, Jize Wang, Xinping Guan, Xinyi Le

机构 * Shanghai JiaoTong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 该研究针对大型语言模型逻辑推理的缺陷,提出结合逻辑知识图谱与动态求解器路由的神经-符号架构,在基准任务上优于现有方法,实现了可验证的高准确率逻辑推理。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26329 2026-08-28 cs.CL 新提交 83%

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification

神经符号PRM:通过结构化轨迹与符号验证增强科学推理

Yuxin Zi, Cong Xu, Suparna Bhattacharya, Martin Foltin, Amit Sheth

机构 * AI Institute of South Carolina(南卡罗来纳州人工智能研究所) HPE Labs(慧与实验室) Indian AI Research Organisation(印度人工智能研究组织)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 该研究提出神经符号PRM框架,解耦推理为符号有效性与语义接地性,引入反事实符号扰动训练PRM,通过验证器优先搜索提升工具增强型LLM的科学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26147 2026-08-28 cs.CL cs.CV 新提交 83%

CARE: Causally-Aligned Reasoning Exploration for Medical Large Language Models

CARE:面向医学大语言模型的因果对齐推理探索

Yucheng Zhou, Peng Luo, Qianning Wang, Chengzhong Xu, Jianbing Shen

机构 * University of Macau(澳门大学) Auckland University of Technology(奥克兰理工大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究针对医学大语言模型的推理缺陷,提出CARE框架,通过因果充分性与近端可学习性条件筛选训练经验,在医学基准上提升了推理一致性与训练稳定性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26107 2026-08-28 cs.AI 新提交 80%

EduRiskX: A Neuro-Symbolic Framework with F-Logic Reasoning for Early Academic Risk Prediction

EduRiskX:用于早期学业风险预测的神经符号框架,结合F-Logic推理

Yu Fu, Yongqi Kang, Yong Zhao, Rongfang Bie

机构 * Sichuan University(四川大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出结合F-Logic推理的神经符号框架EduRiskX,在OULAD数据集上实现了更高的早期学业风险预测性能,且可提供可解释的规则依据。

Comments Previously available on Research Square: this https URL (https://doi.org/10.21203/rs.3.rs-8877832/v1). This version presents the complete neuro-symbolic framework, EduRiskX, integrating temporal Transformers with F-Logic reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26114 2026-08-28 cs.AI cs.CL q-fin.CP 新提交 73%

CIFQA: A Deterministic Tool-Grounded Multi-Agent LLM Framework for Financial Query Answering

CIFQA:一种用于金融查询问答的确定性工具基多智能体大语言模型框架

Kunjesh Parekh, Anil Kumar Tiwari, Divya Saxena

机构 * School of Artificial Intelligence and Data Science, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据科学学院)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM多步骤金融计算易出错的问题,提出CIFQA多智能体框架,在定期存款查询基准上准确率达95.54%,且17B开源模型在该框架内表现优于更大前沿模型,证明架构设计对数值可靠性更关键。

Comments 16 pages, 5 figures, submitted for academic dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-28 cs.CL 版本更新 57%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yafei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-28 cs.CL 版本更新 57%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments EMNLP 2026, findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26197 2026-08-28 cs.SE 新提交 50%

Harness Engineering for Predictable Agentic Systems: An Empirical Study of Deterministic Execution Constraints

利用工程实现可预测的智能体系统:确定性执行约束的实证研究

Saransh Dhage

专题命中 逻辑推理 :planning(abstract)

AI总结 本研究通过实证探究harness工程中确定性执行约束对LLM智能体的影响,发现添加结构化规划可提升可复现性与任务成功率,但延迟存在模型依赖的成本差异。

Comments 9 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏