arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1658 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1658 篇

2606.23717 2026-06-24 eess.IV 新提交 88%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08688 2026-06-09 cs.RO cs.CV 新提交 88%

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback

PhysAgent: 通过轨迹驱动的多智能体反馈实现基于物理的4D合成自动化

Chunji Lv, Jiaxi Ye, Yuchen Jiang, Rexar Lin, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出PhysAgent,首个模拟器在环的多智能体框架,通过解耦材料与外力、利用视觉基础模型提取轨迹并借助LLM常识推理,实现自动化、物理可信的4D运动合成,显著提升生成多样性与物理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16637 2026-08-18 cs.AI 新提交 87%

PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning

PDDLCoder:用于LLM辅助符号规划的智能体式PDDL生成工具

Veit Laule, Jiangtao Shuai, Manfred Hauswirth, Sonja Schimmler

机构 * Technical University of Berlin(柏林工业大学) Fraunhofer FOKUS(弗劳恩霍夫FOKUS研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出智能体式PDDL生成框架PDDLCoder,引入含711个问题的NL-pddlgym基准,其在测试集上可生成89.6%可执行规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13612 2026-08-17 cs.AI cs.SE 新提交 87%

SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data

SemPlan:面向企业数据的基于大语言模型(LLM)查询的结构化语义规划基准测试

Bruno Santos Teixeira

机构 * Universidade Federal de Ouro Preto (UFOP)(欧鲁普雷图联邦大学(UFOP))

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究构建了SemPlan基准测试,对比四种架构在企业数据LLM查询语义规划中的表现,发现结构化语义规划架构(A3)正确率最高,不同架构在正确率、策略合规性、成本等方面存在权衡。

Comments 11 pages, 3 figures, 9 tables. Submitted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13221 2026-08-14 cs.AI 新提交 87%

TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

TsuGO:通过围棋死活问题探究大语言模型推理中的搜索效率

Shunwen Bai, Ziping Ma, Chaoyang Zhang, Yarong Wang, Jiale Liu, Zhen Qin, Qingpei Guo

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究提出围棋死活问题基准TsuGO,发现现有LLM的推理搜索组织能力远逊于神经引导的KataGo,指出搜索组织是LLM推理评估的缺失维度。

Comments 23 pages, 12 figures, 20 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 87%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12197 2026-08-13 eess.SY cs.AI cs.SY 新提交 87%

NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

NetlistBench:评估大型语言模型在SPICE网表识别与操作中的可靠性

Jiarui Ma, Jianghan Wang, Yuheng Ma, Ziyi Zhuang, Xiaoguang Liu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLMs在SPICE网表识别与操作中的可靠性,构建含2342个案例的NetlistBench基准,发现其性能随结构复杂度变化,为电路设计自动化提供关键瓶颈参考。

Comments accepted by MLCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10843 2026-08-12 cs.AI 新提交 87%

Hypothesis Frontier: Verifier Guided LLM and Symbolic Search for First-Order Induction

假设前沿:验证器引导的大语言模型与符号搜索用于一阶归纳

Serafim Batzoglou

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究提出Hypothesis Frontier框架,结合LLM与符号搜索,在匹配条件下比重复原始提示生成解决更多一阶归纳问题,还可简化所得公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10483 2026-08-12 cs.AI cond-mat.mtrl-sci 新提交 87%

Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning

基于动态少样本学习的大语言模型预测双钙钛矿的空间群

Jongwon Park, Inhyo Lee, Junhyeong Lee, Seunghwa Ryu

专题命中 推理与问题求解 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI

AI总结 该研究提出基于LLM智能体的DyRIS框架,通过动态少样本检索与规则引导推理,在不平衡双钙钛矿数据集上提升了空间群预测的整体及少数类性能,验证了领域知识与LLM结合的有效性。

Comments 46 pages, 6 figures, Supplementary Information included(24 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09857 2026-08-11 cs.RO cs.AI 新提交 87%

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

智能体 harness:面向机器人自主的大语言模型驱动验证层

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

机构 * Carnegie Mellon University(卡内基梅隆大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。

Comments 7 pages. Not yet finalized for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09253 2026-08-11 cs.AI 新提交 87%

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07813 2026-08-11 cs.AI 新提交 87%

When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines

当评判者不应做决定时:证据锁定的非补偿选择界限在推理流程中限制大语言模型评判者的失效

Yiyao Zhang, Diksha Goel, Hussain Ahmad, Shixun Huang, Jun Shen

机构 * School of Computing and Information Technology, University of Wollongong(伍伦贡大学计算与信息技术学院) CSIRO’s Data61(联邦科学与工业研究组织Data61研究院) School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息技术学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对推理流程中的LLM评判者,提出证据锁定的非补偿规则EL-DGR,在不改变评判者等条件下提升了GSM8K和HotpotQA任务性能,发现应限制评判者影响范围而非提升其准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06811 2026-08-10 cs.SE cs.AI 新提交 87%

Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

在软件问题解决的大语言模型智能体中耦合规划与情景记忆

Jiahao Zhang, Yifan Zhang, Yu Huang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04265 2026-08-06 cs.MA cs.AI cs.SY eess.SY 新提交 87%

Strategic Evaluation of Planning Strategies for LLM Agents in Cyber-Physical Systems

网络物理系统中大语言模型智能体规划策略的战略评估

J. de Curtò, I. de Zarzà

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对网络物理系统,构建含40个异构产消者的智能电网基准,评估4种LLM规划架构,发现架构影响结果,应用截止可行性可显著降低遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02026 2026-08-04 cs.AI 新提交 87%

HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning

HPFA:基于超图的大语言模型推理配对失败归因

Runchuan Zhu, Hongbin Lai, Bowen Jiang, Junrui Zhang, Zhangheng LI, Ostap Kilbasovych, Junyuan Hong

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28890 2026-08-03 cs.HC cs.AI 新提交 87%

Agreement Is Not Quality: Blind Expert Verification of Human and LLM Qualitative Coding When Human Consensus Is Not Ground Truth

一致性并非质量:当人类共识并非真值时,对人类与大语言模型定性编码的盲专家验证

Alex Liu, Lief Esbenshade, Michael Xiao, Victor Tian, Zachary Zhang, Kevin He, Min Sun

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究发现以人类共识为标准的一致性评估无法准确衡量LLM定性编码质量,盲专家验证显示部分LLM编码优于人类,提出了可迁移的验证协议与编码分工框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28636 2026-08-03 cs.CL cs.CY 新提交 87%

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计

Qian Wang, Zhanzhi Lou, Zhenheng Tang, Nuo Chen, Bingsheng He

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28460 2026-07-31 cs.LG cs.CR 新提交 87%

Cybersecurity Detection Classification with Reasoning-enabled Language Models

基于推理增强语言模型的网络安全检测分类

Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 该研究针对SOC警报疲劳问题,训练了思维链推理增强的分类器及校准器,在Windows终端检测任务上提升了良性与恶意召回率,且30B微调模型优于通用大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18915 2026-07-22 cs.CL 新提交 87%

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化

Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15957 2026-07-20 cs.CL 新提交 87%

From Plausible to Actionable: A Position on LLM Self-Explanations

从似是而非到可付诸行动:关于大语言模型自我解释的立场

Elize Herrewijnen, Benedetta Muscato, Gizem Gezici, Fosca Giannotti

机构 * Utrecht University(乌得勒支大学) Scuola Normale Superiore(高等师范学校) University of Pisa(比萨大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 探讨大语言模型自我解释,指出其虽看似合理但忠实性存疑。从传统可解释人工智能角度识别评估局限,提出评估合理性与忠实性的指南,并强调评估应拓展到可操作性及相关应用,以支持不同利益相关者的明智决策和适当行动。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12177 2026-07-15 cs.AI cs.CV 新提交 87%

The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning

地理空间基础模型的新兴范式:从预训练到智能推理

Shelley Cazares

机构 * Google Public Sector(谷歌公共部门)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究地理空间基础模型的新兴范式,通过职责分离实现预训练与特定任务微调,探讨不同类型模型能力及实现考虑因素,提出模型适应策略分类法和框架,展望智能地理空间推理推动领域从感知到认知的发展。

Comments 18 pages, 4 figures. To appear in Lecture Notes in Computer Science (LNCS)

Journal ref Lecture Notes in Computer Science, Vol. 16446 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05573 2026-07-08 cs.AI cs.CE 新提交 87%

Foundation Models for Automatic CAD Generation

用于自动CAD生成的基础模型

J de Curtò, Victoria Guillén, I. de Zarzà

机构 * BARCELONA Supercomputing Center(巴塞罗那超级计算中心) Universidad Pontificia Comillas(庞培法布拉大学) Chung-Ang University(中央大学) LUXEMBOURG Institute of Science and Technology(卢森堡科学技术研究所)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究利用统一评估管道和基准,对用于机械零件自动CAD生成的基础模型展开实证。介绍LLMForge框架,通过两种批判机制评估七个基础模型,展示了紧凑模型的效果,以及VLM批判的作用,还探讨了相关设计及影响。

Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32025 2026-07-01 cs.CL 新提交 87%

Generative Skill Composition for LLM Agents

面向LLM智能体的生成式技能组合

Xinyu Zhao, Zhen Tan, Vaishnav Tadiparthi, Nakul Agarwal, Kwonjoon Lee, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Honda Research Institute USA(本田美国研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SkillComposer方法,将技能组合形式化为任务条件技能序列预测,通过约束自回归解码器联合决定技能子集、数量和顺序,在真实技能库上训练并验证其提升下游任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23387 2026-06-29 cs.CL 新提交 87%

Self-Stigma Is Not a Monolith, but Generic Empathy Is: Persona-Conditioned LLM Support for People Who Use Drugs

自我污名并非单一概念,但通用共情是:面向吸毒者的人物条件化LLM支持

Layla Bouzoubaa, Rezvaneh Rezapour

机构 * Department of Information Science(信息科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 针对吸毒者自我污名表达异质性问题,提出基于潜在剖面分析的四人物类型学,并用序列贝叶斯和循环神经网络从有限发帖历史中恢复人物类型,发现人物匹配响应虽能实现行为转变,但临床专家更偏好通用共情。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17524 2026-06-29 cs.LG 新提交 87%

Learning to Refine Hidden States for Reliable LLM Reasoning

学习精炼隐藏状态以实现可靠的LLM推理

Chia-Hsuan Hsu, Jui-Ming Yao

机构 * Tongyu0924

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ReLAR框架,通过强化学习引导的潜在状态精炼,自适应调整推理步数和方向,提升复杂多步推理的准确性和稳定性,降低推理开销。

Comments Code is available at tongyu0924/Learning-to-Refine-Hidden-States

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26981 2026-06-26 cs.RO cs.AI 新提交 87%

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

上下文模型预测生成:从语言模型到物理的开放词汇运动合成

Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24420 2026-06-24 cs.CL 新提交 87%

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

超越Logprobs:基于LLM的文档字段提取的多信号置信度引擎

Nitesh Kumar

机构 * Perfios Software Solutions Pvt. Ltd.(Perfios软件解决方案私人有限公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ExtractConf,通过双视角文档解析(字段引导与文档引导)的不一致性,融合多信号实现高可靠置信度估计,在DocILE上AUC达0.928,准确率99.1%。

Comments Extended version of a paper accepted (Oral) at the RobustifAI Workshop, IJCAI-ECAI 2026, Bremen, Germany. 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22570 2026-06-23 cs.CL 新提交 87%

What are Key Factors for Updates in RL for LLM Reasoning?

RL提升LLM推理能力的关键更新因素是什么?

Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15633 2026-06-18 cs.LG 新提交 87%

Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning

形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理

Donald Loveland, Puja Trivedi, Ari Weinstein, Edward W Huang, Danai Koutra

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17514 2026-06-17 cs.SE cs.AI 新提交 87%

Unlocking LLM Code Correction with Iterative Feedback Loops

解锁大语言模型代码修正的迭代反馈循环

Le Zhang, Suresh Kothari

机构 * Iowa State University(爱荷华州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过执行反馈迭代修正代码的能力,提出评估指标并分析推理与非推理模型在利用反馈上的差异,发现推理模型显著优于非推理模型,且语法和运行时错误比逻辑错误更易修正。

Comments 22 pages, 14th Computing Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏