arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-24 至 2026-08-24 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 2 篇

2608.01347 2026-08-24 cs.CL 版本更新 79%

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-08-24 cs.CR cs.SE 版本更新 78%

MalSkills: Detecting Malicious Skills in the Agentic Supply Chain via Neuro-symbolic Reasoning

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏