arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 160 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 18 篇

2607.15439 2026-08-28 cs.AI 版本更新 57%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-08-28 cs.AI cs.NE 版本更新 57%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments Major revisions are going to be implemented and the paper will be restored later

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14586 2026-08-28 cs.IR cs.AI 版本更新 57%

CPGRec+: A Balance-oriented Framework for Personalized Video Game Recommendations

CPGRec+: 一种面向个性化视频游戏推荐的平衡框架

Xiping Li, Aier Yang, Jianghong Ma, Kangzhe Liu, Shanshan Feng, Haijun Zhang, Yi Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CPGRec+框架,通过引入偏好引导边加权和表示生成模块,解决传统推荐系统在准确率与多样性间的平衡问题,实验表明其在Steam数据集上表现更优。

Comments Published in ACM Transactions on Information Systems (TOIS). 43 pages, 9 figures

Journal ref ACM Trans. Inf. Syst. 44, 3, Article 66 (March 2026), 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09215 2026-08-28 cs.CL eess.AS 版本更新 57%

SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models

SPAR-K:调度周期性交替早退用于语音语言模型

Hsiao-Ying Huang, Cheng-Han Chiang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 SPAR-K通过调度周期性交替早退机制,提升语音语言模型的推理效率,同时保持感知质量,减少解码深度并优化性能。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-08-28 cs.AI 版本更新 57%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22893 2026-08-28 cs.HC cs.AI 版本更新 57%

Toward a New Science of AI as Cognitive Infrastructure

迈向作为认知基础设施的人工智能新科学

Giuseppe Riva

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出跨学科领域认知基础设施研究(CIS),将AI视为认知基础设施,通过创新方法论研究其对人类认知、公共推理等的潜意识影响,填补多学科缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26715 2026-08-28 cs.HC 新提交 50%

RegulAR: Graph-Grounded Error Recognition and Assistance for Procedural Tasks in AR

RegulAR:面向增强现实中流程任务的基于图的错误识别与辅助

Yi-Lin Ye, Jindu Wang, Hiu Tung Wong, Shuchang Xu, Huamin Qu, Wong Kam-Kwai

专题命中 其他推理 :reasoning(abstract)

AI总结 RegulAR是一款结合分层依赖图与MLLM的AR任务助手,可识别流程任务错误并提供恢复指导,在被试内研究中被证实比仅用MLLM的基线系统更能帮助用户理解任务结构与恢复任务。

Comments 16 pages, 7 figures. Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26316 2026-08-28 cs.SE 新提交 50%

When Review Alone No Longer Scales: Layered Supervision in AI-Assisted Software Engineering

当仅靠代码审查不再能扩展时:AI辅助软件工程中的分层监督

Markus Stolze, Mirco Strässle

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对AI辅助软件工程中审查护栏无法应对高吞吐量代码生成的问题,提出将监督工作分配至预防性、可执行护栏及人工监督的分层监督模式,实现监督负荷的分散。

Comments Accepted for publication at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Software Engineering in Practice (SEIP) Track, https://conf.researchr.org/track/eseiw-2026/eseiw-2026-esem---seip-track. 13 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17316 2026-08-28 cs.IR 版本更新 50%

Empowering Compact LLMs with Fusion of Layer-wise Exits for Recommendation

融合分层出口的紧凑型大语言模型推荐系统

Xurong Liang, Tong Chen, Quoc Viet Hung Nguyen, Jianxin Li, Xiangliang Zhang, Hongzhi Yin

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出FLEXRec框架,通过在紧凑型LLM的Transformer层插入预测头并自适应融合,结合AC-Router与目标k铰链损失,在三个数据集上以Qwen 3 1.7B和Llama 3.2 3B实现紧凑型主干方法中最优准确率且效率高。

Comments Accepted by ICDM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02475 2026-08-28 cs.SE 版本更新 50%

Lost in Code Generation: Reimagining the Role of Software Models in AI-driven Software Engineering

在代码生成中迷失:重新构想软件模型在AI驱动软件工程中的作用

Jürgen Cito, Dominik Bork

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对AI生成软件存在的缺陷,提出从AI生成系统中恢复软件模型,区分智能体与人类反思循环,将软件模型作为连接现有软件工程与AI驱动开发的桥梁,拓展了软件模型的作用。

Comments New version accepted at MODELS'26

详情

展开后加载摘要…

URL PDF HTML 收藏