arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-20 至 2026-02-20 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5 篇

2602.15868 2026-02-20 cs.CL 79%

Understanding LLM Failures: A Multi-Tape Turing Machine Analysis of Systematic Errors in Language Model Reasoning

理解大语言模型的失败:多带图灵机对语言模型推理系统性错误的分析

Magnus Boman

机构 * Department of Medicine Solna, Division of Clinical Epidemiology, Karolinska Institutet, Stockholm, Sweden(斯德哥尔摩瑞典卡罗林斯卡研究所医学系Solna部临床流行病学 division)

专题命中 其他推理 :reasoning(title);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过多带图灵机分析,揭示了大语言模型推理中的系统性错误,并提出了可检验的理论框架来解释提示技术的有效性与局限性。

Comments 8 pages, 1 page appendix; v2 added Acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16855 2026-02-20 cs.AI cs.CL 62%

Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents

Mobile-Agent-v3.5: 多平台基础图形用户界面代理

Haiyang Xu, Xi Zhang, Haowei Liu, Junyang Wang, Zhaozai Zhu, Shengjie Zhou, Xuhao Hu, Feiyu Gao, Junjie Cao, Zihua Wang, Zhiyuan Chen, Jitong Liao, Qi Zheng, Jiahui Zeng, Ze Xu, Shuai Bai, Junyang Lin, Jingren Zhou, Ming Yan

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GUI-Owl-1.5通过多平台支持和创新算法在GUI任务中取得突破性成绩。

Comments 25 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17452 2026-02-20 cs.CR cs.AI 57%

Jolt Atlas: Verifiable Inference via Lookup Arguments in Zero Knowledge

Jolt Atlas: 通过查找论证实现可验证推断在零知识中

Wyatt Benno, Alberto Centelles, Antoine Douchet, Khalil Gibran

机构 * ICME Labs(ICME实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Jolt Atlas是一种零知识机器学习框架,通过查找论证实现可验证推断,支持在内存受限环境中进行流式证明,并适用于隐私和对抗性环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17185 2026-02-20 cs.HC cs.AI 57%

The Bots of Persuasion: Examining How Conversational Agents' Linguistic Expressions of Personality Affect User Perceptions and Decisions

说服的机器人:探讨对话代理的语言性人格表达如何影响用户感知和决策

Uğur Genç, Heng Gu, Chadha Degachi, Evangelos Niforatos, Senthil Chandrasegaran, Himanshu Verma

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了对话代理通过语言表达的人格如何影响用户在慈善捐赠中的感知和决策,发现人格特征显著影响用户信任和捐赠行为。

Comments Accepted to be presented at CHI'26 in Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16844 2026-02-20 cs.HC cs.AI 57%

Overseeing Agents Without Constant Oversight: Challenges and Opportunities

无需持续监督的代理:挑战与机遇

Madeleine Grunde-McLaughlin, Hussein Mozannar, Maya Murad, Jingya Chen, Saleema Amershi, Adam Fourney

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了无需持续监督的代理系统在验证中的挑战与机遇,通过实验发现简化轨迹设计可提高错误发现效率,但未显著提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏