arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 5 篇

2601.17716 2026-01-27 cs.LG 83%

Do Reasoning Models Ask Better Questions? A Formal Information-Theoretic Analysis on Multi-Turn LLM Games

推理模型会提出更好的问题吗?多轮LLM游戏中的信息论分析

Daniel M. Pedrozo, Telma W. de L. Soares, Bryan L. M. de Oliveira

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出多轮对话框架,通过信息增益评估LLM在地理游戏中提问效率,发现具有推理能力的模型在部分可观察环境下表现更优。

Comments Presented at the NeusymBridge Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18880 2026-01-27 cs.AI 79%

Challenges for Generative AI in Legal Reasoning

生成AI在法律推理中的挑战

Eljas Linna, Tuula Linna

机构 * Tampere University(塔尔库大学) University of Helsinki(赫尔辛基大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文探讨了生成AI在法律推理中的关键挑战,分析了现有AI技术在处理法律问题中的局限性,并提出分阶段采用技术以提升法律推理的严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12869 2026-01-27 cs.LG cs.AI cs.DC cs.IT cs.MA math.IT 62%

On the Fundamental Limits of LLMs at Scale

在大规模下的大语言模型根本限制

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zeeshan Memon, Muhammad Ibtsaam Qadir, Sagnik Bhattacharya, Hassan Rizwan, Abhiram R. Gorle, Maahe Zehra Kazmi, Nukhba Amir, Ali Subhan, Muhammad Usman Rafique, Zihao He, Pulkit Mehta, Muhammad Ali Jamshed, John M. Cioffi

机构 * Stanford University(斯坦福大学) The University of Oklahoma(俄克拉荷马大学) Emory University(埃默里大学) Purdue University(普渡大学) UC Riverside(加州大学河滨分校) UC Berkeley(加州大学伯克利分校) Khyber Medical University(克希伯医学大学) Universtat Pompeu Fabra(庞培法华大学) Zoox(Zoox公司) Meta Google DeepMind(谷歌DeepMind) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Glasgow(格拉斯哥大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大规模大语言模型的根本限制,提出统一框架分析计算、信息和学习的基础限制,并提供缓解方法。

Comments Submitted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22846 2026-01-27 cs.LG cs.AI cs.LO cs.SE 62%

RocqStar: Leveraging Similarity-driven Retrieval and Agentic Systems for Rocq generation

RocqStar: 利用相似性驱动检索与智能体系统进行Rocq生成

Andrei Kozyrev, Nikita Khramov, Gleb Solovev, Anton Podkopaev

机构 * JetBrains Research(JetBrains研究)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 RocqStar通过结合相似性驱动检索和智能体系统,显著提升Rocq证明生成的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20082 2026-01-27 cs.AI cs.CY 57%

Evolution of AI in Education: Agentic Workflows

人工智能在教育中的演变:代理工作流

Firuz Kamalov, David Santandreu Calonge, Linda Smail, Dilshod Azizov, Dimple R. Thadani, Theresa Kwong, Amara Atif

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本研究探讨了AI代理在教育中的应用,提出多代理框架用于自动评分,并指出其在一致性上的优势及需进一步研究的可解释性问题。

Comments made the abstract more succinct, revised the methodology, added PRISMA flow chart, updated references

详情

展开后加载摘要…

URL PDF HTML 收藏