arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-22 至 2025-12-22 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 8 篇

2505.14886 2025-12-22 cs.CL 79%

Strategic Planning and Rationalizing on Trees Make LLMs Better Debaters

树状规划与理性化使大语言模型成为更好的辩论者

Danqing Wang, Zhuorui Ye, Xinran Zhao, Fei Fang, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL

AI总结 TreeDebater通过引入树状结构提升辩论策略,实现辩论说服力和胜率的显著提升。

Comments 9 main pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03790 2025-12-22 cs.CL cs.LG stat.ML 73%

Sample, Don't Search: Rethinking Test-Time Alignment for Language Models

样本,而非搜索:重新思考语言模型的测试时间对齐

Gonçalo Faria, Noah A. Smith

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10321 2025-12-22 cs.LG stat.ML 70%

Towards Human-Guided, Data-Centric LLM Co-Pilots

面向人类指导、数据导向的LLM协同助手

Evgeny Saveliev, Jiashuo Liu, Nabeel Seedat, Anders Boyd, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 CliMB-DC是一种结合人类指导和数据导向工具的LLM协同助手框架,旨在提升领域专家在复杂数据处理中的能力。

Comments Saveliev, Liu & Seedat contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15068 2025-12-22 cs.LG cs.AI cs.CL 67%

The Semantic Illusion: Certified Limits of Embedding-Based Hallucination Detection in RAG Systems

语义幻觉:基于嵌入的幻觉检测在RAG系统中的认证极限

Debu Sinha

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了基于嵌入的幻觉检测在RAG系统中存在语义幻觉问题,通过符合预测方法发现真实幻觉检测的挑战,证明需通过推理而非表面语义解决。

Comments 12 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17267 2025-12-22 cs.CL cs.AI 62%

AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators

AutoMetrics: 通过自动生成评估器进行近似人类判断

Michael J. Ryan, Yanzhe Zhang, Amol Salunkhe, Yi Chu, Di Xu, Diyi Yang

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 AutoMetrics通过自动生成评估器,在低数据条件下提升与人类评分的相关性,提高Kendall相关性达33.4%,并提供可解释的自动指标工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17488 2025-12-22 cs.CV cs.LG 57%

TwinSegNet: A Digital Twin-Enabled Federated Learning Framework for Brain Tumor Analysis

TwinSegNet: 一种基于数字孪生的联邦学习框架用于脑肿瘤分析

Almustapha A. Wakili, Adamu Hussaini, Abubakar A. Musa, Woosub Jung, Wei Yu

机构 * Department of Computer Science and Information Sciences, Towson University, USA(塔森大学计算机科学与信息科学系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 TwinSegNet通过整合混合ViT-UNet模型与个性化数字孪生,实现了隐私保护的联邦学习框架,用于准确且实时的脑肿瘤分割。

Comments IEEE Virtual Conference on Communications. 4-6 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17250 2025-12-22 cs.AI 57%

Accelerating Multi-modal LLM Gaming Performance via Input Prediction and Mishit Correction

通过输入预测和误位修正加速多模态大语言模型游戏性能

Ziyang Lin, Zixuan Sun, Sanhorn Chen, Xiaoyang Chen, Roy Zhao

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 通过输入预测和误位修正方法,显著降低多模态大语言模型游戏性能的推理延迟,提升整体控制效果。

Comments UIUC 25 Fall CS 498

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17735 2025-12-22 q-bio.NC 50%

Gravity Prior and Temporal Horizon Shape Interceptive Behavior under Active Inference

引力先验与时间地平线塑造主动推断下的拦截行为

Marta Russo, Antonella Maselli, Federico Maggiore, Giovanni Pezzulo

专题命中 规划推理 :planning(abstract)

AI总结 本研究探讨了重力先验和时间地平线对主动推断中拦截行为的影响,发现结合重力和更长预测地平线的策略在准确性与轨迹平滑度上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏