arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-04 至 2025-12-04 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2512.03244 2025-12-04 cs.LG cs.AI cs.CL 83%

SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning

SPARK:基于过程的奖励机制用于无参考强化学习

Salman Rahman, Sruthi Gorantla, Arpit Gupta, Swastik Roy, Nanyun Peng, Yang Liu

机构 * Amazon AGI(亚马逊人工智能实验室) UCLA(大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03099 2025-12-04 quant-ph cs.AI cs.LG 62%

QGShap: Quantum Acceleration for Faithful GNN Explanations

QGShap:用于忠实图神经网络解释的量子加速

Haribandhu Jena, Jyotirmaya Shivottam, Subhankar Mishra

机构 * School of Computer Sciences(计算机科学学院) National Institute of Science Education and Research(国家科学教育与研究 institute) An OCC of Homi Bhabha National Institute, India(印度霍米·巴哈瓦国家研究所的分支)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 QGShap通过量子计算实现图神经网络解释的加速,提供精确且高效的Shapley值计算,提升解释的保真度和准确性。

Comments Accepted in the QC+AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12482 2025-12-04 cs.SE cs.AI cs.CE cs.LG 62%

Kodezi Chronos: A Debugging-First Language Model for Repository-Scale Code Understanding

Kodezi Chronos:面向仓库级代码理解的调试优先语言模型

Ishraq Khan, Assad Chowdary, Sharoz Haseeb, Urvish Patel, Yousuf Zaii

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Kodezi Chronos-1是一种专为调试设计的语言模型,通过自适应图引导检索、持久调试内存和七层架构,在多文件调试任务中达到67.3%的修复准确率,超越现有模型并实现仓库特定的高解决率。

Comments 24 figures, 43 tables, 2 algorithms. Extended technical report introducing Chronos-1, a debugging-specific language model. Information available at https://github.com/Kodezi/chronos

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03874 2025-12-04 cs.RO cs.LG 57%

OmniDexVLG: Learning Dexterous Grasp Generation from Vision Language Model-Guided Grasp Semantics, Taxonomy and Functional Affordance

OmniDexVLG: 从视觉语言模型引导的抓取语义、分类法和功能可及性中学习灵巧抓取生成

Lei Zhang, Diwen Zheng, Kaixin Bai, Zhenshan Bing, Zoltan-Csaba Marton, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * University of Hamburg(汉堡大学) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 OmniDexVLG通过多模态语义推理和统一视觉语言模型,实现从自然语言指令中生成多样且语义连贯的灵巧抓取。

Comments Project Website: https://sites.google.com/view/omnidexvlg, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03097 2025-12-04 cs.CR cs.LG cs.MA 57%

Many-to-One Adversarial Consensus: Exposing Multi-Agent Collusion Risks in AI-Based Healthcare

多对一对抗共识:揭示基于AI的医疗保健中多智能体合谋的风险

Adeela Bashir, The Anh han, Zia Ush Shamszaman

机构 * School of Computing, Engineering and Digital Technologies(计算、工程与数字技术学院) Teesside University(泰赛德大学) Center for Digital Innovation(数字创新中心)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本研究揭示了基于AI的医疗保健中多智能体合谋的风险,提出了一种轻量级防御机制以确保临床指南的准确性。

Comments 7 pages Conference level paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10746 2025-12-04 cs.CL 57%

RECAP: Transparent Inference-Time Emotion Alignment for Medical Dialogue Systems

RECAP:医疗对话系统中透明的推理时间情感对齐

Adarsh Srinivasan, Jacob Dineen, Muhammad Umar Afzal, Muhammad Uzair Sarfraz, Irbaz B. Riaz, Ben Zhou

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 RECAP通过结构化情感推理提升医疗对话系统的情感响应质量,实现透明和可审计的同理心沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏