arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-18 至 2025-12-18 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2507.10532 2025-12-18 cs.LG cs.AI cs.CL 82%

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

推理还是记忆?由于数据污染导致强化学习不可靠的结果

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用

Comments 28 pages, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15687 2025-12-18 cs.LG cs.AI 81%

Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning

大语言模型能否引导自身探索?基于梯度引导的强化学习用于大语言模型推理

Zhenwen Liang, Sidi Lu, Wenhao Yu, Kishan Panaganti, Yujun Zhou, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(诺丁汉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 G2RL通过利用模型自身的梯度几何特性,改进大语言模型的推理能力,优于传统探索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15489 2025-12-18 cs.AI 79%

Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision

Nemotron-Math:基于多模式监督的高效长上下文数学推理蒸馏

Wei Du, Shubham Toshniwal, Branislav Kisacanin, Sadegh Mahdavi, Ivan Moshkov, George Armstrong, Stephen Ge, Edgar Minasyan, Feng Chen, Igor Gitman

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Nemotron-Math通过多模式监督和长上下文训练,实现了高效数学推理蒸馏,显著提升数学竞赛任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11495 2025-12-18 cs.LG stat.ML 70%

How Reinforcement Learning After Next-Token Prediction Facilitates Learning

如何在生成下一个标记后使用强化学习促进学习

Nikolaos Tsilivis, Eran Malach, Karen Ullrich, Julia Kempe

机构 * New York University(纽约大学) Harvard University(哈佛大学) FAIR, Meta

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 通过在生成下一个标记后使用强化学习,研究了如何在推理任务中提升模型的学习能力,证明其在预测比特奇偶性等任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18148 2025-12-18 cs.CL cs.AI cs.LG 67%

Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find

haystack中隐藏的针:更小的针对LLM来说更难找到

Owen Bianchi, Mathew J. Koretsky, Maya Willey, Chelsea X. Alvarado, Tanay Nayak, Adi Asija, Nicole Kuznetsov, Mike A. Nalls, Faraz Faghri, Daniel Khashabi

机构 * Center for Alzheimer’s Disease and Related Dementias, NIA, NIH(阿尔茨海默病及相关痴呆症研究中心,国家老龄化研究所,国家卫生研究院) DataTecnica LLC(DataTecnica公司) Johns Hopkins University(约翰霍普金斯大学) Laboratory of Neurogenetics, NIA, NIH(神经遗传学实验室,国家老龄化研究所,国家卫生研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了黄金上下文大小对LLM长上下文问答性能的影响,发现较短的黄金上下文会显著降低模型性能,揭示了上下文长度对模型表现的关键作用。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14954 2025-12-18 cs.CL cs.LG 62%

Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation

跨分词器似然评分算法用于语言模型蒸馏

Buu Phan, Ashish Khisti, Karen Ullrich

机构 * University of Toronto(多伦多大学) Meta AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出跨分词器似然评分算法,通过BPE递归结构解决词汇不匹配问题,提升蒸馏效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14744 2025-12-18 q-fin.CP cs.AI 57%

VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation

VERAFI:通过神经符号策略生成实现验证的代理金融智能

Adewale Akinfaderin, Shreyas Subramanian

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 5 篇

2512.14709 2025-12-18 cs.AI cs.LG 84%

Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning

注意力作为绑定:一种向量符号视角下的Transformer推理

Sahil Rajesh Dhayalkar

机构 * Sahil Rajesh Dhayalkar(独立研究者)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将Transformer的注意力机制视为软向量符号计算,通过向量符号架构视角解释其推理行为,并提出改进架构和训练目标以提升逻辑可靠性和可解释性。

Comments 12 pages with references. Submitted to 'Logical and Symbolic Reasoning in Language Models @ AAAI 2026' conference and is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14989 2025-12-18 cs.CL cs.AI cs.CV 73%

Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams

评估大型语言模型在多模态化学奥林匹克考试中的表现

Yiming Cui, Xin Yao, Yuxuan Qin, Xin Li, Shijin Wang, Guoping Hu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了多种多模态LLM在化学奥林匹克考试中的表现,发现其在多模态融合和科学推理方面存在显著局限,提出通过链式思维提示提升模型性能的方法。

Comments Published at Communications Chemistry

Journal ref Commun. Chem. 8 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15298 2025-12-18 cs.AI cs.CL cs.CY 62%

ChatGPT and Gemini participated in the Korean College Scholastic Ability Test -- Earth Science I

ChatGPT 和 Gemini 参与韩国大学入学考试——地球科学I

Seok-Hyun Ga, Chun-Yen Chang

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了ChatGPT和Gemini在地球科学I考试中的多模态推理能力,发现模型在感知与认知之间存在差距,揭示了AI在科学评估中的局限性。

Comments 23 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01398 2025-12-18 cs.AI 57%

The Need for Verification in AI-Driven Scientific Discovery

人工智能驱动科学发现中的验证需求

Cristina Cornelio, Takuya Ito, Ryan Cory-Wright, Sanjeeb Dash, Lior Horesh

机构 * Samsung AI, Cambridge, UK(三星人工智能,英国坎布里奇) IBM Research, Yorktown Heights, USA(IBM研究院,美国尤里茨山) Imperial Business School, London, UK(帝国商业学院,英国伦敦)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了人工智能驱动科学发现中验证的重要性,指出验证机制是确保科学进步的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04642 2025-12-18 math.LO 50%

Tableaux for epistemic Gödel logic

表格用于知识 Gödel 逻辑

Marta Bílková, Thomas Ferguson, Daniil Kozhemiachenko

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出了一种多智能体知识 Gödel 逻辑,利用表格计算方法解决有效性问题,证明其在不同智能体数量下的复杂性为 PSpace 或 coNP 完全。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 10 篇

2512.15663 2025-12-18 cs.AI cs.CL 81%

Explaining the Reasoning of Large Language Models Using Attribution Graphs

通过归因图解释大语言模型的推理过程

Chase Walker, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09245 2025-12-18 cs.CV 78%

DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving

DriveMLM: 通过行为规划状态对齐多模态大语言模型以实现自动驾驶

Erfei Cui, Wenhai Wang, Zhiqi Li, Jiangwei Xie, Haoming Zou, Hanming Deng, Gen Luo, Lewei Lu, Xizhou Zhu, Jifeng Dai

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 规划推理 :planning(title,abstract)

AI总结 DriveMLM通过多模态大语言模型对齐行为规划状态,提升自动驾驶系统的决策能力与闭环性能。

Comments Accepted to Visual Intelligence

Journal ref Visual Intelligence, Volume 3, article number 22, (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19895 2025-12-18 cs.AI 57%

RPM-MCTS: Knowledge-Retrieval as Process Reward Model with Monte Carlo Tree Search for Code Generation

RPM-MCTS:基于蒙特卡洛树搜索的知识检索作为过程奖励模型用于代码生成

Yuanyuan Lin, Xiangyu Ouyang, Teng Zhang, Kaixin Sui

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 RPM-MCTS通过结合知识检索与蒙特卡洛树搜索,有效评估代码生成过程中的中间步骤,减少错误并提升效率

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15042 2025-12-18 cs.CL cs.IR 57%

DASH: Dialogue-Aware Similarity and Handshake Recognition for Topic Segmentation in Public-Channel Conversations

DASH:对话感知相似性与握手识别用于公共频道对话中的主题分割

Sijin Sun, Liangbin Zhao, Ming Deng, Xiuju Fu

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 DASH-DTS通过对话感知相似性与握手识别技术,提升公共频道对话中主题分割的准确性和鲁棒性,并发布首个海上VHF通信数据集推动相关研究。

Comments Accepted by AAAIW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14910 2025-12-18 cs.AI cs.CY 57%

AgroAskAI: A Multi-Agentic AI Framework for Supporting Smallholder Farmers' Enquiries Globally

AgroAskAI: 一种支持全球小农户提问的多智能体AI框架

Nadine Angela Cantonjos, Arpita Biswas

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AgroAskAI通过多智能体系统为小农户提供气候适应决策支持,支持多语言交互并整合实时数据,提升农业可持续性和决策透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06928 2025-12-18 cs.CY cs.AI 57%

Beyond Tools: Generative AI as Epistemic Infrastructure in Education

超越工具:生成式AI在教育中的认知基础设施

Bodong Chen

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出AI作为认知基础设施的框架,探讨其在教育中对认知能力的影响,指出AI系统可能替代而非维持人类认知实践。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15681 2025-12-18 eess.IV 50%

Radiomics and Clinical Features in Predictive Modelling of Brain Metastases Recurrence

放射组学与临床特征在脑转移瘤复发预测模型中的应用

Ines Faria, Matheus Silva, Crystian Saraiva, Jose Soares, Victor Alves

专题命中 规划推理 :planning(abstract)

AI总结 本研究利用放射组学和临床数据构建模型,预测脑转移瘤复发并探讨辐射剂量差异与复发风险的关系。

Comments 14 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15150 2025-12-18 cs.CR 50%

Policy-Value Guided MDP-MCTS Framework for Cyber Kill-Chain Inference

基于策略-价值的MDP-MCTS框架用于网络杀伤链推断

Chitraksh Singh, Monisha Dhanraj, Ken Huang

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种结合Transformer语义先验与AlphaZero风格MCTS的框架,用于自动推断网络杀伤链,提升入侵路径的语义准确性和操作连贯性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14703 2025-12-18 cs.SI 50%

SEMO: A Socio-Evolutionary Adaptive Optimization Framework for Dynamic Social Network Tie Management

SEMO:一种用于动态社交网络关系管理的社会-进化自适应优化框架

Mohammad Zare

专题命中 规划推理 :planning(abstract)

AI总结 SEMO提出了一种结合强化学习和贝叶斯更新的框架,通过UCB策略优化动态社交网络关系,实现社会适应度最大化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18929 2025-12-18 cs.CV 50%

Human-Centric Open-Future Task Discovery: Formulation, Benchmark, and Scalable Tree-Based Search

以人为中心的开放未来任务发现: formulation、基准和可扩展的树基搜索

Zijian Song, Xiaoxin Lin, Tao Pu, Zhenlong Yuan, Guangrun Wang, Liang Lin

机构 * Zijian Song 1(Song 研究所) Xiaoxin Lin 1(Lin 研究所) Tao Pu 1(Pu 研究所) Zhenlong Yuan 4(Yuan 研究所) Guangrun Wang 1,2,3(Wang 研究所) Liang Lin 1,2,3(Lin 研究所)

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究提出HOTD问题,通过CMAST框架在开放未来任务发现中实现最佳性能,显著超越现有LMMs。

Comments accepted to AAAI 2026, 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 5 篇

2512.15388 2025-12-18 cs.AI 74%

Bilateral Spatial Reasoning about Street Networks: Graph-based RAG with Qualitative Spatial Representations

双重视觉推理关于街道网络:基于图的RAG与定性空间表示

Reinhard Moratz, Niklas Daute, James Ondieki, Markus Kattenbeck, Mario Krajina, Ioannis Giannopoulos

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 本文提出一种基于图的RAG方法,利用定性空间表示提升LLM在行人导航中的路线指引能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22657 2025-12-18 cs.CV cs.AI cs.CL cs.LG 67%

3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model

3DLLM-Mem: 长期空间-时间记忆用于具身3D大语言模型

Wenbo Hu, Yining Hong, Yanjun Wang, Leison Gao, Zibu Wei, Xingcheng Yao, Nanyun Peng, Yonatan Bitton, Idan Szpektor, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 3DLLM-Mem通过引入动态内存管理和融合模型,提升LLMs在复杂3D环境中的长期空间-时间记忆推理与行动能力。

Comments demos at: https://3dllm-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14725 2025-12-18 cs.LG cs.AI 62%

Generative Urban Flow Modeling: From Geometry to Airflow with Graph Diffusion

生成性城市风场建模:从几何到气流的图扩散

Francisco Giral, Álvaro Manzano, Ignacio Gómez, Petros Koumoutsakos, Soledad Le Clainche

机构 * Applied Mathematics Department, ETSIAE-School of Aeronautics, Universidad Politécnica de Madrid(应用数学系、ETSIAE航空学院、马德里理工大学) Microflown Technologies(Microflown技术公司) Computational Science and Engineering Laboratory, Harvard University(计算科学与工程实验室、哈佛大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于图扩散的生成模型,用于在非结构化网格上合成城市风场,通过结合层次图神经网络和分数扩散建模,实现对复杂几何形状的高效风场模拟与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15701 2025-12-18 cs.CV 50%

VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官

Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Zhang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14222 2025-12-18 cs.CV cs.RO 50%

History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation

基于历史增强的双阶段变压器用于空域视觉与语言导航

Xichen Ding, Jianzhe Gao, Cong Pan, Wenguan Wang, Jie Qin

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出HETT框架,通过粗到细的导航流程整合全局环境推理与局部场景理解,提升无人机在大规模城市环境中基于语言指令的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 3 篇

2512.15274 2025-12-18 cs.CL cs.AI 81%

Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning

开篇即胜,半途而废:基于前缀优化的强化学习用于大语言模型推理

Yiliu Sun, Zicheng Zhao, Yang Wei, Yanfang Zhang, Chen Gong

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PPPO通过优化LLM推理的前缀部分,提升推理能力,实验显示其在推理任务中表现更优。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15000 2025-12-18 cs.LG cs.AI cs.CL 67%

DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding

DreamPRM-Code: 一种基于函数作为步骤的进程奖励模型与标签校正用于LLM编码

Ruiyi Zhang, Peijia Qin, Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DreamPRM-Code通过链式函数提示策略和元学习校正机制,提升LLM在编码任务中的表现,达到LiveCodeBench的最高准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15512 2025-12-18 cs.CV cs.MM 50%

VAAS: Vision-Attention Anomaly Scoring for Image Manipulation Detection in Digital Forensics

VAAS:面向数字取证中图像篡改检测的视觉-注意力异常评分

Opeyemi Bamigbade, Mark Scanlon, John Sheppard

机构 * Forensics and Security Research Group, South East Technological University(法医与安全研究组,南东技术大学) Security Research Group, School of Computer Science, University College Dublin(安全研究组,计算机科学学院,都柏林大学学院)

专题命中 测试时计算 :reasoning(abstract)

AI总结 VAAS通过整合视觉注意力和片段一致性评分,提出一种双模块框架用于图像篡改检测,提升检测精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏