arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-16 至 2025-10-16 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2506.13886 2025-10-16 cs.CL cs.AI 81%

Investigating the interaction of linguistic and mathematical reasoning in language models using multilingual number puzzles

Antara Raaghavi Bhattacharya, Isabel Papadimitriou, Kathryn Davidson, David Alvarez-Melis

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Department of Linguistics, Harvard University(哈佛大学语言学系) Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学凯普纳自然与人工智能研究 institute)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21908 2025-10-16 cs.LG cs.AI 81%

Reinforcement Learning for Out-of-Distribution Reasoning in LLMs: An Empirical Study on Diagnosis-Related Group Coding

Hanyin Wang, Zhenbang Wu, Gururaj Kolar, Hariprasad Korsapati, Brian Bartlett, Bryan Hull, Jimeng Sun

机构 * School of Computing and Data Science, UIUC(计算与数据科学学院,UIUC) Mayo Clinic Health System(梅奥诊所健康系统) Mayo Clinic Rochester(梅奥诊所罗切斯特分部) Mayo Clinic Phoenix(梅奥诊所凤凰城分部) Carle Illinois College of Medicine, UIUC(Carle伊利诺伊医学院,UIUC)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13501 2025-10-16 cs.AI 77%

Confidence as a Reward: Transforming LLMs into Reward Models

He Du, Bowen Li, Chengxing Xie, Chang Gao, Kai Chen, Dacheng Tao

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13744 2025-10-16 cs.AI cs.CL cs.LG 75%

Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math

Shrey Pandit, Austin Xu, Xuan-Phi Nguyen, Yifei Ming, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07312 2025-10-16 cs.LG cs.AI 66%

h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning

Sumeet Ramesh Motwani, Alesia Ivanova, Ziyang Cai, Philip Torr, Riashat Islam, Shital Shah, Christian Schroeder de Witt, Charles London

机构 * University of Oxford(牛津大学) Princeton University(普林斯顿大学) Microsoft AI Frontiers(微软人工智能前沿)

专题命中 数学推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments Preprint, 31 pages, 8 figures, long-horizon reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 1 篇

2510.03394 2025-10-16 cs.LG cs.CL 62%

Studying the Korean Word-Chain Game with RLVR: Mitigating Reward Conflicts via Curriculum Learning

Donghwan Rho

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 11 篇

2310.00194 2025-10-16 cs.AI cs.NE 85%

Improving Planning with Large Language Models: A Modular Agentic Architecture

Taylor Webb, Shanka Subhra Mondal, Ida Momennejad

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07882 2025-10-16 cs.RO 82%

Towards Proprioception-Aware Embodied Planning for Dual-Arm Humanoid Robots

Boyu Li, Siyuan He, Hang Xu, Haoqi Yuan, Xinrun Xu, Yu Zang, Liwei Hu, Junpeng Yue, Zhenxiong Jiang, Pengbo Hu, Börje F. Karlsson, Yehui Tang, Zongqing Lu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) AgiBot School of Computer Science, Peking University(北京大学计算机学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12864 2025-10-16 cs.AI cs.CL cs.LG 80%

From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models

Imran Khan

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages. Code and data are available at https://github.com/strongSoda/LITERAL-TO-LIBERAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13363 2025-10-16 cs.CL 79%

D-SMART: Enhancing LLM Dialogue Consistency via Dynamic Structured Memory And Reasoning Tree

Xiang Lei, Qin Li, Min Zhang, Min Zhang

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

Comments 8 pages, 6 figures (main content); 25 pages, 18 figures (total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13062 2025-10-16 physics.med-ph cs.AI 79%

Towards Human-Centric Intelligent Treatment Planning for Radiation Therapy

Adnan Jafar, Xun Jia

机构 * Department of Radiation Oncology(放射肿瘤学系) Molecular Radiation Sciences(分子放射科学) Johns Hopkins University(约翰霍普金斯大学) Baltimore, MD, USA(巴尔的摩,马里兰州,美国)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16494 2025-10-16 cs.CL cs.AI 62%

Can an Individual Manipulate the Collective Decisions of Multi-Agents?

Fengyuan Liu, Rui Zhao, Shuo Chen, Guohao Li, Philip Torr, Lei Han, Jindong Gu

机构 * Tencent Robotics X(腾讯机器人实验室) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·祖斯卓越人工智能学校)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17365 2025-10-16 cs.LG cs.AI 62%

DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning

Chuzhan Hao, Wenfeng Feng, Yuewei Zhang, Hao Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12850 2025-10-16 cs.CY cs.AI 57%

Ethic-BERT: An Enhanced Deep Learning Model for Ethical and Non-Ethical Content Classification

Mahamodul Hasan Mahadi, Md. Nasif Safwan, Souhardo Rahman, Shahnaj Parvin, Aminun Nahar, Kamruddin Nur

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01340 2025-10-16 cs.CL 57%

The Landscape of Arabic Large Language Models (ALLMs): A New Era for Arabic Language Technology

Shahad Al-Khalifa, Nadir Durrani, Hend Al-Khalifa, Firoj Alam

机构 * is a Researcher at iWAN Research Group, King Saud University(iWAN研究组,国王沙特大学) is a Senior Scientist at Qatar Computing Research Institute(卡塔尔计算研究所) is a Professor at King Saud University(国王沙特大学) Head of iWAN Research Group(iWAN研究组)

专题命中 规划推理 :planning(abstract);分类 cs.CL

Comments Accepted at CACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02379 2025-10-16 cs.CV 50%

MedDINOv3: How to adapt vision foundation models for medical image segmentation?

Yuheng Li, Yizhou Wu, Yuxiang Lai, Mingzhe Hu, Xiaofeng Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Emory University School of Medicine(埃默里大学医学院)

专题命中 规划推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07008 2025-10-16 cs.GT cs.MA 50%

Constant-Memory Strategies in Stochastic Games: Best Responses and Equilibria

Fengming Zhu, Fangzhen Lin

专题命中 规划推理 :planning(abstract)

Comments 21 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 4 篇

2507.05258 2025-10-16 cs.CV cs.LG 79%

Spatio-Temporal LLM: Reasoning about Environments and Actions

Haozhen Zheng, Beitong Tian, Mingyuan Wu, Zhenggang Tang, Klara Nahrstedt, Alex Schwing

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

Comments Code and data are available at https://zoezheng126.github.io/STLLM-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14138 2025-10-16 cs.CV cs.AI 79%

ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom

Jingqi Zhou, Sheng Wang, Jingwei Dong, Kai Liu, Lei Li, Jiahui Gao, Jiyue Jiang, Lingpeng Kong, Chuan Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13375 2025-10-16 cs.CV 78%

DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning

Tianyuan Yuan, Yicheng Liu, Chenhao Lu, Zhuoguang Chen, Tao Jiang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学智能技术学部)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12845 2025-10-16 cs.CL cs.AI cs.CV cs.RO 62%

VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages

Jesse Atuhurra, Iqra Ali, Tomoya Iwakura, Hidetaka Kamigaito, Tatsuya Hiraoka

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 4 篇

2510.13804 2025-10-16 cs.CV cs.AI cs.CL 84%

Generative Universal Verifier as Multimodal Meta-Reasoner

Xinchen Zhang, Xiaoying Zhang, Youbin Wu, Yanbin Cao, Renrui Zhang, Ruihang Chu, Ling Yang, Yujiu Yang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22637 2025-10-16 cs.CL cs.AI cs.LG 82%

Variational Reasoning for Language Models

Xiangxin Zhou, Zichen Liu, Haonan Wang, Chao Du, Min Lin, Chongxuan Li, Liang Wang, Tianyu Pang

机构 * Sea AI Lab(海智实验室) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) NUS(新加坡国立大学) RUC(哈尔滨工业大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13651 2025-10-16 cs.LG math.OC 74%

What is the objective of reasoning with reinforcement learning?

Damek Davis, Benjamin Recht

机构 * Department of Statistics and Data Science, The Wharton School, University of Pennsylvania(统计与数据科学系,沃森商学院,宾夕法尼亚大学) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(电气工程与计算机科学系,加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10425 2025-10-16 cs.LG 57%

Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs

Jingyao Wang, Wenwen Qiang, Zeen Song, Changwen Zheng, Hui Xiong

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 11 篇

2505.17244 2025-10-16 cs.CL cs.AI 84%

ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models

Changyi Li, Jiayi Wang, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13214 2025-10-16 cs.AI 83%

Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning

Zehui Ling, Deshu Chen, Yichi Zhang, Yuchen Liu, Xigui Li, Xin Guo, Yuan Cheng

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13002 2025-10-16 cs.AI cs.LG 81%

From Narratives to Probabilistic Reasoning: Predicting and Interpreting Drivers' Hazardous Actions in Crashes Using Large Language Model

Boyou Chen, Gerui Xu, Zifei Wang, Huizhong Guo, Ananna Ahmed, Zhaonan Sun, Zhen Hu, Kaihan Zhang, Shan Bao

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13029 2025-10-16 cs.AI 79%

Toward Reasoning-Centric Time-Series Analysis

Xinlei Wang, Mingtian Tan, Jing Qiu, Junhua Zhao, Jinjin Gu

机构 * University of Sydney(悉尼大学) University of Virginia(弗吉尼亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) INSAIT

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16971 2025-10-16 cs.SD eess.AS 78%

AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning

Yan Rong, Chenxing Li, Dong Yu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent AI Lab(腾讯AI实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏