arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-10 至 2025-11-10 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4 篇

2511.04902 2025-11-10 cs.LG cs.AI 84%

You Need Reasoning to Learn Reasoning: The Limitations of Label-Free RL in Weak Base Models

Shuvendu Roy, Hossein Hajimirsadeghi, Mengyao Zhai, Golnoosh Samei

机构 * Sea AI Lab(海思人工智能实验室) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: MATH-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05636 2025-11-10 cs.LG cs.AI 62%

Graph Learning

Feng Xia, Ciyuan Peng, Jing Ren, Falih Gozi Febrinanto, Renqiang Luo, Vidya Saikrishna, Shuo Yu, Xiangjie Kong

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 185 pages

Journal ref Foundations and Trends in Signal Processing, Vol. 19, No. 4, pp 371-551. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05286 2025-11-10 cs.CL 57%

Reflective Personalization Optimization: A Post-hoc Rewriting Framework for Black-Box Large Language Models

Teqi Hao, Xioayu Tan, Shaojie Shi, Yinghui Xu, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05000 2025-11-10 cs.IR cs.AI 57%

Query Generation Pipeline with Enhanced Answerability Assessment for Financial Information Retrieval

Hyunkyu Kim, Yeeun Yoo, Youngjun Kwak

机构 * Kakaobank Seongnam-si Republic of Korea(韩国首尔市韩国 Kakao银行)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments Accepted(Oral) by ICAIF 2025. Hyunkyu Kim and Yeeun Yoo contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 13 篇

2511.05184 2025-11-10 cs.CL 89%

Effectiveness of Chain-of-Thought in Distilling Reasoning Capability from Large Language Models

Cong-Thanh Do, Rama Doddipatla, Kate Knill

机构 * Cambridge Research Laboratory, Toshiba Europe Ltd.(东京电讯欧洲有限公司剑桥研究实验室) Department of Engineering, University of Cambridge(剑桥大学工程系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

Comments In proceedings of the 18th International Natural Language Generation Conference (INLG 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15144 2025-11-10 cs.AI cs.CL cs.CY 81%

HugAgent: Benchmarking LLMs for Simulation of Individualized Human Reasoning

Chance Jiajie Li, Zhenze Mo, Yuhan Tang, Ao Qu, Jiayi Wu, Kaiya Ivy Zhao, Yulu Gan, Jie Fan, Jiangbo Yu, Hang Jiang, Paul Pu Liang, Jinhua Zhao, Luis Alberto Alonso Pastor, Kent Larson

机构 * MIT Media Lab(MIT媒体实验室) MIT EECS(MIT电子工程与计算机科学系) MIT BCS(MIT生物科学系) MIT IDSS(MIT国际设计系统研究所) MIT CEE(MIT土木与环境工程系) MIT DUSP(MIT设计学教授职位) MIT Architecture(MIT建筑系) Northeastern University(东北大学) Brown University(布朗大学) McGill University(麦吉尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments To appear in NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models (LAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23247 2025-11-10 cs.CL 79%

P-ReMIS: Pragmatic Reasoning in Mental Health and a Social Implication

Sneha Oram, Pushpak Bhattacharyya

机构 * Sneha Oram(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18069 2025-11-10 cs.LO 78%

$\text{C}^2\text{P}$: Featuring Large Language Models with Causal Reasoning

Abdolmahdi Bagheri, Matin Alinejad, Mahdi Dehshiri, Kevin Bello, Alireza Akhondi-Asl

专题命中 推理评测 :reasoning(title,abstract)

Comments arXiv admin note: text overlap with arXiv:2306.05836 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11137 2025-11-10 cs.CL 70%

Scalable Medication Extraction and Discontinuation Identification from Electronic Health Records Using Large Language Models

Chong Shao, Douglas Snyder, Chiran Li, Bowen Gu, Kerry Ngan, Chun-Ting Yang, Jiageng Wu, Richard Wyss, Kueiyu Joshua Lin, Jie Yang

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16395 2025-11-10 cs.LG cs.AI cs.CL cs.HC 67%

AIRepr: An Analyst-Inspector Framework for Evaluating Reproducibility of LLMs in Data Science

Qiuhai Zeng, Claire Jin, Xinyue Wang, Yuhan Zheng, Qunhua Li

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University(卡内基梅隆大学) International Monetary Fund(国际货币基金组织)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to 2025 EMNLP findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05040 2025-11-10 cs.CL cs.AI cs.SE 62%

UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian

Mykyta Syromiatnikov, Victoria Ruvinskaya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 5 figures. XI International conference "Informatics. Culture. Technique." (2025)

Journal ref XI International conference "Informatics. Culture. Technique." (2025) 308-314

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04705 2025-11-10 cs.CL cs.AI 62%

POLIS-Bench: Towards Multi-Dimensional Evaluation of LLMs for Bilingual Policy Tasks in Governmental Scenarios

Tingyue Yang, Junchi Yao, Yuhui Guo, Chang Liu

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03279 2025-11-10 cs.LG cs.AI stat.ML 62%

Conformal Information Pursuit for Interactively Guiding Large Language Models

Kwan Ho Ryan Chan, Yuyan Ge, Edgar Dobriban, Hamed Hassani, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03265 2025-11-10 cs.LG cs.AI 62%

Cognitive Edge Computing: A Comprehensive Survey on Optimizing Large Models and AI Agents for Pervasive Deployment

Xubin Wang, Qing Li, Weijia Jia

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16470 2025-11-10 cs.IR cs.CL cs.CV 57%

Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering

Kuicai Dong, Yujing Chang, Shijie Huang, Yasheng Wang, Ruiming Tang, Yong Liu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Paper accepted to NeurIPS 2025 DB

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04824 2025-11-10 cs.SE 50%

Agentic Refactoring: An Empirical Study of AI Coding Agents

Kosei Horikawa, Hao Li, Yutaro Kashiwa, Bram Adams, Hajimu Iida, Ahmed E. Hassan

专题命中 推理评测 :planning(abstract)

Comments 23 pages, 7 Tables, 5 Figuress, Submitted to ACM Transactions on Software Engineering and Methodology(TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00383 2025-11-10 cs.CE 50%

STARC-9: A Large-scale Dataset for Multi-Class Tissue Classification for CRC Histopathology

Barathi Subramanian, Rathinaraja Jeyaraj, Mitchell Nevin Peterson, Terry Guo, Nigam Shah, Curtis Langlotz, Andrew Y. Ng, Jeanne Shen

专题命中 推理评测 :planning(abstract)

Comments 37 pages, 18 figures, Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 3 篇

2511.03929 2025-11-10 cs.LG cs.AI cs.CV 62%

NVIDIA Nemotron Nano V2 VL

NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Guo Chen, Karan Sapra, Zhiding Yu, Adi Renduchintala, Charles Wang, Peter Jin, Arushi Goel, Mike Ranzinger, Lukas Voegtle, Philipp Fischer, Timo Roman, Wei Ping, Boxin Wang, Zhuolin Yang, Nayeon Lee, Shaokun Zhang, Fuxiao Liu, Zhiqi Li, Di Zhang, Greg Heinrich, Hongxu Yin, Song Han, Pavlo Molchanov, Parth Mannan, Yao Xu, Jane Polak Scowcroft, Tom Balough, Subhashree Radhakrishnan, Paris Zhang, Sean Cha, Ratnesh Kumar, Zaid Pervaiz Bhat, Jian Zhang, Darragh Hanley, Pritam Biswas, Jesse Oliver, Kevin Vasques, Roger Waleffe, Duncan Riach, Oluwatobi Olabiyi, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Pritam Gundecha, Khanh Nguyen, Alexandre Milesi, Eugene Khvedchenia, Ran Zilberstein, Ofri Masad, Natan Bagrov, Nave Assaf, Tomer Asida, Daniel Afrimi, Amit Zuker, Netanel Haber, Zhiyu Cheng, Jingyu Xin, Di Wu, Nik Spirin, Maryam Moosaei, Roman Ageev, Vanshil Atul Shah, Yuting Wu, Daniel Korzekwa, Unnikrishnan Kizhakkemadam Sreekumar, Wanli Jiang, Padmavathy Subramanian, Alejandra Rico, Sandip Bhaskar, Saeid Motiian, Kedi Wu, Annie Surla, Chia-Chih Chen, Hayden Wolff, Matthew Feinberg, Melissa Corpuz, Marek Wawrzos, Eileen Long, Aastha Jhunjhunwala, Paul Hendricks, Farzan Memarian, Benika Hall, Xin-Yu Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Krzysztof Pawelec, Michael Evans, Katherine Luna, Jie Lou, Erick Galinkin, Akshay Hazare, Kaustubh Purandare, Ann Guan, Anna Warno, Chen Cui, Yoshi Suhara, Shibani Likhite, Seph Mard, Meredith Price, Laya Sleiman, Saori Kaji, Udi Karpas, Kari Briski, Joey Conway, Michael Lightstone, Jan Kautz, Mohammad Shoeybi, Mostofa Patwary, Jonathen Cohen, Oleksii Kuchaiev, Andrew Tao, Bryan Catanzaro

机构 * NVIDIA

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05406 2025-11-10 cs.CL 57%

Large Language Models for Explainable Threat Intelligence

Tiago Dinis, Miguel Correia, Roger Tavares

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14245 2025-11-10 cs.CV cs.CL 57%

Towards Explainable Fake Image Detection with Multi-Modal Large Language Models

Yikun Ji, Yan Hong, Jiahui Zhan, Haoxing Chen, jun lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

Comments Accepted to ACM MM 2025; 14 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏