arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-09 至 2025-09-09 共收录 74 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 16 篇

2509.05946 2025-09-09 cs.NI 50%

Large Language Models for Next-Generation Wireless Network Management: A Survey and Tutorial

Bisheng Wei, Ruihong Jiang, Ruichen Zhang, Yinqiu Liu, Dusit Niyato, Yaohua Sun, Yang Lu, Yonghui Li, Shiwen Mao, Chau Yuen, Marco Di Renzo, Mugen Peng

专题命中 规划推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11844 2025-09-09 cs.CV cs.RO 50%

Generative World Explorer

Taiming Lu, Tianmin Shu, Alan Yuille, Daniel Khashabi, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :planning(abstract)

Comments Website: generative-world-explorer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 3 篇

2509.05669 2025-09-09 cs.CV 78%

Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance

Weijie Shen, Xinrui Wang, Yuanqi Nie, Apiradee Boonmee

机构 * Beihua University(白华大学) Kasem Bundit University(Kasem Bundit大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05578 2025-09-09 cs.AI cs.RO 70%

OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision

Ruixun Liu, Lingyu Kong, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究所) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21853 2025-09-09 cs.RO 50%

Skill-Nav: Enhanced Navigation with Versatile Quadrupedal Locomotion via Waypoint Interface

Dewei Wang, Chenjia Bai, Chenhui Li, Jiyuan Shi, Yan Ding, Chi Zhang, Bin Zhao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :planning(abstract)

Comments 17pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 8 篇

2508.15868 2025-09-09 cs.CL cs.AI 90%

CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning

Wenqiao Zhu, Ji Liu, Rongjuncheng Zhang, Haipang Wu, Yulun Zhang

机构 * HiThink Research(HiThink研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 14 pages, to appear in EMNLP25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06870 2025-09-09 cs.CL 70%

The Majority is not always right: RL training for solution aggregation

Wenting Zhao, Pranjal Aggarwal, Swarnadeep Saha, Asli Celikyilmaz, Jason Weston, Ilia Kulikov

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03624 2025-09-09 cs.CL cs.AI cs.LG 67%

Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models

NVIDIA, :, Aaron Blakeman, Aarti Basant, Abhinav Khattar, Adithya Renduchintala, Akhiad Bercovich, Aleksander Ficek, Alexis Bjorlin, Ali Taghibakhshi, Amala Sanjay Deshmukh, Ameya Sunil Mahabaleshwarkar, Andrew Tao, Anna Shors, Ashwath Aithal, Ashwin Poojary, Ayush Dattagupta, Balaram Buddharaju, Bobby Chen, Boris Ginsburg, Boxin Wang, Brandon Norick, Brian Butterfield, Bryan Catanzaro, Carlo del Mundo, Chengyu Dong, Christine Harvey, Christopher Parisien, Dan Su, Daniel Korzekwa, Danny Yin, Daria Gitman, David Mosallanezhad, Deepak Narayanan, Denys Fridman, Dima Rekesh, Ding Ma, Dmytro Pykhtar, Dong Ahn, Duncan Riach, Dusan Stosic, Eileen Long, Elad Segal, Ellie Evans, Eric Chung, Erick Galinkin, Evelina Bakhturina, Ewa Dobrowolska, Fei Jia, Fuxiao Liu, Gargi Prasad, Gerald Shen, Guilin Liu, Guo Chen, Haifeng Qian, Helen Ngo, Hongbin Liu, Hui Li, Igor Gitman, Ilia Karmanov, Ivan Moshkov, Izik Golan, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jarno Seppanen, Jason Lu, Jason Sewall, Jiaqi Zeng, Jiaxuan You, Jimmy Zhang, Jing Zhang, Jining Huang, Jinze Xue, Jocelyn Huang, Joey Conway, John Kamalu, Jon Barker, Jonathan Cohen, Joseph Jennings, Jupinder Parmar, Karan Sapra, Kari Briski, Kateryna Chumachenko, Katherine Luna, Keshav Santhanam, Kezhi Kong, Kirthi Sivamani, Krzysztof Pawelec, Kumar Anik, Kunlun Li, Lawrence McAfee, Leon Derczynski, Lindsey Pavao, Luis Vega, Lukas Voegtle, Maciej Bala, Maer Rodrigues de Melo, Makesh Narsimhan Sreedhar, Marcin Chochowski, Markus Kliegl, Marta Stepniewska-Dziubinska, Matthieu Le, Matvei Novikov, Mehrzad Samadi, Michael Andersch, Michael Evans, Miguel Martinez, Mike Chrzanowski, Mike Ranzinger, Mikolaj Blaz, Misha Smelyanskiy, Mohamed Fawzy, Mohammad Shoeybi, Mostofa Patwary, Nayeon Lee, Nima Tajbakhsh, Ning Xu, Oleg Rybakov, Oleksii Kuchaiev, Olivier Delalleau, Osvald Nitski, Parth Chadha, Pasha Shamis, Paulius Micikevicius, Pavlo Molchanov, Peter Dykas, Philipp Fischer, Pierre-Yves Aquilanti, Piotr Bialecki, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Rabeeh Karimi, Rahul Kandu, Ran El-Yaniv, Raviraj Joshi, Roger Waleffe, Ruoxi Zhang, Sabrina Kavanaugh, Sahil Jain, Samuel Kriman, Sangkug Lym, Sanjeev Satheesh, Saurav Muralidharan, Sean Narenthiran, Selvaraj Anandaraj, Seonmyeong Bak, Sergey Kashirsky, Seungju Han, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Clay, Shelby Thomas, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shyamala Prayaga, Siddhartha Jain, Sirshak Das, Slawek Kierat, Somshubra Majumdar, Song Han, Soumye Singhal, Sriharsha Niverty, Stefania Alborghetti, Suseella Panguluri, Swetha Bhendigeri, Syeda Nahida Akter, Szymon Migacz, Tal Shiri, Terry Kong, Timo Roman, Tomer Ronen, Trisha Saar, Tugrul Konuk, Tuomas Rintamaki, Tyler Poon, Ushnish De, Vahid Noroozi, Varun Singh, Vijay Korthikanti, Vitaly Kurin, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wenliang Dai, Wonmin Byeon, Xiaowei Ren, Yao Xu, Yejin Choi, Yian Zhang, Ying Lin, Yoshi Suhara, Zhiding Yu, Zhiqi Li, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zijia Chen

机构 * NVIDIA

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05007 2025-09-09 cs.AI cs.CL 62%

Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework

Jie Chen, Jinhao Jiang, Yingqian Min, Zican Dong, Shijie Wang, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 1 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05735 2025-09-09 cs.LG cs.AI 62%

Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies

Jiaqi Chen, Ji Shi, Cansu Sancaktar, Jonas Frey, Georg Martius

专题命中 测试时计算 :self-correction(abstract);分类 cs.AI、cs.LG

Comments Accepted at Reinforcement Learning Conference (RLC 2025); Code available at: https://github.com/swsychen/Offline_vs_Online_in_MBRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05385 2025-09-09 cs.CL cs.AI 62%

A Lightweight Framework for Trigger-Guided LoRA-Based Self-Adaptation in LLMs

Jiacheng Wei, Faguo Wu, Xiao Zhang

机构 * SAGE: A Lightweight Framework for Trigger-Guided LoRA-Based Self-Adaptation in LLMs(SAGE:轻量级框架)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17656 2025-09-09 cs.CL 57%

Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs

Hexiang Tan, Fei Sun, Sha Liu, Du Su, Qi Cao, Xin Chen, Jingang Wang, Xunliang Cai, Yuanzhuo Wang, Huawei Shen, Xueqi Cheng

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12583 2025-09-09 cs.CL 57%

Process-Supervised Reward Models for Verifying Clinical Note Generation: A Scalable Approach Guided by Domain Expertise

Hanyin Wang, Chufan Gao, Qiping Xu, Bolun Liu, Guleid Hussein, Hariprasad Korsapati, Mohamad El Labban, Kingsley Iheasirim, Mohamed Hassan, Gokhan Anil, Brian Bartlett, Jimeng Sun

机构 * Mayo Clinic Health System(梅奥诊所健康系统) School of Computing and Data Science, UIUC(UIUC计算与数据科学学院) Carle Illinois College of Medicine, UIUC(UIUC卡勒医学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 7 篇

2412.17727 2025-09-09 cs.CL 83%

Knowledge Editing through Chain-of-Thought

Changyue Wang, Weihang Su, Qingyao Ai, Yichen Tang, Yiqun Liu

专题命中 复杂问题求解 :chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03460 2025-09-09 cs.AI 79%

Multi-Agent Reasoning for Cardiovascular Imaging Phenotype Analysis

Weitong Zhang, Mengyun Qiao, Chengqi Zang, Steven Niederer, Paul M Matthews, Wenjia Bai, Bernhard Kainz

机构 * Department of Computing, Imperial College London, London, UK(帝国理工学院计算机系) Department of Mechanical Engineering, University College London, London, UK(伦敦大学学院机械工程系) Department of Brain Sciences, Imperial College London, London, UK(帝国理工学院脑科学系) Data Science Institute, Imperial College London, London, UK(帝国理工学院数据科学研究所) University of Tokyo, Tokyo, JP(东京大学) National Heart and Lung Institute, Imperial College London, London, UK(帝国理工学院国家心脏和肺研究所) FAU Erlangen-Nürnberg, Erlangen, DE(埃朗根-纽伦堡大学) UK Dementia Research Institute, Imperial College London, London, UK(英国痴呆研究所在伦敦帝国理工学院) Rosalind Franklin Institute, Harwell Science and Innovation Campus, Didcot, UK(罗莎琳德·弗兰克林研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

Comments accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05751 2025-09-09 cs.CV cs.AI 79%

Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation

Bingrui Zhao, Lin Yuanbo Wu, Xiangtian Fan, Deyin Liu, Lu Zhang, Ruyi He, Jialie Shen, Ximing Li

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05741 2025-09-09 cs.CL 77%

Enhancing Factual Accuracy and Citation Generation in LLMs via Multi-Stage Self-Verification

Fernando Gabriela García, Qiyang Shi, Zilin Feng

机构 * Autonomous University of Nuevo León(新莱昂自治大学) Minnan Normal University(闽南师范大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01563 2025-09-09 cs.CV 67%

Kwai Keye-VL 1.5 Technical Report

Biao Yang, Bin Wen, Boyang Ding, Changyi Liu, Chenglong Chu, Chengru Song, Chongling Rao, Chuan Yi, Da Li, Dunju Zang, Fan Yang, Guorui Zhou, Guowang Zhang, Han Shen, Hao Peng, Haojie Ding, Hao Wang, Haonan Fan, Hengrui Ju, Jiaming Huang, Jiangxia Cao, Jiankang Chen, Jingyun Hua, Kaibing Chen, Kaiyu Jiang, Kaiyu Tang, Kun Gai, Muhao Wei, Qiang Wang, Ruitao Wang, Sen Na, Shengnan Zhang, Siyang Mao, Sui Huang, Tianke Zhang, Tingting Gao, Wei Chen, Wei Yuan, Xiangyu Wu, Xiao Hu, Xingyu Lu, Yi-Fan Zhang, Yiping Yang, Yulong Chen, Zeyi Lu, Zhenhua Wu, Zhixin Ling, Zhuoran Yang, Ziming Li, Di Xu, Haixuan Gao, Hang Li, Jing Wang, Lejian Ren, Qigen Hu, Qianqian Wang, Shiyao Wang, Xinchen Luo, Yan Li, Yuhang Hu, Zixing Zhang

机构 * Keye Team, Kuaishou Group(快手集团Keye团队)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

Comments Github page: https://github.com/Kwai-Keye/Keye

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17746 2025-09-09 cs.CL 57%

Fast Quiet-STaR: Thinking Without Thought Tokens

Wei Huang, Yizhe Xiong, Xin Ye, Zhijie Deng, Hui Chen, Zijia Lin, Guiguang Ding

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology (BNRist)(北京信息科学与技术国家研究中心) Kuaishou Technology(快手科技) Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05695 2025-09-09 cs.CV 50%

Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization

Jingwei Peng, Zhixuan Qiu, Boyu Jin, Surasakdi Siripong

机构 * Tianjin Agricultural University(天津农业大学) Walailak University(Walailak大学)

专题命中 复杂问题求解 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 13 篇

2509.06024 2025-09-09 cs.AI 89%

Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL

Haoyang He, Zihua Rong, Kun Ji, Chenyang Li, Qing Huang, Chong Xia, Lan Yang, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06409 2025-09-09 cs.AI 88%

Teaching AI Stepwise Diagnostic Reasoning with Report-Guided Chain-of-Thought Learning

Yihong Luo, Wenwu He, Zhuo-Xu Cui, Dong Liang

机构 * Fujian University of Technology(福建工程学院) Fujian Provincial Key Laboratory of Big Data Mining and Applications(福建省大数据挖掘与应用重点实验室) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(生物医学成像科学与系统重点实验室,中国科学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06169 2025-09-09 cs.LG cs.AI 81%

Reasoning Language Model for Personalized Lung Cancer Screening

Chuang Niu, Ge Wang

机构 * Department of Biomedical Engineering, School of Engineering, Center for Computational Innovations, Center for Biotechnology & Interdisciplinary Studies(生物医学工程系、工程学院、计算创新中心、生物技术与跨学科研究所以及中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06160 2025-09-09 cs.AI cs.CL 81%

Reverse-Engineered Reasoning for Open-Ended Generation

Haozhe Wang, Haoran Que, Qixin Xu, Minghao Liu, Wangchunshu Zhou, Jiazhan Feng, Wanjun Zhong, Wei Ye, Tong Yang, Wenhao Huang, Ge Zhang, Fangzhen Lin

机构 * Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00457 2025-09-09 cs.CL cs.LG 81%

CVPD at QIAS 2025 Shared Task: An Efficient Encoder-Based Approach for Islamic Inheritance Reasoning

Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Hichem Telli, Cosimo Distante, Abdenour Hadid

机构 * University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU) Institute of Applied Sciences and Intelligent Systems – CNR(应用科学与智能系统研究所 – CNR) Laboratory of LESIA, University of Biskra(LESIA实验室,比斯克拉大学) Sorbonne University Abu Dhabi, UAE(阿布扎赫尔索邦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12543 2025-09-09 cs.CV 78%

REVEAL -- Reasoning and Evaluation of Visual Evidence through Aligned Language

Ipsita Praharaj, Yukta Butala, Badrikanath Praharaj, Yash Butala

机构 * Carnegie Mellon University(卡内基梅隆大学) VIT Bhopal(维捷商学院)

专题命中 推理评测 :reasoning(title,abstract)

Comments 4 pages, 6 figures, International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05315 2025-09-09 cs.RO cs.AI cs.CV 70%

Evaluation of Large Language Models for Anomaly Detection in Autonomous Vehicles

Petros Loukas, David Bassir, Savvas Chatzichristofis, Angelos Amanatiadis

机构 * Democritus University of Thrace(德米特里乌斯大学) Dongguan University of Technology(东莞理工大学) ENS-Paris-Saclay University(巴黎-萨克雷大学) Neapolis University Pafos(纳皮奥斯大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15865 2025-09-09 cs.RO cs.AI cs.CL 62%

BeSimulator: A Large Language Model Powered Text-based Behavior Simulator

Jianan Wang, Bin Li, Jingtao Qi, Xueying Wang, Fu Li, Hanxun Li

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10291 2025-09-09 cs.AI cs.CL cs.IR 62%

ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents

Hao Kang, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06464 2025-09-09 cs.AI cs.CL 62%

Transforming Wearable Data into Personal Health Insights using Large Language Model Agents

Mike A. Merrill, Akshay Paruchuri, Naghmeh Rezaei, Geza Kovacs, Javier Perez, Yun Liu, Erik Schenck, Nova Hammerquist, Jake Sunshine, Shyam Tailor, Kumar Ayush, Hao-Wei Su, Qian He, Cory Y. McLean, Mark Malhotra, Shwetak Patel, Jiening Zhan, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 53 pages, 7 main figures, 2 main tables, accepted to Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏