arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-16 至 2025-09-16 共收录 91 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 24 篇

2508.19256 2025-09-16 cs.HC cs.CY 50%

WeDesign: Generative AI-Facilitated Community Consultations for Urban Public Space Design

Rashid Mushkani, Hugo Berard, Shin Koseki

专题命中 规划推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 4 篇

2509.10884 2025-09-16 cs.RO cs.CV 82%

Nav-R1: Reasoning and Navigation in Embodied Scenes

Qingxiang Liu, Ting Huang, Zeyu Zhang, Hao Tang

机构 * Shanghai University of Engineering Science(上海工程技术大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11197 2025-09-16 cs.RO cs.AI cs.CL cs.CV 73%

DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation

Yunheng Wang, Yuetong Fang, Taowen Wang, Yixiao Feng, Yawen Tan, Shuning Zhang, Peiran Liu, Yiding Ji, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang Normal University(浙江师范大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11124 2025-09-16 cs.SD eess.AS 50%

STASE: A spatialized text-to-audio synthesis engine for music generation

Tutti Chi, Letian Gao, Yixiao Zhang

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to LLM4Music @ ISMIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10748 2025-09-16 cs.CV 50%

SCOPE: Speech-guided COllaborative PErception Framework for Surgical Scene Segmentation

Jecia Z. Y. Mao, Francis X Creighton, Russell H Taylor, Manish Sahu

机构 * LCSR, Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 2 篇

2505.00979 2025-09-16 cs.CL cs.AI 79%

Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models

Shengjie Ma, Xuhui Jiang, Chengjin Xu, Cehao Yang, Liyu Zhang, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research, International Digital Economy Academy(IDEA研究所、国际数字经济学院) Gaoling School of Artificial Intelligence, Renmin University of China(法律人工智能学院,中国人民大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11238 2025-09-16 cs.SE 50%

UserTrace: User-Level Requirements Generation and Traceability Recovery from Software Project Repositories

Dongming Jin, Zhi Jin, Yiran Zhang, Zheng Fang, Linyu Li, Yuanpeng He, Xiaohong Chen, Weisong Sun

专题命中 测试时计算 :verifier(abstract)

Comments 21page, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 14 篇

2508.13229 2025-09-16 cs.LG cs.CV 83%

RISE: Enhancing VLM Image Annotation with Self-Supervised Reasoning

Suhang Hu, Wei Hu, Yuhang Su, Fan Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10852 2025-09-16 cs.CL cs.AI 81%

Pre-Storage Reasoning for Episodic Memory: Shifting Inference Burden to Memory for Personalized Dialogue

Sangyeop Kim, Yohan Lee, Sanghwa Kim, Hyunjong Kim, Sungzoon Cho

机构 * Seoul National University(首尔国立大学) Coxwave KAIST(韩国科学技术院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11944 2025-09-16 cs.AI 79%

Agentic Temporal Graph of Reasoning with Multimodal Language Models: A Potential AI Aid to Healthcare

Susanta Mitra

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09448 2025-09-16 cs.AI 79%

TORSO: Template-Oriented Reasoning Towards General Tasks

Minhyuk Kim, Seungyoon Lee, Heuiseok Lim

机构 * Korea University, Republic of Korea(韩国大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19260 2025-09-16 cs.CR 78%

ALRPHFS: Adversarially Learned Risk Patterns with Hierarchical Fast \& Slow Reasoning for Robust Agent Defense

Shiyu Xiang, Tong Zhang, Ronghao Chen

专题命中 复杂问题求解 :reasoning(title,abstract)

Comments EMNLP 2025 findings, 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21773 2025-09-16 cs.CL cs.AI 76%

MAC-Tuning: LLM Multi-Compositional Problem Reasoning with Enhanced Knowledge Boundary Awareness

Junsheng Huang, Zhitao He, Yucheng Huang, Sandeep Polisetty, Qingyun Wang, Yi. R Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UMass Amherst(马萨诸塞大学阿姆赫斯特分校) William & Mary(威廉与玛丽学院)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

Comments We release our code and resource at https://github.com/no-touch-fish/Multi-QA-Tuning. The paper is accepted into EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11766 2025-09-16 cs.RO 67%

Igniting VLMs toward the Embodied Space

Andy Zhai, Brae Liu, Bruno Fang, Chalse Cai, Ellie Ma, Ethan Yin, Hao Wang, Hugo Zhou, James Wang, Lights Shi, Lucy Liang, Make Wang, Qian Wang, Roy Gan, Ryan Yu, Shalfun Li, Starrick Liu, Sylas Chen, Vincent Chen, Zach Xu

机构 * X SQUARE ROBOT

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03562 2025-09-16 cs.LG cs.AI 62%

Kolb-Based Experiential Learning for Generalist Agents with Human-Level Kaggle Data Science Performance

Antoine Grosnit, Alexandre Maraval, Refinath S N, Zichao Zhao, James Doran, Giuseppe Paolo, Albert Thomas, Jonas Gonzalez, Abhineet Kumar, Khyati Khandelwal, Abdelhakim Benechehab, Hamza Cherkaoui, Youssef Attia El-Hili, Kun Shao, Jianye Hao, Jun Yao, Balázs Kégl, Haitham Bou-Ammar, Jun Wang

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12132 2025-09-16 cs.CV cs.CL 57%

Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models

Pu Jian, Junhong Wu, Wei Sun, Chen Wang, Shuo Ren, Jiajun Zhang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments EMNLP2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11903 2025-09-16 stat.AP cs.LG math.ST stat.ME stat.TH 57%

Wavelet-SARIMA-Transformer: A Hybrid Model for Rainfall Forecasting

Junmoni Saikia, Kuldeep Goswami, Sarat C. Kakaty

机构 * Srushti Drushti Geospatial Foundation(斯鲁斯蒂·德鲁斯蒂地理基础)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11626 2025-09-16 cs.SE cs.AI 57%

Automated Creation and Enrichment Framework for Improved Invocation of Enterprise APIs as Tools

Prerna Agarwal, Himanshu Gupta, Soujanya Soni, Rohith Vallam, Renuka Sindhgatta, Sameep Mehta

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11523 2025-09-16 cs.SE 50%

VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection

Ziliang Wang, Ge Li, Jia Li, Hao Zhu, Zhi Jin

专题命中 复杂问题求解 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11447 2025-09-16 cs.CE cs.NA math.NA 50%

Large language model-empowered next-generation computer-aided engineering

Jiachen Guo, Chanwook Park, Dong Qian, Thomas J. R. Hughes, Wing Kam Liu

专题命中 复杂问题求解 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05479 2025-09-16 cs.CV 50%

LATTE: Learning to Think with Vision Specialists

Zixian Ma, Jianguo Zhang, Zhiwei Liu, Jieyu Zhang, Juntao Tan, Manli Shu, Juan Carlos Niebles, Shelby Heinecke, Huan Wang, Caiming Xiong, Ranjay Krishna, Silvio Savarese

机构 * University of Washington(华盛顿大学) Salesforce Research(Salesforce研究)

专题命中 复杂问题求解 :reasoning(abstract)

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 25 篇

2505.14403 2025-09-16 cs.AI cs.LG 84%

Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning

Zhaohui Yang, Yuxiao Ye, Shilei Jiang, Chen Hu, Linjing Li, Shihong Deng, Daxin Jiang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of Technology(北京理工大学) StepFun, China(中国StepFun)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11648 2025-09-16 cs.CL cs.AI cs.CY 81%

EthicsMH: A Pilot Benchmark for Ethical Reasoning in Mental Health AI

Sai Kartheek Reddy Kasu

机构 * IIIT Dharwad(德瓦德理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10744 2025-09-16 cs.CL cs.AI 81%

Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models

Ozan Gokdemir, Neil Getty, Robert Underwood, Sandeep Madireddy, Franck Cappello, Arvind Ramanathan, Ian T. Foster, Rick L. Stevens

机构 * Argonne National Laboratory(阿贡国家实验室) The University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments This manuscript has been accepted for publication at the Supercomputing 25 (SC '25) Conference (Frontiers in Generative AI for HPC Science and Engineering: Foundations, Challenges, and Opportunities Workshop) in St. Louis, MO, USA on November 16th, 2025. It will appear in the SC25 Workshop Proceedings after that date

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04249 2025-09-16 cs.CL 79%

IOLBENCH: Benchmarking LLMs on Linguistic Reasoning

Satyam Goyal, Soham Dan

机构 * University of Michigan(密歇根大学) Microsoft(微软公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11796 2025-09-16 cs.CV 78%

FineQuest: Adaptive Knowledge-Assisted Sports Video Understanding via Agent-of-Thoughts Reasoning

Haodong Chen, Haojian Huang, XinXiang Yin, Dian Shao

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) The University of Hong Kong(香港大学) School of Software, Northwestern Polytechnical University(软件学院,西北工业大学) Unmanned System Research Institute, Northwestern Polytechnical University(无人系统研究院,西北工业大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11071 2025-09-16 cs.CV cs.AI cs.CL 73%

The System Description of CPS Team for Track on Driving with Language of CVPR 2024 Autonomous Grand Challenge

Jinghan Peng, Jingwen Wang, Xing Yu, Dehui Du

机构 * East China Normal University(东华师范大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10345 2025-09-16 cs.CV cs.AI 70%

Towards Understanding Visual Grounding in Visual Language Models

Georgios Pantazopoulos, Eda B. Özyiğit

机构 * The Alan Turing Institute(艾伦·图灵研究所) Heriot-Watt University(赫瑞-沃德大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11026 2025-09-16 cs.AI cs.CL 68%

Rethinking Human Preference Evaluation of LLM Rationales

Ziang Li, Manasi Ganti, Zixian Ma, Helena Vasconcelos, Qijia He, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI;planning(comments)

Comments Published in the XLLM-Reason-Plan Workshop on the Application of LLM Explainability to Reasoning and Planning at COLM 2025

Journal ref Proceedings of the XLLM-Reason-Plan Workshop, Conference on Language Modeling (COLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11589 2025-09-16 cs.CV 67%

MVQA-68K: A Multi-dimensional and Causally-annotated Dataset with Quality Interpretability for Video Assessment

Yanyun Pu, Kehan Li, Zeyi Huang, Zhijie Zhong, Kaixiang Yang

机构 * Huawei Technologies Co.(华为技术有限公司) South China University of Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏