arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-23 至 2025-09-23 共收录 132 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 10 篇

2509.16330 2025-09-23 cs.AI 57%

Generalizability of Large Language Model-Based Agents: A Comprehensive Survey

Minxing Zhang, Yi Yang, Roy Xie, Bhuwan Dhingra, Shuyan Zhou, Jian Pei

机构 * Duke University(杜克大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17435 2025-09-23 cs.RO cs.SY eess.SY 50%

GPS Denied IBVS-Based Navigation and Collision Avoidance of UAV Using a Low-Cost RGB Camera

Xiaoyu Wang, Yan Rui Tan, William Leong, Sunan Huang, Rodney Teo, Cheng Xiang

机构 * Electrical and Computer Engineering Dept., National University of Singapore(新加坡国立大学电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16805 2025-09-23 cs.CV 50%

Benchmarking and Mitigating MCQA Selection Bias of Large Vision-Language Models

Md. Atabuzzaman, Ali Asgarov, Chris Thomas

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 3 篇

2506.11474 2025-09-23 cs.CL 79%

Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process Rewards

Jaehoon Yun, Jiwoong Sohn, Jungwoo Park, Hyunjae Kim, Xiangru Tang, Yanjun Shao, Yonghoe Koo, Minhyeok Ko, Qingyu Chen, Mark Gerstein, Michael Moor, Jaewoo Kang

机构 * Korea University(韩国大学) ETH Zürich(苏黎世联邦理工学院) Yale University(耶鲁大学) AIGEN Sciences(AIGEN公司) Hanyang University College of Medicine(翰雅大学医学院) University of Ulsan College of Medicine(釜山大学医学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17570 2025-09-23 cs.CL 57%

Asking a Language Model for Diverse Responses

Sergey Troshin, Irina Saparina, Antske Fokkens, Vlad Niculae

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments UncertaiNLP workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17522 2025-09-23 cs.CV 50%

Chat-CBM: Towards Interactive Concept Bottleneck Models with Frozen Large Language Models

Hangzhou He, Lei Zhu, Kaiwen Li, Xinliang Zhang, Jiakui Hu, Ourui Fu, Zhengjian Yao, Yanye Lu

机构 * Department of Biomedical Engineering, College of Future Technology, Peking University(生物医学工程系,未来技术学院,北京大学) Institute of Medical Technology, Peking University Health Science Center, Peking University(医学技术研究所,北京大学医学部,北京大学) National Biomedical Imaging Center, College of Future Technology, Peking University(国家生物医学成像中心,未来技术学院,北京大学)

专题命中 测试时计算 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 8 篇

2509.17437 2025-09-23 cs.CL 79%

GeoPQA: Bridging the Visual Perception Gap in MLLMs for Geometric Reasoning

Guizhen Chen, Weiwen Xu, Hao Zhang, Hou Pong Chan, Deli Zhao, Anh Tuan Luu, Yu Rong

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里达摩院) Hupan Lab(华普实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02965 2025-09-23 cs.CL cs.AI cs.LG 67%

CoLa: Learning to Interactively Collaborate with Large Language Models

Abhishek Sharma, Dan Goldwasser

机构 * Department of Computer Science(计算机科学系) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13222 2025-09-23 cs.CL cs.AI 62%

Can Language Models Follow Multiple Turns of Entangled Instructions?

Chi Han, Xin Liu, Haodong Wang, Shiyang Li, Jingfeng Yang, Haoming Jiang, Zhengyang Wang, Qingyu Yin, Liang Qiu, Changlong Yu, Yifan Gao, Zheng Li, Bing Yin, Jingbo Shang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025) Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16810 2025-09-23 cs.AI 57%

Automated Procedural Analysis via Video-Language Models for AI-assisted Nursing Skills Assessment

Shen Chang, Dennis Liu, Renran Tian, Kristen L. Swartzell, Stacie L. Klingler, Amy M. Nagle, Nan Kong

机构 * Weldon School of Biomedical Engineering, Purdue University(普渡大学生物医学工程学院) Department of Industrial and Operations Engineering, University of Michigan(密歇根大学工业与运作工程系) Edward P. Fitts Department of Industrial and Systems Engineering, North Carolina State University(北卡罗来纳州立大学工业与系统工程系) School of Nursing, Purdue University(普渡大学护理学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16597 2025-09-23 cs.CL 57%

MCP: A Control-Theoretic Orchestration Framework for Synergistic Efficiency and Interpretability in Multimodal Large Language Models

Luyan Zhang

机构 * Northeastern University(东北大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments 13 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16502 2025-09-23 cs.LG 57%

GRIL: Knowledge Graph Retrieval-Integrated Learning with Large Language Models

Jialin Chen, Houyu Zhang, Seongjun Yun, Alejandro Mottini, Rex Ying, Xiang Song, Vassilis N. Ioannidis, Zheng Li, Qingjun Cui

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16369 2025-09-23 cs.IR cs.AI cs.CE 57%

Enhancing Financial RAG with Agentic AI and Multi-HyDE: A Novel Approach to Knowledge Retrieval and Hallucination Reduction

Akshay Govind Srinivasan, Ryan Jacob George, Jayden Koshy Joe, Hrushikesh Kant, Harshith M R, Sachin Sundar, Sudharshan Suresh, Rahul Vimalkanth, Vijayavallabh

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments 14 Pages, 8 Tables, 2 Figures. Accepted and to be published in the proceedings of FinNLP, Empirical Methods in Natural Language Processing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16212 2025-09-23 cs.DB cs.AI 57%

EPIC: Generative AI Platform for Accelerating HPC Operational Data Analytics

Ahmad Maroof Karimi, Woong Shin, Jesse Hines, Tirthankar Ghosal, Naw Safrin Sattar, Feiyi Wang

机构 * National Center for Computational Sciences(国家计算科学中心) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 39 篇

2502.15361 2025-09-23 cs.CL cs.AI 86%

Does Reasoning Introduce Bias? A Study of Social Bias Evaluation and Mitigation in LLM Reasoning

Xuyang Wu, Jinming Nian, Ting-Ruen Wei, Zhiqiang Tao, Hsin-Tai Wu, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) Rochester Institute of Technology(罗切斯特理工学院) Docomo Innovations(Docomo创新)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14693 2025-09-23 cs.AI 85%

RationAnomaly: Log Anomaly Detection with Rationality via Chain-of-Thought and Reinforcement Learning

Song Xu, Yilun Liu, Minggui He, Mingchen Dai, Ziang Chen, Chunguang Zhao, Jingzhou Du, Shimin Tao, Weibin Meng, Shenglin Zhang, Yongqian Sun, Boxing Chen, Daimeng Wei

机构 * School of Software Engineering, University of Science and Technology of China(软件工程学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究 institute,中国科学技术大学) Huawei, Beijing, China(华为,中国) Huawei Canada, Montreal, Canada(华为加拿大分公司,加拿大) Nankai University, Tianjin, China(南开大学,中国)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02318 2025-09-23 cs.SD cs.AI cs.CL cs.LG cs.MM eess.AS 85%

Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models

Zhifei Xie, Mingbao Lin, Zihang Liu, Pengcheng Wu, Shuicheng Yan, Chunyan Miao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Rakuten

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical report, in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02954 2025-09-23 cs.CL cs.AI 84%

Advanced Financial Reasoning at Scale: A Comprehensive Evaluation of Large Language Models on CFA Level III

Pranam Shetty, Abhisek Upadhayaya, Parth Mitesh Shah, Srikanth Jagabathula, Shilpi Nayak, Anna Joo Fee

机构 * Rochester Institute of Technology(罗切斯特理工学院) GoodFin, Inc(GoodFin公司) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted at FinLLM @ IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18063 2025-09-23 cs.CL 83%

ARK-V1: An LLM-Agent for Knowledge Graph Question Answering Requiring Commonsense Reasoning

Jan-Felix Klein, Lars Ohnemus

机构 * Institute of Material Handling and Logistics (IFL) at the Karlsruhe Institute of Technology (KIT)(材料搬运与物流研究所(IFL)于卡尔斯鲁厄理工学院(KIT))

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments Work in Progess

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17938 2025-09-23 cs.CL 83%

D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models

Satyapriya Krishna, Andy Zou, Rahul Gupta, Eliot Krzysztof Jones, Nick Winter, Dan Hendrycks, J. Zico Kolter, Matt Fredrikson, Spyros Matsoukas

机构 * Amazon Nova Responsible AI(亚马逊Nova负责任的人工智能) Center for AI Safety(人工智能安全中心) CMU(卡内基梅隆大学) Gray Swan AI(灰天鹅人工智能)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15712 2025-09-23 cs.CL 83%

TurnaboutLLM: A Deductive Reasoning Benchmark from Detective Games

Yuan Yuan, Muyu He, Muhammad Adil Shahid, Jiani Huang, Ziyang Li, Li Zhang

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments In EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18761 2025-09-23 cs.CL cs.AI cs.LG 82%

How Is LLM Reasoning Distracted by Irrelevant Context? An Analysis Using a Controlled Benchmark

Minglai Yang, Ethan Huang, Liang Zhang, Mihai Surdeanu, William Wang, Liangming Pan

机构 * University of Arizona(亚利桑那大学) MOE Key Lab of Computational Linguistics, Peking University(北京大学计算语言学国家重点实验室) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16866 2025-09-23 cs.AI cs.CL cs.LG 82%

seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs

Mohammad Ramezanali, Mo Vazifeh, Paolo Santi

机构 * Salesforce AI Palo Alto(Salesforce AI 巴尔的摩) Capital One MIT(麻省理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12466 2025-09-23 cs.LG cs.AI cs.CL cs.PL cs.SE 82%

EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking

Anjiang Wei, Jiannan Cao, Ran Li, Hongyu Chen, Yuhui Zhang, Ziheng Wang, Yuan Liu, Thiago S. F. X. Teixeira, Diyi Yang, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Google(谷歌) Nanjing University(南京大学) Intel(英特尔)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10571 2025-09-23 cs.AI cs.CL 81%

Agentic AI with Orchestrator-Agent Trust: A Modular Visual Classification Framework with Trust-Aware Orchestration and RAG-Based Reasoning

Konstantinos I. Roumeliotis, Ranjan Sapkota, Manoj Karkee, Nikolaos D. Tselikas

机构 * University of the Peloponnese, Department of Informatics and Telecommunications(希腊皮埃蒙特大学信息与电信系) Cornell University, Department of Biological and Environmental Engineering(康奈尔大学生物与环境工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16517 2025-09-23 cs.CV cs.AI cs.CL cs.MM 81%

Seeing Culture: A Benchmark for Visual Reasoning and Grounding

Burak Satar, Zhixin Ma, Patrick A. Irawan, Wilfried A. Mulyawan, Jing Jiang, Ee-Peng Lim, Chong-Wah Ngo

机构 * Singapore Management University(新加坡管理大学) Bandung Institute of Technology(班达理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Main Conference, https://seeingculture-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16397 2025-09-23 cs.LG cs.AI 81%

GRID: Graph-based Reasoning for Intervention and Discovery in Built Environments

Taqiya Ehsan, Shuren Xia, Jorge Ortiz

机构 * Rutgers University(罗格斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07129 2025-09-23 cs.CL cs.AI 81%

ASTRA: A Negotiation Agent with Adaptive and Strategic Reasoning via Tool-integrated Action for Dynamic Offer Optimization

Deuksin Kwon, Jiwon Hae, Emma Clift, Daniel Shamsoddini, Jonathan Gratch, Gale M. Lucas

机构 * University of Southern California(美国南加州大学) St. Olaf College(圣奥拉夫学院) Northwestern University(西北大学) USC for Institute of Creative Technologies(美国南加州大学创意技术研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14498 2025-09-23 cs.CL 79%

LLaSA: A Sensor-Aware LLM for Natural Language Reasoning of Human Activity from IMU Data

Sheikh Asif Imran, Mohammad Nur Hossain Khan, Subrata Biswas, Bashima Islam

机构 * Worcester Polytechnic Institute(沃斯特理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16989 2025-09-23 cs.CL 79%

All-in-one: Understanding and Generation in Multimodal Reasoning with the MAIA Benchmark

Davide Testa, Giovanni Bonetta, Raffaella Bernardi, Alessandro Bondielli, Alessandro Lenci, Alessio Miaschi, Lucia Passaro, Bernardo Magnini

机构 * Università di Roma La Sapienza(罗马La Sapienza大学) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会) Free University of Bozen-Bolzano(博兹纳-博尔扎诺自由大学) Dept. of Computer Science, University of Pisa(比萨大学计算机科学系) CoLing Lab, Dept. of Philology, Literature and Linguistics, University of Pisa(比萨大学语言学、文学与语言学系CoLing实验室) Istituto di Linguistica Computazionale "A. Zampolli" (CNR-ILC), ItaliaNLP Lab, Pisa(A. Zampolli计算语言学研究所(CNR-ILC),意大利NLP实验室,比萨)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted at Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏