arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2506.21591 2025-11-07 cs.CL 79%

FinEval-KR: A Financial Domain Evaluation Framework for Large Language Models' Knowledge and Reasoning

Shaoyu Dou, Yutian Shen, Mofan Chen, Zixuan Wang, Jiajie Xu, Qi Guo, Kailai Shao, Chao Chen, Haixiang Hu, Haibo Shi, Min Min, Liwen Zhang

机构 * Ant Group(蚂蚁集团) Shanghai University of Finance and Economics(上海金融学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by FinNLP@EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04201 2025-11-06 cs.CV cs.AI 79%

ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs

Ben Zhang, LuLu Yu, Lei Gao, QuanJiang Guo, Jing Liu, Hui Gao

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18140 2025-11-06 cs.CL 79%

MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning

Xiaoyuan Li, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02243 2025-11-05 cs.AI 79%

When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs

Zhuoran Zhang, Tengyue Wang, Xilin Gong, Yang Shi, Haotian Wang, Di Wang, Lijie Hu

机构 * Peking University(北京大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能和数据分析实验室) King Abdullah University of Science and Technology(卡布斯大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学) University of Georgia(佐治亚大学) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02234 2025-11-05 cs.MM cs.CL cs.SD 79%

An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM

Jiawei Liu, Enis Berk Çoban, Zarina Schevchenko, Hao Tang, Zhigang Zhu, Michael I Mandel, Johanna Devaney

机构 * The Graduate Center, CUNY(CUNY研究生中心) Brooklyn College, CUNY(CUNY布鲁克林学院) Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院) The City College of New York, CUNY(CUNY纽约城市学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01365 2025-11-04 cs.CL 79%

The Ouroboros of Benchmarking: Reasoning Evaluation in an Era of Saturation

İbrahim Ethem Deveci, Duygu Ataman

机构 * Department of Cognitive Science(认知科学系) Graduate School of Informatics(信息科学研究生院) Middle East Technical University(中东部技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025 Workshop on LLM Evaluation (https://openreview.net/group?id=NeurIPS.cc/2025/Workshop/LLM_Evaluation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23433 2025-11-04 cs.LG 79%

Diversity-Aware Policy Optimization for Large Language Model Reasoning

Jian Yao, Ran Cheng, Xingyu Wu, Jibin Wu, Kay Chen Tan

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) The Hong Kong Polytechnic University Shenzhen Research Institute(香港理工大学深圳研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15715 2025-11-04 cs.CL 79%

Beyond Empathy: Integrating Diagnostic and Therapeutic Reasoning with Large Language Models for Mental Health Counseling

He Hu, Yucheng Zhou, Juzheng Si, Qianning Wang, Hengheng Zhang, Fuji Ren, Fei Ma, Laizhong Cui, Qi Tian

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济发展实验室) SKL-IOTSC, CIS, University of Macau(澳门科学馆物联网与智慧城市研究中心) Shandong University(山东大学) Auckland University of Technology(技术大学(奥克兰)) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26937 2025-11-03 cs.LG 79%

MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models

Zimeng Huang, Jinxin Ke, Xiaoxuan Fan, Yufeng Yang, Yang Liu, Liu Zhonghan, Zedi Wang, Junteng Dai, Haoyi Jiang, Yuyu Zhou, Keze Wang, Ziliang Chen

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Jinan University(暨南大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks Track poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03185 2025-11-03 cs.LG 79%

PRISM-Physics: Causal DAG-Based Process Evaluation for Physics Reasoning

Wanjia Zhao, Qinwei Ma, Jingzhe Shi, Shirley Wu, Jiaqi Han, Yijia Xiao, Si-Yuan Chen, Xiao Luo, Ludwig Schmidt, James Zou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26322 2025-10-31 cs.CL 79%

SCRIBE: Structured Chain Reasoning for Interactive Behaviour Explanations using Tool Calling

Fares Fawzi, Vinitra Swamy, Dominik Glandorf, Tanya Nazaretsky, Tanja Käser

机构 * EPFL(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24446 2025-10-29 cs.CL cs.CV 79%

SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space

Viktoriia Zinkovich, Anton Antonov, Andrei Spiridonov, Denis Shepelev, Andrey Moskalenko, Daria Pugacheva, Elena Tutubalina, Andrey Kuznetsov, Vlad Shakhuro

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24299 2025-10-29 cs.AI 79%

Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank

Jiayu Liu, Wei Dai, Zhenya Huang, Ning Miao, Enhong Chen

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(人工智能与数据科学学院,中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学) Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23337 2025-10-28 cs.CL 79%

BaZi-Based Character Simulation Benchmark: Evaluating AI on Temporal and Persona Reasoning

Siyuan Zheng, Pai Liu, Xi Chen, Jizheng Dong, Sihan Jia

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Journal ref WordPlay Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18700 2025-10-28 cs.CV cs.AI 79%

GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains

Chun Wang, Xiaojun Ye, Xiaoran Pan, Zihao Pan, Haofan Wang, Yiren Song

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学) NUS(国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23077 2025-10-28 cs.IR cs.AI 79%

Think before Recommendation: Autonomous Reasoning-enhanced Recommender

Xiaoyu Kong, Junguang Jiang, Bin Liu, Ziru Xu, Han Zhu, Jian Xu, Bo Zheng, Jiancan Wu, Xiang Wang

机构 * Taobao & Tmall Group of Alibaba, China(阿里巴巴集团淘宝与天猫事业部) National University of Singapore(新加坡国立大学) Institute of Dataspace, Hefei Comprehensive National Science Center(合肥综合国家科学中心数据空间研究院) Shanghai Key Laboratory of Data Science(上海数据科学重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18087 2025-10-28 cs.CV cs.AI 79%

CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays

Hyungyung Lee, Geon Choi, Jung-Oh Lee, Hangyul Yoon, Hyuk Gi Hong, Edward Choi

机构 * KAIST(韩国国立科学技术院) Seoul National University Hospital(首尔国立大学医院) Seoul Medical Center(首尔医疗中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21807 2025-10-28 cs.CV cs.AI 79%

Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs

Jiaao Yu, Shenwei Li, Mingjie Han, Yifei Yin, Wenzheng Song, Chenghao Jia, Man Lan

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12712 2025-10-28 cs.CV cs.AI 79%

Beyond Seeing: Evaluating Multimodal LLMs on Tool-Enabled Image Perception, Transformation, and Reasoning

Xingang Guo, Utkarsh Tyagi, Advait Gosai, Paula Vergara, Jayeon Park, Ernesto Gabriel Hernández Montoya, Chen Bo Calvin Zhang, Bin Hu, Yunzhong He, Bing Liu, Rakshith Sharma Srinivasa

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13866 2025-10-27 cs.CL 79%

Reasoning Path Compression: Compressing Generation Trajectories for Efficient LLM Reasoning

Jiwon Song, Dongwon Jo, Yulhwa Kim, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学) Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20967 2025-10-27 cs.CV cs.AI 79%

3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models

Sraavya Sambara, Sung Eun Kim, Xiaoman Zhang, Luyang Luo, Shreya Johri, Mohammed Baharoon, Du Hyun Ro, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Seoul National University Hospital(首尔国立大学医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19836 2025-10-24 cs.AI cs.SY eess.SY 79%

Benchmarking Reasoning Reliability in Artificial Intelligence Models for Energy-System Analysis

Eliseo Curcio

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18368 2025-10-22 cs.CL 79%

KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs

Donghyeon Ko, Yeguk Jin, Kyubyung Chae, Byungwook Lee, Chansong Jo, Sookyo In, Jaehong Lee, Taesup Kim, Donghyun Kwak

机构 * Naver Cloud(Naver云) Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18112 2025-10-22 cs.CL 79%

Does Reasoning Help LLM Agents Play Dungeons and Dragons? A Prompt Engineering Experiment

Patricia Delafuente, Arya Honraopatil, Lara J. Martin

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Published at the Wordplay: When Language Meets Games Workshop (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17685 2025-10-21 cs.CV cs.AI 79%

Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning

Min Cao, Xinyu Zhou, Ding Jiang, Bo Du, Mang Ye, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Key Laboratory of New Generation Artificial Intelligence Technology & Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新 generation 人工智能技术及交叉应用重点实验室(东南大学),教育部,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Final version published in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Xplore link: https://ieeexplore.ieee.org/document/11199360

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16095 2025-10-21 cs.AI 79%

Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study

Dou Liu, Ying Long, Sophia Zuoqiu, Di Liu, Kang Li, Yiting Lin, Hanyi Liu, Rong Yin, Tian Tang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15974 2025-10-21 cs.AI 79%

Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games

Chris Su, Harrison Li, Matheus Marques, George Flint, Kevin Zhu, Sunishchal Dev

机构 * Algoverse AI Research(Algoverse AI研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08750 2025-10-21 cs.CL 79%

HCR-Reasoner: Synergizing Large Language Models and Theory for Human-like Causal Reasoning

Yanxi Zhang, Xin Cong, Zhong Zhang, Xiao Liu, Dongyan Zhao, Yesai Wu

机构 * Center for Data Science, AAIS, Peking University(数据科学中心,AAIS,北京大学) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14265 2025-10-17 cs.AI 79%

MorphoBench: A Benchmark with Difficulty Adaptive to Model Reasoning

Xukai Wang, Xuanbo Liu, Mingrui Chen, Haitian Zhong, Xuanlin Yang, Bohan Zeng, Jinbo Hu, Hao Liang, Junbo Niu, Xuchen Li, Ruitao Wu, Ruichuan An, Yang Shi, Liu Liu, Xu-Yao Zhang, Qiang Liu, Zhouchen Lin, Wentao Zhang, Bin Dong

机构 * Zhongguancun Academy(中关村学院) Peking University(北京大学) Beihang University(北航) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14014 2025-10-17 cs.CL 79%

CRaFT: An Explanation-Based Framework for Evaluating Cultural Reasoning in Multilingual Language Models

Shehenaz Hossain, Haithem Afli

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏