arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-04 至 2025-11-04 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2504.09802 2025-11-04 cs.CL cs.AI 86%

Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment

Wenrui Cai, Chengyu Wang, Junbing Yan, Jun Huang, Xiangzhong Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Cloud Computing(阿里云计算)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments emnlp 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23945 2025-11-04 cs.CL cs.AI 86%

A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models

Sriram Balasubramanian, Samyadeep Basu, Soheil Feizi

机构 * Department of Computer Science University of Maryland, College Park(计算机科学系马里兰大学 College Park)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted in EMNLP 2025, 34 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00879 2025-11-04 cs.CL cs.AI cs.LG 82%

Assessing LLM Reasoning Steps via Principal Knowledge Grounding

Hyeon Hwang, Yewon Cho, Chanwoong Yoon, Yein Park, Minju Song, Kyungjae Lee, Gangwoo Kim, Jaewoo Kang

机构 * Korea University(韩国大学) University of Seoul(首尔大学) AWS AI Labs(AWS人工智能实验室) AIGEN Sciences(AIGEN科学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00421 2025-11-04 cs.CL cs.AI cs.LG 82%

MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts

Naoto Iwase, Hiroki Okuyama, Junichiro Iwasawa

机构 * Preferred Networks, Inc. School of Medicine, Nagoya University(Nagoya大学医学部)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01365 2025-11-04 cs.CL 79%

The Ouroboros of Benchmarking: Reasoning Evaluation in an Era of Saturation

İbrahim Ethem Deveci, Duygu Ataman

机构 * Department of Cognitive Science(认知科学系) Graduate School of Informatics(信息科学研究生院) Middle East Technical University(中东部技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025 Workshop on LLM Evaluation (https://openreview.net/group?id=NeurIPS.cc/2025/Workshop/LLM_Evaluation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23433 2025-11-04 cs.LG 79%

Diversity-Aware Policy Optimization for Large Language Model Reasoning

Jian Yao, Ran Cheng, Xingyu Wu, Jibin Wu, Kay Chen Tan

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) The Hong Kong Polytechnic University Shenzhen Research Institute(香港理工大学深圳研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15715 2025-11-04 cs.CL 79%

Beyond Empathy: Integrating Diagnostic and Therapeutic Reasoning with Large Language Models for Mental Health Counseling

He Hu, Yucheng Zhou, Juzheng Si, Qianning Wang, Hengheng Zhang, Fuji Ren, Fei Ma, Laizhong Cui, Qi Tian

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济发展实验室) SKL-IOTSC, CIS, University of Macau(澳门科学馆物联网与智慧城市研究中心) Shandong University(山东大学) Auckland University of Technology(技术大学(奥克兰)) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17267 2025-11-04 cs.CL 74%

GreekBarBench: A Challenging Benchmark for Free-Text Legal Reasoning and Citations

Odysseas S. Chlapanis, Dimitrios Galanis, Nikolaos Aletras, Ion Androutsopoulos

机构 * Department of Informatics, Athens University of Economics and Business(信息学院,雅典经济与商业大学) Archimedes, Athena Research Center(阿提卡研究中心-阿基米德) Athena Research Center(阿提卡研究中心) University of Sheffield(谢菲尔德大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

Comments 19 pages, 17 figures, accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01512 2025-11-04 cs.CL cs.AI 73%

BanglaNirTox: A Large-scale Parallel Corpus for Explainable AI in Bengali Text Detoxification

Ayesha Afroza Mohsin, Mashrur Ahsan, Nafisa Maliyat, Shanta Maria, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Under review, 6 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01340 2025-11-04 cs.CV cs.CL 70%

$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles

Trishanu Das, Abhilash Nandy, Khush Bajaj, Deepiha S

机构 * Tredence Inc.(特伦德公司) Indian Institute of Technology Kharagpur(印度理工学院克拉格浦尔分校) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00389 2025-11-04 cs.CV 67%

Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond

Fan Zhang, Haoxuan Li, Shengju Qian, Xin Wang, Zheng Lian, Hao Wu, Zhihong Zhu, Yuan Gao, Qiankun Li, Yefeng Zheng, Zhouchen Lin, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tencent(腾讯) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Westlake University(西湖大学)

专题命中 推理评测 :reasoning(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19667 2025-11-04 cs.CL cs.AI 62%

Can Large Language Models Analyze Graphs like Professionals? A Benchmark, Datasets and Models

Xin Li, Weize Chen, Qizhi Chu, Haopeng Li, Zhaojun Sun, Ran Li, Chen Qian, Yiwei Wei, Zhiyuan Liu, Chuan Shi, Maosong Sun, Cheng Yang

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) College of Petroleum Engineering, China University of Petroleum (Beijing) at Karamay(中国石油大学(北京)克拉玛依校区石油工程学院) Institute for Artificial Intelligence, Tsinghua University(清华大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16093 2025-11-04 cs.CL cs.AI 62%

Beyond Pointwise Scores: Decomposed Criteria-Based Evaluation of LLM Responses

Fangyi Yu, Nabeel Seedat, Dasha Herrmannova, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Thomson Reuters Labs(汤姆森·路透实验室) Imperial College London(帝国理工学院伦敦分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by 2025 EMNLP industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17050 2025-11-04 cs.CL cs.AI cs.CE cs.CY cs.MM 62%

Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning

Xinyi Wu, Yanhao Jia, Qinglin Zhang, Yiran Qin, Luwei Xiao, Shuai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01053 2025-11-04 cs.CL 57%

Building a Silver-Standard Dataset from NICE Guidelines for Clinical LLMs

Qing Ding, Eric Hua Qing Zhang, Felix Jozsa, Julia Ive

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Submitted to EFMI Medical Informatics Europe 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26101 2025-11-04 cs.CL cs.PL quant-ph 57%

QCoder Benchmark: Bridging Language Generation and Quantum Hardware through Simulator-Based Feedback

Taku Mikuriya, Tatsuya Ishigaki, Masayuki Kawarada, Shunya Minami, Tadashi Kadowaki, Yohichi Suzuki, Soshun Naito, Shunya Takata, Takumi Kato, Tamotsu Basseda, Reo Yamada, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Yokohama National University(Yokohama国立大学) CyberAgent, Inc.(CyberAgent公司) DENSO CORPORATION(DENSO公司) The University of Tokyo(东京大学) Keio University(庆应义塾大学) NTT DATA GROUP Corporation(NTT DATA集团公司) Miletos inc.(Miletos公司) University of Tsukuba(筑波大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to INLG2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22765 2025-11-04 cs.AI 57%

Jarvis: Towards Personalized AI Assistant via Personal KV-Cache Retrieval

Binxiao Xu, Junyu Feng, Shaolin Lu, Yulin Luo, Shilin Yan, Hao Liang, Ming Lu, Wentao Zhang

机构 * Peking University(北京大学) Xi’an Jiaotong University(西安交通大学) Alibaba Group(阿里巴巴集团) Intel Labs China(英特尔中国实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10449 2025-11-04 cs.CV cs.AI 57%

CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding

Hongyong Han, Wei Wang, Gaowei Zhang, Mingjie Li, Yi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Technology Innovation Center for South China Sea Remote Sensing, Surveying and Mapping Collaborative Application, Ministry of Natural Resources(自然资源部南海遥感测绘协同应用技术创新中心) South China Sea Development Research Institute, Ministry of Natural Resources(自然资源部南海发展研究 institute) Inspur Computer Technology Co., Ltd(Inspur 计算机技术有限公司) Shandong Key Laboratory of Advanced Computing(山东先进计算重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13063 2025-11-04 cs.CV cs.CL 57%

PRISM2: Unlocking Multi-Modal General Pathology AI with Clinical Dialogue

Eugene Vorontsov, George Shaikovski, Adam Casson, Julian Viret, Eric Zimmermann, Neil Tenenholtz, Yi Kan Wang, Jan H. Bernhard, Ran A. Godrich, Juan A. Retamero, Jinru Shia, Mithat Gonen, Martin R. Weiser, David S. Klimstra, Razik Yousfi, Nicolo Fusi, Thomas J. Fuchs, Kristen Severson, Siqi Liu

机构 * Paige, NYC, NY United States(美国纽约市帕伊公司) Microsoft Research, Cambridge, MA United States(微软研究院) Memorial Sloan Kettering Cancer Center, NYC, NY United States(纪念斯隆凯特林癌症中心) University of Yale, New Haven, CT United States(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 57%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26781 2025-11-04 cs.CV 50%

ChartAB: A Benchmark for Chart Grounding & Dense Alignment

Aniruddh Bansal, Davit Soselia, Dang Nguyen, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00872 2025-11-04 cs.SE 50%

A Comprehensive Empirical Evaluation of Agent Frameworks on Code-centric Software Engineering Tasks

Zhuowen Yin, Cuifeng Gao, Chunsong Fan, Wenzhang Yang, Yinxing Xue, Lijun Zhang

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏