arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2505.24238 2025-06-03 cs.CV cs.LG 79%

MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM

Bowen Dong, Minheng Ni, Zitong Huang, Guanglei Yang, Wangmeng Zuo, Lei Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01199 2025-06-03 cs.LG 79%

CaReAQA: A Cardiac and Respiratory Audio Question Answering Model for Open-Ended Diagnostic Reasoning

Tsai-Ning Wang, Lin-Lin Chen, Neil Zeghidour, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学) Kyutai France(Kyutai法国分公司) Eindhoven Artificial Intelligence Systems Institute(埃因霍温人工智能系统研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

Comments Accepted at AHLI CHIL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05367 2025-06-03 cs.CL 79%

STRICTA: Structured Reasoning in Critical Text Assessment for Peer Review and Beyond

Nils Dycke, Matej Zečević, Ilia Kuznetsov, Beatrix Suess, Kristian Kersting, Iryna Gurevych

机构 * UKP Lab, ATHENE National Research Center for Applied Cybersecurity, Technical University of Darmstadt(UKP实验室,ATHENE国家应用网络安全研究中心,德累斯顿技术大学) AIML Lab, Hessian Center for AI, Technical University of Darmstadt(AIML实验室,黑森人工智能中心,德累斯顿技术大学) Synthetic RNA Biology, Technical University of Darmstadt(合成RNA生物学,德累斯顿技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00334 2025-06-03 cs.CL 79%

Beyond Context to Cognitive Appraisal: Emotion Reasoning as a Theory of Mind Benchmark for Large Language Models

Gerard Christopher Yeo, Kokil Jaidka

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00172 2025-06-03 cs.LG 79%

Breakpoint: Scalable evaluation of system-level reasoning in LLM code agents

Kaivalya Hariharan, Uzay Girit, Atticus Wang, Jacob Andreas

机构 * MIT(麻省理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08120 2025-06-02 cs.CL 79%

DeepSeek-R1 vs. o3-mini: How Well can Reasoning LLMs Evaluate MT and Summarization?

Daniil Larionov, Sotaro Takeshita, Ran Zhang, Yanran Chen, Christoph Leiter, Zhipin Wang, Christian Greisinger, Steffen Eger

机构 * University of Mannheim(曼海姆大学) University of Technology Nuremberg(纽伦堡技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12567 2025-06-02 cs.CL 79%

FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop Reasoning

Seunghee Kim, Changhyeon Kim, Taeuk Kim

机构 * Hanyang University(翰阳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23013 2025-05-30 cs.LG 79%

Scalable Complexity Control Facilitates Reasoning Ability of LLMs

Liangkai Hang, Junjie Yao, Zhiwei Bai, Tianyi Chen, Yang Chen, Rongjie Diao, Hezhou Li, Pengxiao Lin, Zhiwei Wang, Cheng Xu, Zhongwang Zhang, Zhangchen Zhou, Zhiyu Li, Zehao Lin, Kai Chen, Feiyu Xiong, Yaoyu Zhang, Weinan E, Hongkang Yang, Zhi-Qin John Xu

机构 * Institute of Natural Sciences, School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院自然科学院) MOE-LSC, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Center for Machine Learning Research, School of Mathematical Sciences, Peking University(北京大学数学科学学院机器学习研究中心) Center for LLM, Institute for Advanced Algorithms Research, Shanghai(上海高级算法研究所大语言模型中心) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15929 2025-05-30 cs.AI 79%

PhyX: Does Your Model Have the "Wits" for Physical Reasoning?

Hui Shen, Taiqiang Wu, Qi Han, Yunta Hsieh, Jizhou Wang, Yuyue Zhang, Yuxin Cheng, Zijian Hao, Yuansheng Ni, Xin Wang, Zhongwei Wan, Kai Zhang, Wendong Xu, Jing Xiong, Ping Luo, Wenhu Chen, Chaofan Tao, Zhuoqing Mao, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan(密歇根大学) Independent(独立研究者) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09187 2025-05-30 cs.LG 79%

GuardAgent: Safeguard LLM Agents by a Guard Agent via Knowledge-Enabled Reasoning

Zhen Xiang, Linzhi Zheng, Yanjie Li, Junyuan Hong, Qinbin Li, Han Xie, Jiawei Zhang, Zidi Xiong, Chulin Xie, Carl Yang, Dawn Song, Bo Li

机构 * University of Georgia(佐治亚大学) University of Chicago(芝加哥大学) UIUC(伊利诺伊大学香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校) Emory University(埃默里大学) Virtue AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22661 2025-05-29 cs.CL 79%

GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning

Qingchen Yu, Zifan Zheng, Ding Chen, Simin Niu, Bo Tang, Feiyu Xiong, Zhiyu Li

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) University of Sydney(悉尼大学) Research Institute of China Telecom(中国电信研究院) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22430 2025-05-29 cs.CL 79%

RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning

Kun Li, Yunxiang Li, Tianhua Zhang, Hongyin Luo, Xixin Wu, James Glass, Helen Meng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21765 2025-05-29 cs.AI 79%

Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models

Sohyun An, Ruochen Wang, Tianyi Zhou, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20201 2025-05-29 cs.CL 79%

Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations

Mohit Chandra, Siddharth Sriraman, Harneet Singh Khanuja, Yiqiao Jin, Munmun De Choudhury

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 34 pages, 5 figures, 30 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21297 2025-05-28 cs.CL 79%

rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset

Yifei Liu, Li Lyna Zhang, Yi Zhu, Bingcheng Dong, Xudong Zhou, Ning Shang, Fan Yang, Mao Yang

机构 * Microsoft Research Asia(微软亚洲研究院) Dalian University of Technology(大连理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20700 2025-05-28 cs.CL 79%

Beyond Templates: Dynamic Adaptation of Reasoning Demonstrations via Feasibility-Aware Exploration

Yong Wu, Weihang Pan, Ke Li, Chen Binhui, Ping Li, Binbin Lin

机构 * College of Software Technology, Zhejiang University(浙江大学软件技术学院) Fullong Technology, Ningbo, Zhejiang, China(宁波 fuller 技术有限公司) Ningbo Zhoushan Port Co., Ltd., Ningbo, Zhejiang, China(宁波舟山港股份有限公司) School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20672 2025-05-28 cs.AI 79%

GIFARC: Synthetic Dataset for Leveraging Human-Intuitive Analogies to Elevate AI Reasoning

Woochang Sim, Hyunseok Ryu, Kyungmin Choi, Sungwon Han, Sundong Kim

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10479 2025-05-28 cs.AI cs.GT 79%

TMGBench: A Systematic Game Benchmark for Evaluating Strategic Reasoning Abilities of LLMs

Haochuan Wang, Xiachong Feng, Lei Li, Yu Guo, Zhanyue Qin, Dianbo Sui, Lingpeng Kong

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20286 2025-05-27 cs.AI 79%

Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-Evolution

Jiahao Qiu, Xuan Qi, Tongcheng Zhang, Xinzhe Juan, Jiacheng Guo, Yifu Lu, Yimin Wang, Zixin Yao, Qihan Ren, Xun Jiang, Xing Zhou, Dongrui Liu, Ling Yang, Yue Wu, Kaixuan Huang, Shilong Liu, Hongru Wang, Mengdi Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20120 2025-05-27 cs.AI 79%

Agents Require Metacognitive and Strategic Reasoning to Succeed in the Coming Labor Markets

Simpson Zhang, Tennison Liu, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments *Zhang & Liu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19987 2025-05-27 cs.CL 79%

How Well Do Large Reasoning Models Translate? A Comprehensive Evaluation for Multi-Domain Machine Translation

Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) School of Informatics, Xiamen University(厦门大学信息学院) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University),Ministry of Culture and Tourism(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),文化部)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12054 2025-05-27 cs.AI 79%

PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning

Xinyu Zhang, Yuxuan Dong, Yanrui Wu, Jiaxing Huang, Chengyou Jia, Basura Fernando, Mike Zheng Shou, Lingling Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(新加坡科技研究局高性能计算研究所) Show Lab, National University of Singapore(新加坡国立大学Show实验室) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(中国教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19690 2025-05-27 cs.AI 79%

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

Baihui Zheng, Boren Zheng, Kerui Cao, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19502 2025-05-27 cs.SE cs.AI 79%

CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation

Guang Yang, Yu Zhou, Xiang Chen, Wei Zheng, Xing Hu, Xin Zhou, David Lo, Taolue Chen

机构 * College of Computer Science and Technology(计算机科学与技术学院) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) School of Software(软件学院) School of Software Technology(软件技术学院) School of Computing and Information Systems(计算与信息系统学院) School of Computing and Mathematical Sciences(计算与数学科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19383 2025-05-27 cs.AI 79%

CaseEdit: Enhancing Localized Commonsense Reasoning via Null-Space Constrained Knowledge Editing in Small Parameter Language Models

Varun Reddy, Yen-Ling Kuo

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18978 2025-05-27 cs.CL 79%

AI4Math: A Native Spanish Benchmark for University-Level Mathematical Reasoning in Large Language Models

Miguel Angel Peñaloza Perez, Bruno Lopez Orozco, Jesus Tadeo Cruz Soto, Michelle Bruno Hernandez, Miguel Angel Alvarado Gonzalez, Sandra Malagon

机构 * Centro de Investigación Científica y de Educación Superior de Ensenada(恩森亚达科学与高等教育研究中心) Facultad de Ciencias, UNAM(科学学院,国立自治大学) Facultad de Matemáticas, Universidad Veracruzana(数学学院,韦拉克鲁斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11393 2025-05-27 cs.CL 79%

HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning

Xiaoyuan Li, Moxin Li, Rui Men, Yichang Zhang, Keqin Bao, Wenjie Wang, Fuli Feng, Dayiheng Liu, Junyang Lin

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17503 2025-05-26 cs.CL 79%

CReSt: A Comprehensive Benchmark for Retrieval-Augmented Generation with Complex Reasoning over Structured Documents

Minsoo Khang, Sangjun Park, Teakgyu Hong, Dawoon Jung

机构 * Upstage AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17225 2025-05-26 cs.AI 79%

Reasoning Model is Stubborn: Diagnosing Instruction Overriding in Reasoning Models

Doohyuk Jang, Yoonjeon Kim, Chanjae Park, Hyun Ryu, Eunho Yang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15472 2025-05-23 cs.CL 79%

PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions

Song Dai, Yibo Yan, Jiamin Su, Dongfang Zihao, Yubo Gao, Yonghua Hei, Jungang Li, Junyan Zhang, Sicheng Tao, Zhuoran Gao, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏