arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2408.09429 2025-06-02 cs.LG cs.CL cs.CV 62%

Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models

Kening Zheng, Junkai Chen, Yibo Yan, Xin Zou, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Guangxi Zhuang Autonomous Region Big Data Research Institute(广西壮族自治区大数据研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted by Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14742 2025-06-02 cs.LG cs.AI 62%

Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability Hypothesis

Hong Huang, Dapeng Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23693 2025-05-30 cs.CV cs.AI cs.CL 62%

VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos

Tingyu Song, Tongyan Hu, Guo Gan, Yilun Zhao

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13503 2025-05-30 cs.LG cs.CL cs.DL cs.IR 62%

SciHorizon: Benchmarking AI-for-Science Readiness from Scientific Data to Large Language Models

Chuan Qin, Xin Chen, Chengrui Wang, Pengmin Wu, Xi Chen, Yihang Cheng, Jingyi Zhao, Meng Xiao, Xiangchao Dong, Qingqing Long, Boya Pan, Han Wu, Chengzan Li, Yuanchun Zhou, Hui Xiong, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08008 2025-05-30 cs.LG cs.CL cs.HC 62%

Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition

Kehua Feng, Keyan Ding, Hongzhi Tan, Kede Ma, Zhihua Wang, Shuangquan Guo, Yuzhou Cheng, Ge Sun, Guozhou Zheng, Qiang Zhang, Huajun Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 35 pages, 6 figures, Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21775 2025-05-29 cs.LG cs.AI math.OC 62%

DualSchool: How Reliable are LLMs for Optimization Education?

Michael Klamkin, Arnaud Deza, Sikai Cheng, Haoruo Zhao, Pascal Van Hentenryck

机构 * Georgia Institute of Technology(佐治亚理工学院) NSF AI Institute for Advances in Optimization(国家科学基金会人工智能优化研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03312 2025-05-29 cs.CL cs.LG 62%

Evaluating Compact LLMs for Zero-Shot Iberian Language Tasks on End-User Devices

Luís Couto Seller, Íñigo Sanz Torres, Adrián Vogel-Fernández, Carlos González Carballo, Pedro Miguel Sánchez Sánchez, Adrián Carruana Martín, Enrique de Miguel Ambite

机构 * Advantx Technological Foundation (Funditec)(Advantx技术基金会)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted at SEPLN 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17933 2025-05-29 cs.CL cs.AI cs.IR 62%

Experience Retrieval-Augmentation with Electronic Health Records Enables Accurate Discharge QA

Justice Ou, Tinglin Huang, Yilun Zhao, Ziyang Yu, Peiqing Lu, Rex Ying

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Yale University(耶鲁大学) University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09245 2025-05-29 cs.LG cs.CL 62%

You Do Not Fully Utilize Transformer's Representation Capacity

Gleb Gerasimov, Yaroslav Aksenov, Nikita Balagansky, Viacheslav Sinii, Daniil Gavrilov

机构 * T-Tech Moscow Institute of Physics and Technology(莫斯科物理技术学院) HSE University(俄罗斯高等经济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21362 2025-05-28 cs.CL cs.AI cs.HC 62%

Evaluating LLM Adaptation to Sociodemographic Factors: User Profile vs. Dialogue History

Qishuai Zhong, Zongmin Li, Siqi Fan, Aixin Sun

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) University of Electronic Science and Technology of China, Chengdu, China(电子科技大学,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18034 2025-05-28 cs.AI cs.CL 62%

Structured Thinking Matters: Improving LLMs Generalization in Causal Inference Tasks

Wentao Sun, João Paulo Nogueira, Alonso Silva

机构 * École Polytechnique(巴黎高等理工学院) Institut Polytechnique de Paris(巴黎高等理工学院) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19457 2025-05-27 cs.AI cs.CE cs.CL 62%

BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs

Guilong Lu, Xuntao Guo, Rongjunchen Zhang, Wenqiao Zhu, Ji Liu

机构 * HiThink Research(HiThink研究机构) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://hithink-research.github.io/BizFinBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18878 2025-05-27 cs.CL cs.AI 62%

CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions

Kung-Hsiang Huang, Akshara Prabhakar, Onkar Thorat, Divyansh Agarwal, Prafulla Kumar Choubey, Yixin Mao, Silvio Savarese, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14106 2025-05-27 cs.CL cs.AI 62%

A Personalized Conversational Benchmark: Towards Simulating Personalized Conversations

Li Li, Peilin Cai, Ryan A. Rossi, Franck Dernoncourt, Branislav Kveton, Junda Wu, Tong Yu, Linxin Song, Tiankai Yang, Yuehan Qin, Nesreen K. Ahmed, Samyadeep Basu, Subhojyoti Mukherjee, Ruiyi Zhang, Zhengmian Hu, Bo Ni, Yuxiao Zhou, Zichao Wang, Yue Huang, Yu Wang, Xiangliang Zhang, Philip S. Yu, Xiyang Hu, Yue Zhao

机构 * University of Southern California(南加州大学) Adobe Research(Adobe研究院) University of California, San Diego(加州大学圣地亚哥分校) Intel AI Research(英特尔人工智能研究) University of Maryland, College Park(马里兰大学学院市分校) Vanderbilt University(范德比大学) Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学) University of Notre Dame(诺特丹大学) University of Oregon(俄勒冈大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06766 2025-05-27 cs.AI cs.CL 62%

FamilyTool: A Multi-hop Personalized Tool Use Benchmark

Yuxin Wang, Yiran Guo, Yining Zheng, Zhangyue Yin, Shuo Chen, Jie Yang, Jiajun Chen, Yuan Li, Xuanjing Huang, Xipeng Qiu

机构 * Computer Science, Fudan University(复旦大学计算机科学系) Institute of Modern Languages and Linguistics, Fudan University(复旦大学现代语言与语言学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08279 2025-05-27 cs.CL cs.AI cs.CV 62%

What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations

Dongqi Liu, Chenxi Whitehouse, Xi Yu, Louis Mahon, Rohit Saxena, Zheng Zhao, Yifu Qiu, Mirella Lapata, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17613 2025-05-26 cs.AI cs.CL cs.CV 62%

MMMG: a Comprehensive and Reliable Evaluation Suite for Multitask Multimodal Generation

Jihan Yao, Yushi Hu, Yujie Yi, Bin Han, Shangbin Feng, Guang Yang, Bingbing Wen, Ranjay Krishna, Lucy Lu Wang, Yulia Tsvetkov, Noah A. Smith, Banghua Zhu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17265 2025-05-26 cs.CL cs.AI 62%

CaseReportBench: An LLM Benchmark Dataset for Dense Information Extraction in Clinical Case Reports

Xiao Yu Cindy Zhang, Carlos R. Ferreira, Francis Rossignol, Raymond T. Ng, Wyeth Wasserman, Jian Zhu

机构 * University of British Columbia(不列颠哥伦比亚大学) National Institutes of Health(美国国家卫生研究院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01441 2025-05-26 cs.AI cs.LG 62%

LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal Demonstrations

Anian Ruoss, Fabio Pardo, Harris Chan, Bonnie Li, Volodymyr Mnih, Tim Genewein

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16648 2025-05-23 cs.CL cs.AI 62%

Collaboration among Multiple Large Language Models for Medical Question Answering

Kexin Shang, Chia-Hsuan Chang, Christopher C. Yang

机构 * College of Computing & Informatics(计算机与信息学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to IEEE International Conference on Healthcare Informatics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16100 2025-05-23 cs.AI cs.CL 62%

BioDSA-1K: Benchmarking Data Science Agents for Biomedical Research

Zifeng Wang, Benjamin Danek, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14728 2025-05-22 cs.CV cs.AI cs.CL cs.CY cs.MM 62%

MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models

Xiao Lin, Zhining Liu, Ze Yang, Gaotang Li, Ruizhong Qiu, Shuke Wang, Hui Liu, Haotian Li, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07996 2025-05-22 cs.AI cs.CL 62%

SQLCritic: Correcting Text-to-SQL Generation via Clause-wise Critic

Jikai Chen, Leilei Gan, Ziyu Zhao, Zechuan Wang, Dong Wang, Chenyi Zhuang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14354 2025-05-21 cs.CL cs.LG 62%

WirelessMathBench: A Mathematical Modeling Benchmark for LLMs in Wireless Communications

Xin Li, Mengbing Liu, Li Wei, Jiancheng An, Mérouane Debbah, Chau Yuen

机构 * School of Electrical and Electronic Engineering (EEE), Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Department of Computer and Information Engineering, Khalifa University, Abu Dhabi, UAE(哈利法大学计算机与信息工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14212 2025-05-21 cs.CL cs.AI 62%

Automatic Dataset Generation for Knowledge Intensive Question Answering Tasks

Sizhe Yuen, Ting Su, Ziyang Wang, Yali Du, Adam J. Sobey

机构 * The Alan Turing Institute(艾伦·图灵研究所) King’s College London(伦敦国王学院) University of Southampton(南安普顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13533 2025-05-21 cs.AI cs.LG q-fin.GN 62%

FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs

Junzhe Jiang, Chang Yang, Aixin Cui, Sihan Jin, Ruiyu Wang, Bo Li, Xiao Huang, Dongning Sun, Xinrun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) KTH Royal Institute of Technology(皇家理工学院) Peng Cheng Laboratory(鹏城实验室) Singapore Management University(新加坡管理大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10657 2025-05-21 cs.CL cs.AI 62%

RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs

Zhongzhan Huang, Guoming Ling, Yupei Lin, Yandong Chen, Shanshan Zhong, Hefeng Wu, Liang Lin

机构 * Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12900 2025-05-20 cs.SE cs.AI cs.CG cs.CL cs.DB 62%

AutoGEEval: A Multimodal and Automated Framework for Geospatial Code Generation on GEE with Large Language Models

Shuyang Hou, Zhangxiao Shen, Huayi Wu, Jianyuan Liang, Haoyue Jiao, Yaxian Qing, Xiaopu Zhang, Xu Li, Zhipeng Gui, Xuefeng Guan, Longgang Xiang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13377 2025-05-20 cs.CL cs.AI 62%

DateLogicQA: Benchmarking Temporal Biases in Large Language Models

Gagan Bhatia, MingZe Tang, Cristina Mahanta, Madiha Kazi

机构 * University of Aberdeen(阿伯丁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11774 2025-05-20 cs.LG cs.AI 62%

HARDMath2: A Benchmark for Applied Mathematics Built by Students as Part of a Graduate Class

James V. Roggeveen, Erik Y. Wang, Will Flintoft, Peter Donets, Lucy S. Nathwani, Nickholas Gutierrez, David Ettel, Anton Marius Graf, Siddharth Dandavate, Arjun Nageswaran, Raglan Ward, Ava Williamson, Anne Mykland, Kacper K. Migacz, Yijun Wang, Egemen Bostan, Duy Thuc Nguyen, Zhe He, Marc L. Descoteaux, Felix Yeung, Shida Liu, Jorge García Ponce, Luke Zhu, Yuyang Chen, Ekaterina S. Ivshina, Miguel Fernandez, Minjae Kim, Kennan Gumbs, Matthew Scott Tan, Russell Yang, Mai Hoang, David Brown, Isabella A. Silveira, Lavon Sykes, Ahmed Roman, William Fredenberg, Yiming Chen, Lucas Martin, Yixing Tang, Kelly Werker Smith, Hongyu Liao, Logan G. Wilson, Alexander Dazhen Cai, Andrea Elizabeth Biju, Michael P. Brenner

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏