arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2505.02311 2025-11-11 cs.CL 57%

Invoke Interfaces Only When Needed: Adaptive Invocation for Large Language Models in Question Answering

Jihao Zhao, Chunlai Zhou, Daixuan Li, Shuaishuai Zu, Biao Qin

机构 * School of Information, Renmin University of China(信息学院,中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01894 2025-11-11 cs.CV cs.AI cs.HC 57%

LIVS: A Pluralistic Alignment Dataset for Inclusive Public Spaces

Rashid Mushkani, Shravan Nayak, Hugo Berard, Allison Cohen, Shin Koseki, Hadrien Bertrand

机构 * Mila–Quebec AI Institute(魁北克AI研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16470 2025-11-10 cs.IR cs.CL cs.CV 57%

Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering

Kuicai Dong, Yujing Chang, Shijie Huang, Yasheng Wang, Ruiming Tang, Yong Liu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Paper accepted to NeurIPS 2025 DB

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13956 2025-11-07 cs.AI cs.CV cs.MM 57%

Cross-modal Causal Intervention for Alzheimer's Disease Prediction

Yutao Jin, Haowen Xiao, Junyong Zhai, Yuxiao Li, Jielei Chu, Fengmao Lv, Yuxiao Li

机构 * Southwest Jiaotong University(西南交通大学) Southeast University(东南大学) Sichuan University(四川大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04132 2025-11-07 cs.LG 57%

Exploring the Feasibility of End-to-End Large Language Model as a Compiler

Hongbin Zhang, Shihao Gao, Yang Liu, Mingjie Xing, Yanjun Wu, Chen Zhao

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments This work has been accepted by IJCNN 2025 and submitted to the IEEE for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04093 2025-11-07 cs.AI 57%

KGFR: A Foundation Retriever for Generalized Knowledge Graph Question Answering

Yuanning Cui, Zequn Sun, Wei Hu, Zhangjie Fu

机构 * School of Computer Science, Nanjing University of Information Science and Technology(南京信息工程大学计算机科学学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学教育部长江数字取证工程研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03995 2025-11-07 cs.CR cs.AI 57%

Hybrid Fuzzing with LLM-Guided Input Mutation and Semantic Feedback

Shiyin Lin

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03376 2025-11-06 eess.IV cs.AI q-bio.QM 57%

Computational Imaging Meets LLMs: Zero-Shot IDH Mutation Prediction in Brain Gliomas

Syed Muqeem Mahmood, Hassan Mohy-ud-Din

机构 * School of Science and Engineering, Lahore University of Management Sciences, Lahore, Pakistan(科学与工程学院,拉合尔管理科学大学,巴基斯坦拉合尔)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 5 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02589 2025-11-06 cs.AI 57%

The ORCA Benchmark: Evaluating Real-World Calculation Accuracy in Large Language Models

Claudia Herambourg, Dawid Siuda, Julia Kopczyńska, Joao R. L. Santos, Wojciech Sas, Joanna Śmietańska-Nowak

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03106 2025-11-06 cs.AI 57%

Large language models require a new form of oversight: capability-based monitoring

Katherine C. Kellogg, Bingyang Ye, Yifan Hu, Guergana K. Savova, Byron Wallace, Danielle S. Bitterman

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02778 2025-11-05 cs.CV cs.CL 57%

VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation

Kevin Qinghong Lin, Yuhao Zheng, Hangyu Ran, Dantong Zhu, Dongxing Mao, Linjie Li, Philip Torr, Alex Jinpeng Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Project page: https://csu-jpg.github.io/VCode Github: https://github.com/CSU-JPG/VCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02495 2025-11-05 cs.CV cs.CL 57%

DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding

Zixuan Liu, Siavash H. Khajavi, Guangkai Jiang

机构 * Department of Computer Science(计算机科学系) Tulane University(Tulane 大学) Department of Industrial Engineering and Management(工业工程与管理系) Aalto University(Aalto 大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Advances in Neural Information Processing Systems 2025 (NeurIPS 2025), Poster, https://neurips.cc/virtual/2025/loc/san-diego/poster/121400

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02347 2025-11-05 cs.CL 57%

LTD-Bench: Evaluating Large Language Models by Letting Them Draw

Liuhao Lin, Ke Li, Zihan Xu, Yuchen Shi, Yulei Qin, Yan Zhang, Xing Sun, Rongrong Ji

机构 * Youtu-Agent Team(优图智能团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08039 2025-11-05 cs.SD cs.CL cs.MM eess.AS 57%

Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning

Shu Wu, Chenxing Li, Wenfu Wang, Hao Zhang, Hualei Wang, Meng Yu, Dong Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07453 2025-11-05 cs.AI 57%

How well do LLMs reason over tabular data, really?

Cornelius Wolff, Madelon Hulsebos

机构 * Centrum Wiskunde & Informatica(数学与信息学研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 10 pages, 4 figures

Journal ref The 4th Table Representation Learning Workshop at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01914 2025-11-05 cs.CV cs.AI cs.RO 57%

iFlyBot-VLA Technical Report

Yuan Zhang, Chenyu Xue, Wenjie Xu, Chao Ji, Jiajia wu, Jia Pan

机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01902 2025-11-05 cs.CY cs.AI 57%

Before the Clinic: Transparent and Operable Design Principles for Healthcare AI

Alexander Bakumenko, Aaron J. Masino, Janine Hoelscher

机构 * Clemson University(克莱姆森大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01053 2025-11-04 cs.CL 57%

Building a Silver-Standard Dataset from NICE Guidelines for Clinical LLMs

Qing Ding, Eric Hua Qing Zhang, Felix Jozsa, Julia Ive

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Submitted to EFMI Medical Informatics Europe 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26101 2025-11-04 cs.CL cs.PL quant-ph 57%

QCoder Benchmark: Bridging Language Generation and Quantum Hardware through Simulator-Based Feedback

Taku Mikuriya, Tatsuya Ishigaki, Masayuki Kawarada, Shunya Minami, Tadashi Kadowaki, Yohichi Suzuki, Soshun Naito, Shunya Takata, Takumi Kato, Tamotsu Basseda, Reo Yamada, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Yokohama National University(Yokohama国立大学) CyberAgent, Inc.(CyberAgent公司) DENSO CORPORATION(DENSO公司) The University of Tokyo(东京大学) Keio University(庆应义塾大学) NTT DATA GROUP Corporation(NTT DATA集团公司) Miletos inc.(Miletos公司) University of Tsukuba(筑波大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to INLG2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22765 2025-11-04 cs.AI 57%

Jarvis: Towards Personalized AI Assistant via Personal KV-Cache Retrieval

Binxiao Xu, Junyu Feng, Shaolin Lu, Yulin Luo, Shilin Yan, Hao Liang, Ming Lu, Wentao Zhang

机构 * Peking University(北京大学) Xi’an Jiaotong University(西安交通大学) Alibaba Group(阿里巴巴集团) Intel Labs China(英特尔中国实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10449 2025-11-04 cs.CV cs.AI 57%

CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding

Hongyong Han, Wei Wang, Gaowei Zhang, Mingjie Li, Yi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Technology Innovation Center for South China Sea Remote Sensing, Surveying and Mapping Collaborative Application, Ministry of Natural Resources(自然资源部南海遥感测绘协同应用技术创新中心) South China Sea Development Research Institute, Ministry of Natural Resources(自然资源部南海发展研究 institute) Inspur Computer Technology Co., Ltd(Inspur 计算机技术有限公司) Shandong Key Laboratory of Advanced Computing(山东先进计算重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13063 2025-11-04 cs.CV cs.CL 57%

PRISM2: Unlocking Multi-Modal General Pathology AI with Clinical Dialogue

Eugene Vorontsov, George Shaikovski, Adam Casson, Julian Viret, Eric Zimmermann, Neil Tenenholtz, Yi Kan Wang, Jan H. Bernhard, Ran A. Godrich, Juan A. Retamero, Jinru Shia, Mithat Gonen, Martin R. Weiser, David S. Klimstra, Razik Yousfi, Nicolo Fusi, Thomas J. Fuchs, Kristen Severson, Siqi Liu

机构 * Paige, NYC, NY United States(美国纽约市帕伊公司) Microsoft Research, Cambridge, MA United States(微软研究院) Memorial Sloan Kettering Cancer Center, NYC, NY United States(纪念斯隆凯特林癌症中心) University of Yale, New Haven, CT United States(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 57%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27610 2025-11-03 cs.LG 57%

ORGEval: Graph-Theoretic Evaluation of LLMs in Optimization Modeling

Zhuohan Wang, Ziwei Zhu, Ziniu Li, Congliang Chen, Yizhou Han, Yufeng Lin, Zhihang Lin, Angyang Gu, Xinglin Hu, Ruoyu Sun, Tian Ding

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24046 2025-11-03 cs.MA cs.AI 57%

PartnerMAS: An LLM Hierarchical Multi-Agent Framework for Business Partner Selection on High-Dimensional Features

Lingyao Li, Haolun Wu, Zhenkun Li, Jiabei Hu, Yu Wang, Xiaoshan Huang, Wenyue Hua, Wenqian Wang

机构 * University of South Florida(佛罗里达州立大学) McGill University(麦吉尔大学) Purdue University(普渡大学) Lingnan University(岭大大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03419 2025-11-03 cs.CL 57%

Curse of Knowledge: When Complex Evaluation Context Benefits yet Biases LLM Judges

Weiyuan Li, Xintao Wang, Siyu Yuan, Rui Xu, Jiangjie Chen, Qingqing Dong, Yanghua Xiao, Deqing Yang

机构 * School of Data Science, Fudan University, 2 Shanghai Key Laboratory of Data Science 3 College of Computer Science and Artificial Intelligence, Fudan University 4 ByteDance Seed, 5 College of Cryptology and Cyber Science, Nankai University(1 数据科学学院,复旦大学 2 上海数据科学实验室 3 计算机科学与人工智能学院,复旦大学 4 字节跳动种子 5 密码学与网络科学学院,南开大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08249 2025-11-03 cs.DB cs.CL 57%

RADAR: Benchmarking Language Models on Imperfect Tabular Data

Ken Gu, Zhihan Zhang, Kate Lin, Yuwei Zhang, Akshay Paruchuri, Hong Yu, Mehran Kazemi, Kumar Ayush, A. Ali Heydari, Maxwell A. Xu, Girish Narayanswamy, Yun Liu, Ming-Zher Poh, Yuzhe Yang, Mark Malhotra, Shwetak Patel, Hamid Palangi, Xuhai Xu, Daniel McDuff, Tim Althoff, Xin Liu

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14681 2025-10-31 cs.CL 57%

Massive Supervised Fine-tuning Experiments Reveal How Data, Layer, and Training Factors Shape LLM Alignment Quality

Yuto Harada, Yusuke Yamauchi, Yusuke Oda, Yohei Oseki, Yusuke Miyao, Yu Takagi

机构 * NII LLMC(日本信息处理学会大语言模型中心) The University of Tokyo(东京大学) NAIST(日本科学技术大学) Nagoya Institute of Technology(名古屋技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference). Models and evaluation results available at: https://github.com/llm-jp/massive-sft

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26309 2025-10-31 cs.AI cs.IR 57%

GraphCompliance: Aligning Policy and Context Graphs for LLM-Based Regulatory Compliance

Jiseong Chung, Ronny Ko, Wonchul Yoo, Makoto Onizuka, Sungmok Kim, Tae-Wan Kim, Won-Yong Shin

机构 * Seoul National University(首尔国立大学) Osaka University(大阪大学) Yonsei University(延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Under review at The Web Conference 2026 (Semantics & Knowledge track). Code will be released upon acceptance. This arXiv v1 contains no repository links to preserve double-blind review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26238 2025-10-31 cs.AI 57%

Questionnaire meets LLM: A Benchmark and Empirical Study of Structural Skills for Understanding Questions and Responses

Duc-Hai Nguyen, Vijayakumar Nanjappan, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork(科克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 14 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏