arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2409.12962 2025-08-12 cs.CL cs.SD eess.AS 57%

CLAIR-A: Leveraging Large Language Models to Judge Audio Captions

Tsung-Han Wu, Joseph E. Gonzalez, Trevor Darrell, David M. Chan

机构 * Department of Electrical Engineering and Computer Science (EECS)(电气工程与计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to ASRU 2025; Code is publicly available at https://github.com/DavidMChan/clair-a

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06851 2025-08-12 cs.AI cs.CY 57%

MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams

Pengfei Zhou, Xiaopeng Peng, Fanrui Zhang, Zhaopan Xu, Jiaxin Ai, Yansheng Qiu, Chuanhao Li, Zhen Li, Ming Li, Yukang Feng, Jianwen Sun, Haoquan Zhang, Zizhen Li, Xiaofeng Mao, Zekai Li, Wangbo Zhao, Kai Wang, Xiaojun Chang, Wenqi Shao, Yang You, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) USTC(中国科学技术大学) RIT(罗切斯特理工学院) HIT(哈尔滨工业大学) WHU(武汉大学) MBZUAI(马克斯·普朗克人工智能研究所) NUS(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 35 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04030 2025-08-11 cs.SE cs.CL 57%

OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs

Wasi Uddin Ahmad, Aleksander Ficek, Mehrzad Samadi, Jocelyn Huang, Vahid Noroozi, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA圣克拉拉分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01943 2025-08-11 cs.CL 57%

OpenCodeReasoning: Advancing Data Distillation for Competitive Coding

Wasi Uddin Ahmad, Sean Narenthiran, Somshubra Majumdar, Aleksander Ficek, Siddhartha Jain, Jocelyn Huang, Vahid Noroozi, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA圣克拉拉分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05508 2025-08-08 cs.AI 57%

Auto-Eval Judge: Towards a General Agentic Framework for Task Completion Evaluation

Roshita Bhonsle, Rishav Dutta, Sneha Vavilapalli, Harsh Seth, Abubakarr Jaye, Yapei Chang, Mukund Rungta, Emmanuel Aboah Boateng, Sadid Hasan, Ehi Nosakhare, Soundar Srinivasan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft Corporation(微软公司) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05468 2025-08-08 cs.CL 57%

TASE: Token Awareness and Structured Evaluation for Multilingual Language Models

Chenzhuo Zhao, Xinda Wang, Yue Huang, Junting Lu, Ziqian Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05428 2025-08-08 cs.LG 57%

Group Causal Policy Optimization for Post-Training Large Language Models

Ziyin Gu, Jingyao Wang, Ran Zuo, Chuxiong Sun, Zeen Song, Changwen Zheng, Wenwen Qiang

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04720 2025-08-08 cs.AI 57%

Who is a Better Player: LLM against LLM

Yingjie Zhou, Jiezhang Cao, Farong Wen, Li Xu, Yanwei Jiang, Jun Jia, Ronghui Li, Xiaohong Liu, Yu Zhou, Xiongkuo Min, Jie Guo, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) PengCheng Laboratory(鹏城实验室) Harvard Medical School(哈佛医学院) Shanghai AI Laboratory(上海人工智能实验室) China University of Mining and Technology(中国矿业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19168 2025-08-08 cs.CL 57%

Language Model Uncertainty Quantification with Attention Chain

Yinghao Li, Rushi Qiang, Lama Moukheiber, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 36 pages, 7 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17519 2025-08-08 cs.CL 57%

Large Language Models Still Exhibit Bias in Long Text

Wonje Jeung, Dongjae Jeon, Ashkan Yousefpour, Jonghyun Choi

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACL, code and models are available at https://github.com/WonjeJeung/LTF-TEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04576 2025-08-07 cs.AI 57%

ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges

Yue Zhou, Yi Chang, Yuan Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04279 2025-08-07 cs.LG 57%

Mockingbird: How does LLM perform in general machine learning tasks?

Haoyu Jia, Yoshiki Obinata, Kento Kawaharazuka, Kei Okada

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04642 2025-08-07 cs.CL 57%

R1-RE: Cross-Domain Relation Extraction with RLVR

Runpeng Dai, Tong Zheng, Run Yang, Kaixian Yu, Hongtu Zhu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Maryland College Park(马里兰大学学院市分校) BiliBili(哔哩哔哩) Insilicom LLC(Insilicom公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14194 2025-08-07 cs.CL 57%

Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models

Xinlin Zhuang, Jiahui Peng, Ren Ma, Yinfan Wang, Tianyi Bai, Xingjian Wei, Jiantao Qiu, Chi Zhang, Ying Qian, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2025 Best Theme Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12772 2025-08-07 cs.CV cs.AI cs.RO 57%

NuPlanQA: A Large-Scale Dataset and Benchmark for Multi-View Driving Scene Understanding in Multi-Modal Large Language Models

Sung-Yeon Park, Can Cui, Yunsheng Ma, Ahmadreza Moradipari, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17125 2025-08-07 cs.CV cs.AI 57%

DOGR: Towards Versatile Visual Document Grounding and Referring

Yinan Zhou, Yuxin Chen, Haokun Lin, Yichen Wu, Shuyu Yang, Zhongang Qi, Chen Ma, Li Zhu, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) City University of Hongkong(香港城市大学) Institute of Automation, CAS(中国科学院自动化研究所) Harvard University(哈佛大学) vivo Mobile Communication Co.(vivo移动通信公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 22 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03622 2025-08-06 cs.AI 57%

Refining Critical Thinking in LLM Code Generation: A Faulty Premise-based Evaluation Framework

Jialin Li, Jinzhe Li, Gengxu Li, Yi Chang, Yuan Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05895 2025-08-06 cs.CV cs.AI 57%

Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI

Benjamin Raphael Ernhofer, Daniil Prokhorov, Jannica Langner, Dominik Bollmann

机构 * SPARKS Solutions GmbH(SPARKS解决方案有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03109 2025-08-06 cs.AI 57%

AgentSME for Simulating Diverse Communication Modes in Smart Education

Wen-Xi Yang, Tian-Fang Zhao

机构 * Guangdong Institute of Smart Education Jinan University Guangzhou, China School of Journalism \& Communication Jinan University Guangzhou, China

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03080 2025-08-06 cs.AI 57%

ContractEval: Benchmarking LLMs for Clause-Level Legal Risk Identification in Commercial Contracts

Shuang Liu, Zelong Li, Ruoyun Ma, Haiyan Zhao, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) Rutgers University(罗格斯大学) Stanford University(斯坦福大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02994 2025-08-06 cs.AI 57%

When AIs Judge AIs: The Rise of Agent-as-a-Judge Evaluation for LLMs

Fangyi Yu

机构 * Fangyi Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02951 2025-08-06 cs.AI 57%

MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine

Mahtab Bigverdi, Wisdom Ikezogwo, Kevin Zhang, Hyewon Jeong, Mingyu Lu, Sungjae Cho, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Massachusetts Institute of Technology(麻省理工学院) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02765 2025-08-06 cs.CY cs.AI cs.CV 57%

The Architecture of Trust: A Framework for AI-Augmented Real Estate Valuation in the Era of Structured Data

Petteri Teikari, Mike Jarrell, Maryam Azh, Harri Pesola

机构 * Mill Hill Garage JB Real Estate Valuation & Advisory, LLC(JB Real Estate Valuation & Advisory LLC) Atlas Insights

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 46 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19773 2025-08-06 cs.AI 57%

Automatic Prompt Optimization for Knowledge Graph Construction: Insights from an Empirical Study

Nandana Mihindukulasooriya, Niharika S. D'Souza, Faisal Chowdhury, Horst Samulowitz

机构 * IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted at LLM+Graph WS at VLDB 2025. 21 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05347 2025-08-06 cs.CL cs.MA 57%

GEMA-Score: Granular Explainable Multi-Agent Scoring Framework for Radiology Report Evaluation

Zhenxuan Zhang, Kinhei Lee, Peiyuan Jing, Weihang Deng, Huichi Zhou, Zihao Jin, Jiahao Huang, Zhifan Gao, Dominic C Marshall, Yingying Fang, Guang Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15343 2025-08-05 cs.SE cs.AI 57%

StackTrans: From Large Language Model to Large Pushdown Automata Model

Kechi Zhang, Ge Li, Jia Li, Huangzhao Zhang, Yihong Dong, Jia Li, Jingjing Xu, Zhi Jin

机构 * Key Lab of High Confidence Software Technology (PKU), Ministry of Education(高等教育部高性能软件技术重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) ByteDance(字节跳动)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20243 2025-08-05 cs.CL cs.IR 57%

It's High Time: A Survey of Temporal Question Answering

Bhawna Piryani, Abdelrahman Abdallah, Jamshid Mozafari, Avishek Anand, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) Delft University of Technology(代尔夫特理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01746 2025-08-05 cs.AI 57%

Bayes-Entropy Collaborative Driven Agents for Research Hypotheses Generation and Optimization

Shiyang Duan, Yuan Tian, Qi Bing, Xiaowei Shao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Corresponding author: Xiaowei Shao. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01237 2025-08-05 cs.AI 57%

SketchAgent: Generating Structured Diagrams from Hand-Drawn Sketches

Cheng Tan, Qi Chen, Jingxuan Wei, Gaowei Wu, Zhangyang Gao, Siyuan Li, Bihui Yu, Ruifeng Guo, Stan Z. Li

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12441 2025-08-05 cs.CV cs.LG 57%

Describe Anything Model for Visual Question Answering on Text-rich Images

Yen-Linh Vu, Dinh-Thang Duong, Truong-Binh Duong, Anh-Khoi Nguyen, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Jianhua Xing, Xingjian Li, Tianyang Wang, Ulas Bagci, Min Xu

机构 * AI VIETNAM Lab(AI越南实验室) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Northwestern University(西北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 11 pages, 5 figures. Accepted to VisionDocs @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏