arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-20 至 2025-08-20 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 13 篇

2507.17303 2025-08-20 eess.IV cs.AI cs.CV 85%

A Versatile Pathology Co-pilot via Reasoning Enhanced Multimodal Large Language Model

Zhe Xu, Ziyi Liu, Junlin Hou, Jiabo Ma, Cheng Jin, Yihui Wang, Zhixuan Chen, Zhengyu Zhang, Fuxiang Huang, Zhengrui Guo, Fengtao Zhou, Yingxue Xu, Xi Wang, Ronald Cheong Kin Chan, Li Liang, Hao Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Southern Medical University(南方医科大学) Nanfang Hospital and School of Basic Medical Sciences(南方医院和基础医学科学学院) Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13192 2025-08-20 eess.IV cs.CV 82%

Benchmarking GPT-5 for Zero-Shot Multimodal Medical Reasoning in Radiology and Radiation Oncology

Mingzhe Hu, Zach Eidex, Shansong Wang, Mojtaba Safari, Qiang Li, Xiaofeng Yang

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13692 2025-08-20 cs.CV 75%

HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes

Keliang Li, Hongze Shen, Hao Shi, Ruibing Hou, Hong Chang, Jie Huang, Chenghao Jia, Wen Wang, Yiling Wu, Dongmei Jiang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)、计算技术研究所、中国)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13930 2025-08-20 cs.IR cs.AI 70%

InPars+: Supercharging Synthetic Data Generation for Information Retrieval Systems

Matey Krastev, Miklos Hamar, Danilo Toapanta, Jesse Brouwers, Yibin Lei

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21447 2025-08-20 cs.SE cs.ET 67%

LLM4VV: Evaluating Cutting-Edge LLMs for Generation and Evaluation of Directive-Based Parallel Programming Model Compiler Tests

Zachariah Sollenberger, Rahul Patel, Saieda Ali Zada, Sunita Chandrasekaran

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18499 2025-08-20 cs.LG cs.AI stat.ML 62%

G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning

Xiaojun Guo, Ang Li, Yifei Wang, Stefanie Jegelka, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(慕尼黑工业大学) School of CIT, MCML, MDSIEECS and CSAIL(计算机学院、MCML、MDSIEECS和CSAIL)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13186 2025-08-20 cs.CL cs.AI cs.CV 62%

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Shilong Li, Xingyuan Bu, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Wangchunshu Zhou, Zhaoxiang Zhang, Ruizhe Ding, Shilei Wen

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments The first two authors contribute equally, 26 pages, repo at https://github.com/MMBrowseComp/MM-BrowseComp

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13938 2025-08-20 cs.CL cs.CV 57%

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models

Jiacheng Ruan, Dan Jiang, Xian Gao, Ting Liu, Yuzhuo Fu, Yangyang Kang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13757 2025-08-20 cs.SE cs.AI 57%

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

James Meaden, Michał Jarosz, Piotr Jodłowski, Grigori Melnik

机构 * Codility

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13206 2025-08-20 cs.CL 57%

BQA: Body Language Question Answering Dataset for Video Large Language Models

Shintaro Ozaki, Kazuki Hayashi, Miyu Oba, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to ACL2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13223 2025-08-20 cs.CV cs.AI 57%

MIRAGE: Towards AI-Generated Image Detection in the Wild

Cheng Xia, Manxi Lin, Jiexiang Tan, Xiaoxiong Du, Yang Qiu, Junjun Zheng, Xiangheng Kong, Yuning Jiang, Bo Zheng

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13992 2025-08-20 eess.AS cs.SD 50%

MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence

Sonal Kumar, Šimon Sedláček, Vaibhavi Lokegaonkar, Fernando López, Wenyi Yu, Nishit Anand, Hyeonggon Ryu, Lichang Chen, Maxim Plička, Miroslav Hlaváček, William Fineas Ellingwood, Sathvik Udupa, Siyuan Hou, Allison Ferner, Sara Barahona, Cecilia Bolaños, Satish Rahi, Laura Herrera-Alarcón, Satvik Dixit, Siddhi Patil, Soham Deshmukh, Lasha Koroshinadze, Yao Liu, Leibny Paola Garcia Perera, Eleni Zanou, Themos Stafylakis, Joon Son Chung, David Harwath, Chao Zhang, Dinesh Manocha, Alicia Lozano-Diez, Santosh Kesiraju, Sreyan Ghosh, Ramani Duraiswami

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06189 2025-08-20 cs.CV 50%

MA-CBP: A Criminal Behavior Prediction Framework Based on Multi-Agent Asynchronous Collaboration

Cheng Liu, Daou Zhang, Tingxu Liu, Yuhan Wang, Jinyang Chen, Yuexuan Li, Xinying Xiao, Chenbo Xin, Ziru Wang, Weichao Wu

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏