arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-21 至 2025-08-21 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 13 篇

2508.14063 2025-08-21 cs.IR cs.AI 83%

A Multi-Agent Approach to Neurological Clinical Reasoning

Moran Sorka, Alon Gorenshtein, Dvir Aran, Shahar Shelly

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10287 2025-08-21 cs.CV 78%

JRDB-Reasoning: A Difficulty-Graded Benchmark for Visual Reasoning in Robotics

Simindokht Jahangard, Mehrzad Mohammadi, Yi Shen, Zhixi Cai, Hamid Rezatofighi

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14706 2025-08-21 cs.CL cs.AI cs.CV cs.LG cs.MM 67%

ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine

Junying Chen, Zhenyang Cai, Zhiheng Liu, Yunjin Yang, Rongsheng Wang, Qingying Xiao, Xiangyi Feng, Zhan Su, Jing Guo, Xiang Wan, Guangjun Yu, Haizhou Li, Benyou Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12096 2025-08-21 cs.CL cs.AI cs.LG 67%

STEM: Efficient Relative Capability Evaluation of LLMs through Structured Transition Samples

Haiquan Hu, Jiazhi Jiang, Shiyou Xu, Ruhan Zeng, Tian Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submit to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02906 2025-08-21 cs.CL cs.AI 62%

Boosting Chart-to-Code Generation in MLLM via Dual Preference-Guided Refinement

Zhihan Zhang, Yixin Cao, Lizi Liao

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06569 2025-08-21 cs.CL cs.AI 62%

Social Debiasing for Fair Multi-modal LLMs

Harry Cheng, Yangyang Guo, Qingpei Guo, Ming Yang, Tian Gan, Weili Guan, Liqiang Nie

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Project page: https://github.com/xaCheng1996/Social_Debiasing_For_Fair_MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03608 2025-08-21 cs.AI cs.DC cs.ET cs.NI 57%

Benchmarking Vector, Graph and Hybrid Retrieval Augmented Generation (RAG) Pipelines for Open Radio Access Networks (ORAN)

Sarat Ahmad, Zeinab Nezami, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13790 2025-08-21 cs.AI 57%

The NordDRG AI Benchmark for Large Language Models

Tapio Pitkäranta

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Aalto University(阿alto大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13953 2025-08-21 cs.AI 57%

Benchmarking graph construction by large language models for coherence-driven inference

Steve Huntsman, Jewell Thomas

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11370 2025-08-21 cs.CL 57%

G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model

Jiahui Gao, Renjie Pi, Jipeng Zhang, Jiacheng Ye, Wanjun Zhong, Yufei Wang, Lanqing Hong, Jianhua Han, Hang Xu, Zhenguo Li, Lingpeng Kong

机构 * Noah’s Ark Lab(诺亚 Ark 实验室) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14080 2025-08-21 cs.LG 57%

KnowDR-REC: A Benchmark for Referring Expression Comprehension with Real-World Knowledge

Guanghao Jin, Jingpei Wu, Tianpei Guo, Yiyi Niu, Weidong Zhou, Guoyang Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21755 2025-08-21 cs.CV 50%

VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness

Dian Zheng, Ziqi Huang, Hongbo Liu, Kai Zou, Yinan He, Fan Zhang, Lulu Gu, Yuanhan Zhang, Jingwen He, Wei-Shi Zheng, Yu Qiao, Ziwei Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

Comments Equal contributions from first two authors. Project page: https://vchitect.github.io/VBench-2.0-project/ Code: https://github.com/Vchitect/VBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02028 2025-08-21 cs.CV 50%

Bench2ADVLM: A Closed-Loop Benchmark for Vision-language Models in Autonomous Driving

Tianyuan Zhang, Ting Jin, Lu Wang, Jiangfan Liu, Siyuan Liang, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Nanyang Technological University(南洋理工大学) Henan University of Science and Technology(河南科技大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏