arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2412.05725 2025-04-09 cs.CV cs.AI 79%

Black Swan: Abductive and Defeasible Video Reasoning in Unpredictable Events

Aditya Chinchure, Sahithya Ravi, Raymond Ng, Vered Shwartz, Boyang Li, Leonid Sigal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments CVPR 2025. For data, visit https://blackswan.cs.ubc.ca

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03164 2025-04-08 cs.CV cs.AI 79%

NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving

Kexin Tian, Jingrui Mao, Yunlong Zhang, Jiwan Jiang, Yang Zhou, Zhengzhong Tu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01879 2025-04-03 cs.CL cs.CV cs.IR 79%

TransientTables: Evaluating LLMs' Reasoning on Temporally Evolving Semi-structured Tables

Abhilash Shankarampeta, Harsh Mahajan, Tushar Kataria, Dan Roth, Vivek Gupta

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 19 Pages. 21 Tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01296 2025-04-03 cs.CL 79%

ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning

Bairu Hou, Yang Zhang, Jiabao Ji, Yujian Liu, Kaizhi Qian, Jacob Andreas, Shiyu Chang

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);分类 cs.CL

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00016 2025-04-02 cs.CL 79%

Medical Reasoning in LLMs: An In-Depth Analysis of DeepSeek R1

Birger Moell, Fredrik Sand Aronsson, Sanian Akbar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16081 2025-03-31 cs.LG cs.IR 79%

OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning

Zhiyuan Liu, Yuting Zhang, Feng Liu, Changwang Zhang, Ying Sun, Jun Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03562 2025-03-27 cs.CV cs.AI 79%

Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection

Wenqiao Li, Yao Gu, Xintao Chen, Xiaohao Xu, Ming Hu, Xiaonan Huang, Yingna Wu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted by CVPR25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19633 2025-03-26 cs.CL 79%

1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training

Han Zhao, Haotian Wang, Yiping Peng, Sitong Zhao, Xiaoyu Tian, Shuaiting Chen, Yunjie Ji, Xiangang Li

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05069 2025-03-26 cs.CV cs.AI 79%

Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning

Huabin Liu, Filip Ilievski, Cees G. M. Snoek

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18533 2025-03-25 cs.AI 79%

MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning

Dawei Yan, Yang Li, Qing-Guo Chen, Weihua Luo, Peng Wang, Haokui Zhang, Chunhua Shen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18071 2025-03-25 cs.CL 79%

Mind with Eyes: from Language Reasoning to Multimodal Reasoning

Zhiyu Lin, Yifei Gao, Xian Zhao, Yunfan Yang, Jitao Sang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11921 2025-03-24 cs.LG 79%

RePanda: Pandas-powered Tabular Verification and Reasoning

Atoosa Malemir Chegini, Keivan Rezaei, Hamid Eghbalzadeh, Soheil Feizi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13109 2025-03-18 cs.CL 79%

Code-Driven Inductive Synthesis: Enhancing Reasoning Abilities of Large Language Models with Sequences

Kedi Chen, Zhikai Lei, Fan Zhang, Yinqi Zhang, Qin Chen, Jie Zhou, Liang He, Qipeng Guo, Kai Chen, Wei Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12505 2025-03-18 cs.AI cs.CV 79%

MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification

Zhaopan Xu, Pengfei Zhou, Jiaxin Ai, Wangbo Zhao, Kai Wang, Xiaojiang Peng, Wenqi Shao, Hongxun Yao, Kaipeng Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07601 2025-03-18 cs.CV cs.CL 79%

Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models

Jiacong Xu, Shao-Yuan Lo, Bardia Safaei, Vishal M. Patel, Isht Dwivedi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 19 pages, 10 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11348 2025-03-17 cs.CL 79%

RESPONSE: Benchmarking the Ability of Language Models to Undertake Commonsense Reasoning in Crisis Situation

Aissatou Diallo, Antonis Bikakis, Luke Dickens, Anthony Hunter, Rob Miller

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02465 2025-03-17 cs.CL 79%

DetectiveQA: Evaluating Long-Context Reasoning on Detective Novels

Zhe Xu, Jiasheng Ye, Xiaoran Liu, Xiangyang Liu, Tianxiang Sun, Zhigeng Liu, Qipeng Guo, Linlin Li, Qun Liu, Xuanjing Huang, Xipeng Qiu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11996 2025-03-14 cs.CL 79%

Holistic Reasoning with Long-Context LMs: A Benchmark for Database Operations on Massive Textual Data

Seiji Maekawa, Hayate Iso, Nikita Bhutani

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05628 2025-03-13 cs.AI 79%

A Unified Framework for Motion Reasoning and Generation in Human Interaction

Jeongeun Park, Sungjoon Choi, Sangdoo Yun

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments https://vim-motion-language.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08540 2025-03-12 cs.SD cs.AI eess.AS 79%

Mellow: a small audio language model for reasoning

Soham Deshmukh, Satvik Dixit, Rita Singh, Bhiksha Raj

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Checkpoint and dataset available at: https://github.com/soham97/mellow

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07018 2025-03-11 cs.CL 79%

Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit Reasoning

Xintong Li, Jalend Bantupalli, Ria Dharmani, Yuwei Zhang, Jingbo Shang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01145 2025-03-07 cs.CL 79%

Dual Reasoning: A GNN-LLM Collaborative Framework for Knowledge Graph Question Answering

Guangyi Liu, Yongqi Zhang, Yong Li, Quanming Yao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00841 2025-03-04 cs.AI 79%

A Law Reasoning Benchmark for LLM with Tree-Organized Structures including Factum Probandum, Evidence and Experiences

Jiaxin Shen, Jinan Xu, Huiqi Hu, Luyi Lin, Fei Zheng, Guoyang Ma, Fandong Meng, Jie Zhou, Wenjuan Han

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04046 2025-03-04 cs.CC cs.AI 79%

ActionReasoningBench: Reasoning about Actions with and without Ramification Constraints

Divij Handa, Pavel Dolin, Shrinidhi Kumbhar, Tran Cao Son, Chitta Baral

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09961 2025-03-03 cs.SE cs.CL cs.CV 79%

ChartMimic: Evaluating LMM's Cross-Modal Reasoning Capability via Chart-to-Code Generation

Cheng Yang, Chufan Shi, Yaxin Liu, Bo Shui, Junjie Wang, Mohan Jing, Linran Xu, Xinyu Zhu, Siheng Li, Yuxiang Zhang, Gongye Liu, Xiaomei Nie, Deng Cai, Yujiu Yang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to ICLR 2025. Data and code are available at https://github.com/ChartMimic/ChartMimic

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17807 2025-02-26 cs.AI 79%

DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities

Tianyi Zhuang, Chuqiao Kuang, Xiaoguang Li, Yihua Teng, Jihao Wu, Yasheng Wang, Lifeng Shang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13042 2025-02-26 cs.CL 79%

Does Table Source Matter? Benchmarking and Improving Multimodal Scientific Table Understanding and Reasoning

Bohao Yang, Yingji Zhang, Dong Liu, André Freitas, Chenghua Lin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16922 2025-02-25 cs.CL 79%

Benchmarking Temporal Reasoning and Alignment Across Chinese Dynasties

Zhenglin Wang, Jialong Wu, Pengfei LI, Yong Jiang, Deyu Zhou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16428 2025-02-25 cs.CV cs.AI 79%

Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT

Nidhal Jegham, Marwan Abdelatti, Abdeltawab Hendawi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16268 2025-02-25 cs.CL 79%

ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning

Shulin Huang, Linyi Yang, Yan Song, Shuang Chen, Leyang Cui, Ziyu Wan, Qingcheng Zeng, Ying Wen, Kun Shao, Weinan Zhang, Jun Wang, Yue Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏