arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2412.14588 2025-02-25 cs.CL 79%

Beyond Guilt: Legal Judgment Prediction with Trichotomous Reasoning

Kepu Zhang, Haoyue Yang, Xu Tang, Weijie Yu, Jun Xu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14083 2025-02-21 cs.CL 79%

Are Rules Meant to be Broken? Understanding Multilingual Moral Reasoning as a Computational Pipeline with UniMoral

Shivani Kumar, David Jurgens

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 21 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13119 2025-02-20 cs.CL 79%

STEER-ME: Assessing the Microeconomic Reasoning of Large Language Models

Narun Raman, Taylor Lundy, Thiago Amin, Jesse Perla, Kevin Leyton-Brown

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10674 2025-02-19 cs.CV cs.CL 79%

Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!

Mohamed Fazli Imam, Chenyang Lyu, Alham Fikri Aji

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Our dataset can be found at \url{https://huggingface.co/datasets/fazliimam/temporal-vqa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09447 2025-02-14 cs.CV cs.CL 79%

Pixel-Level Reasoning Segmentation via Multi-turn Conversations

Dexian Cai, Xiaocui Yang, Yongkang Liu, Daling Wang, Shi Feng, Yifei Zhang, Soujanya Poria

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08954 2025-02-14 cs.CL 79%

Medicine on the Edge: Comparative Performance Analysis of On-Device LLMs for Clinical Reasoning

Leon Nissen, Philipp Zagar, Vishnu Ravi, Aydin Zahedivash, Lara Marie Reimer, Stephan Jonas, Oliver Aalami, Paul Schmiedmayer

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08235 2025-02-13 cs.AI 79%

The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks

Alejandro Cuadron, Dacheng Li, Wenjie Ma, Xingyao Wang, Yichuan Wang, Siyuan Zhuang, Shu Liu, Luis Gaspar Schroeder, Tian Xia, Huanzhi Mao, Nicholas Thumiger, Aditya Desai, Ion Stoica, Ana Klimovic, Graham Neubig, Joseph E. Gonzalez

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08148 2025-02-13 cs.AI 79%

ACCESS : A Benchmark for Abstract Causal Event Discovery and Reasoning

Vy Vo, Lizhen Qu, Tao Feng, Yuncheng Hua, Xiaoxi Kang, Songhai Fan, Tim Dwyer, Lay-Ki Soon, Gholamreza Haffari

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Journal ref Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07912 2025-02-13 cs.CL 79%

Elevating Legal LLM Responses: Harnessing Trainable Logical Structures and Semantic Knowledge with Legal Reasoning

Rujing Yao, Yang Wu, Chenghao Wang, Jingwei Xiong, Fang Wang, Xiaozhong Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08597 2025-01-16 cs.CL 79%

Dynamic Knowledge Integration for Enhanced Vision-Language Reasoning

Julian Perry, Surasakdi Siripong, Thanakorn Phonchai

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14526 2025-01-14 cs.SD cs.CL eess.AS 79%

What Are They Doing? Joint Audio-Speech Co-Reasoning

Yingzhi Wang, Pooneh Mousavi, Artem Ploujnikov, Mirco Ravanelli

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01290 2025-01-03 cs.CL 79%

ToolComp: A Multi-Tool Reasoning & Process Supervision Benchmark

Vaskar Nath, Pranav Raja, Claire Yoon, Sean Hendryx

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11711 2024-12-25 cs.CL 79%

MiMoTable: A Multi-scale Spreadsheet Benchmark with Meta Operations for Table Reasoning

Zheng Li, Yang Du, Mao Zheng, Mingyang Song

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16849 2024-12-24 cs.AI 79%

OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning

Yuxiang Zhang, Yuqi Yang, Jiangming Shu, Yuhang Wang, Jinlin Xiao, Jitao Sang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19732 2024-12-23 cs.CL cs.CV 79%

Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models

Yucheng Zhou, Zhi Rao, Jun Wan, Jianbing Shen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11763 2024-12-17 cs.CL 79%

QUENCH: Measuring the gap between Indic and Non-Indic Contextual General Reasoning in LLMs

Mohammad Aflah Khan, Neemesh Yadav, Sarah Masud, Md. Shad Akhtar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 17 Pages, 6 Figures, 8 Tables, COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18375 2024-12-17 cs.CL 79%

Thai Winograd Schemas: A Benchmark for Thai Commonsense Reasoning

Phakphum Artkaew

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to SEALP 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15891 2024-11-26 cs.LG 79%

From Laws to Motivation: Guiding Exploration through Law-Based Reasoning and Rewards

Ziyu Chen, Zhiqing Xiao, Xinbei Jiang, Junbo Zhao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07681 2024-11-19 cs.LG 79%

What Do Learning Dynamics Reveal About Generalization in LLM Reasoning?

Katie Kang, Amrith Setlur, Dibya Ghosh, Jacob Steinhardt, Claire Tomlin, Sergey Levine, Aviral Kumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00369 2024-11-11 cs.CL 79%

GRS-QA -- Graph Reasoning-Structured Question Answering Dataset

Anish Pahilajani, Devasha Trivedi, Jincen Shuai, Khin S. Yone, Samyak Rajesh Jain, Namyong Park, Ryan A. Rossi, Nesreen K. Ahmed, Franck Dernoncourt, Yu Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 15 pages, 24 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03314 2024-11-06 cs.CV cs.CL 79%

MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning

Ziliang Gan, Yu Lu, Dong Zhang, Haohan Li, Che Liu, Jian Liu, Ji Liu, Haipang Wu, Chaoyou Fu, Zenglin Xu, Rongjunchen Zhang, Yong Dai

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Project Page: https://hithink-research.github.io/MME-Finance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11161 2024-11-05 cs.AI cs.MM 79%

Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning

Zebang Cheng, Zhi-Qi Cheng, Jun-Yan He, Jingdong Sun, Kai Wang, Yuxiang Lin, Zheng Lian, Xiaojiang Peng, Alexander Hauptmann

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted at NeurIPS 2024. 49 pages, 13 figures, Project: https://github.com/ZebangCheng/Emotion-LLaMA, Demo: https://huggingface.co/spaces/ZebangCheng/Emotion-LLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06196 2024-11-01 cs.CL 79%

LINGOLY: A Benchmark of Olympiad-Level Linguistic Reasoning Puzzles in Low-Resource and Extinct Languages

Andrew M. Bean, Simi Hellsten, Harry Mayne, Jabez Magomere, Ethan A. Chi, Ryan Chi, Scott A. Hale, Hannah Rose Kirk

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Oral presentation at NeurIPS 2024 Datasets and Benchmarks Track. 10 pages, 5 figures, 22 pages supplemental materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02130 2024-11-01 cs.CL 79%

GITA: Graph to Visual and Textual Integration for Vision-Language Graph Reasoning

Yanbin Wei, Shuai Fu, Weisen Jiang, Zejian Zhang, Zhixiong Zeng, Qi Wu, James T. Kwok, Yu Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments NeurIPS 2024; Project Page: v-graph.github.io; Code: https://github.com/WEIYanbin1999/GITA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17558 2024-10-28 cs.AI 79%

CLR-Bench: Evaluating Large Language Models in College-level Reasoning

Junnan Dong, Zijin Hong, Yuanchen Bei, Feiran Huang, Xinrun Wang, Xiao Huang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 18 pages, 6 figures, dataset and evaluation framework will be opensourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14074 2024-10-28 cs.AI cs.IR 79%

Message Intercommunication for Inductive Relation Reasoning

Ke Liang, Lingyuan Meng, Sihang Zhou, Siwei Wang, Wenxuan Tu, Yue Liu, Meng Liu, Xinwang Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18925 2024-10-24 cs.CL cs.CV 79%

Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding

Jiwan Chung, Sungjae Lee, Minseo Kim, Seungju Han, Ashkan Yousefpour, Jack Hessel, Youngjae Yu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments 12 pages, 6 figures. Accepted as main paper in EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09603 2024-10-22 cs.CL 79%

Self-Contradictory Reasoning Evaluation and Detection

Ziyi Liu, Soumya Sanyal, Isabelle Lee, Yongkang Du, Rahul Gupta, Yang Liu, Jieyu Zhao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19764 2024-10-18 cs.CL 79%

Belief Revision: The Adaptability of Large Language Models Reasoning

Bryan Wilie, Samuel Cahyawijaya, Etsuko Ishii, Junxian He, Pascale Fung

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10020 2024-10-15 cs.AI 79%

Adaptive Reasoning and Acting in Medical Language Agents

Abhishek Dutta, Yen-Che Hsiao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏