arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2503.00555 2025-06-06 cs.CR cs.AI cs.LG 81%

Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Yichang Xu, Ling Liu

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15109 2025-06-05 cs.CL cs.LG 81%

Social Genome: Grounded Social Reasoning Abilities of Multimodal Models

Leena Mathur, Marian Qian, Paul Pu Liang, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Under Review, 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00334 2025-06-04 cs.CL cs.AI 81%

UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models

Xin Xu, Qiyun Xu, Tong Xiao, Tianhao Chen, Yuchen Yan, Jiaxin Zhang, Shizhe Diao, Can Yang, Yang Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10849 2025-06-04 cs.AI cs.CL 81%

Superhuman performance of a large language model on the reasoning tasks of a physician

Peter G. Brodeur, Thomas A. Buckley, Zahir Kanjee, Ethan Goh, Evelyn Bin Ling, Priyank Jain, Stephanie Cabral, Raja-Elie Abdulnour, Adrian D. Haimovich, Jason A. Freed, Andrew Olson, Daniel J. Morgan, Jason Hom, Robert Gallo, Liam G. McCoy, Haadi Mombini, Christopher Lucas, Misha Fotoohi, Matthew Gwiazdon, Daniele Restifo, Daniel Restrepo, Eric Horvitz, Jonathan Chen, Arjun K. Manrai, Adam Rodman

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00577 2025-06-03 cs.AI cs.CL cs.GT cs.MA 81%

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs

Yufa Zhou, Shaobo Wang, Xingyu Dong, Xiangqi Jin, Yifang Chen, Yue Min, Kexin Yang, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

机构 * Duke University(杜克大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Qwen Team, Alibaba Group(阿里集团Qwen团队) University of Pennsylvania(宾夕法尼亚大学) The University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00279 2025-06-03 cs.AI cs.LG 81%

Sleep Brain and Cardiac Activity Predict Cognitive Flexibility and Conceptual Reasoning Using Deep Learning

Boshra Khajehpiri, Eric Granger, Massimiliano de Zambotti, Fiona C. Baker, Mohamad Forouzanfar

机构 * Laboratoire d’imagerie, de vision et d’intelligence artificielle (LIVIA), École de technologie supérieure (ÉTS), Université du Québec(图像、视觉和人工智能实验室(LIVIA),工程学院(ÉTS),魁北克大学) Ouraring Inc(Ouraring公司) Center for Health Sciences, SRI International(健康科学中心,SRI国际)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments This work was accepted for publication in IEEE EMBC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23843 2025-06-02 cs.CL cs.LG 81%

Evaluation Hallucination in Multi-Round Incomplete Information Lateral-Driven Reasoning Tasks

Wenhan Dong, Tianyi Hu, Jingyi Zheng, Zhen Sun, Yuemeng Zhao, Yule Liu, Xinlei He, Xinyi Huang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22457 2025-05-29 cs.CV cs.AI cs.CL 81%

Fostering Video Reasoning via Next-Event Prediction

Haonan Wang, Hongfu Liu, Xiangyan Liu, Chao Du, Kenji Kawaguchi, Ye Wang, Tianyu Pang

机构 * National University of Singapore(新加坡国立大学) Sea AI Lab(Sea AI实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19259 2025-05-29 cs.LG cs.AI 81%

Towards Large Reasoning Models for Agriculture

Hossein Zaremehrjerdi, Shreyan Ganguly, Ashlyn Rairdin, Elizabeth Tranel, Benjamin Feuer, Juan Ignacio Di Salvo, Srikanth Panthulugiri, Hernan Torres Pacin, Victoria Moser, Sarah Jones, Joscif G Raigne, Yanben Shen, Heidi M. Dornath, Aditya Balu, Adarsh Krishnamurthy, Asheesh K Singh, Arti Singh, Baskar Ganapathysubramanian, Chinmay Hegde, Soumik Sarkar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20643 2025-05-28 cs.LG cs.AI 81%

Can Past Experience Accelerate LLM Reasoning?

Bo Pan, Liang Zhao

机构 * Bo Pan Liang Zhao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19954 2025-05-27 cs.LG cs.CL 81%

An Explainable Diagnostic Framework for Neurodegenerative Dementias via Reinforcement-Optimized LLM Reasoning

Andrew Zamai, Nathanael Fijalkow, Boris Mansencal, Laurent Simon, Eloi Navet, Pierrick Coupe

机构 * Univ. Bordeaux(波尔多大学) CNRS Bordeaux INP LaBRI UMR 5800(法国国家科学研究中心波尔多研究所LaBRI UMR 5800) F-33400 Talence France(法国塔兰斯(Talence))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18467 2025-05-27 cs.AI cs.CL 81%

Pedagogy-R1: Pedagogically-Aligned Reasoning Model with Balanced Educational Benchmark

Unggi Lee, Jaeyong Lee, Jiyeong Bae, Yeil Jeong, Junbo Koh, Gyeonggeon Lee, Gunho Lee, Taekyung Ahn, Hyeoncheol Kim

机构 * Enuma, Inc.(Enuma公司) Seoul National University(首尔国立大学) Nanyang Technological University(南洋理工大学) Korea University(韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17897 2025-05-26 cs.AI cs.CL 81%

T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation

Zi-Ao Ma, Tian Lan, Rong-Cheng Tu, Shu-Hang Liu, Heyan Huang, Zhijing Wu, Chen Xu, Xian-Ling Mao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16673 2025-05-23 cs.CV cs.AI cs.CL 81%

R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO

Huanjin Yao, Qixiang Yin, Jingyi Zhang, Min Yang, Yibo Wang, Wenhao Wu, Fei Su, Li Shen, Minghui Qiu, Dacheng Tao, Jiaxing Huang

机构 * Nanyang Technological University(南洋理工大学) ByteDance(字节跳动) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15245 2025-05-22 cs.CL cs.AI 81%

Towards Explainable Temporal Reasoning in Large Language Models: A Structure-Aware Generative Framework

Zihao Jiang, Ben Liu, Miao Peng, Wenjie Xu, Yao Xiao, Zhenyan Shan, Min Peng

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments In Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20930 2025-05-22 cs.AI cs.CL cs.CV 81%

ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification

Ziqing Fan, Cheng Liang, Chaoyi Wu, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14064 2025-05-21 eess.IV cs.AI cs.CV cs.LG 81%

NOVA: A Benchmark for Anomaly Localization and Clinical Reasoning in Brain MRI

Cosmin I. Bercea, Jun Li, Philipp Raffler, Evamaria O. Riedel, Lena Schmitzer, Angela Kurz, Felix Bitzer, Paula Roßmüller, Julian Canisius, Mirjam L. Beyrle, Che Liu, Wenjia Bai, Bernhard Kainz, Julia A. Schnabel, Benedikt Wiestler

机构 * Technical University of Munich(慕尼黑技术大学) Klinikum Rechts der Isar(莱比锡医院) Helmholtz Center Munich(慕尼黑海德堡中心) FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡弗赖堡大学) Imperial College London(伦敦帝国理工学院) King’s College London(伦敦国王学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13498 2025-05-21 cs.CL cs.AI 81%

IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation

Khanh-Tung Tran, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork(科尔克大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11074 2025-05-21 cs.CL cs.AI 81%

RoMath: A Mathematical Reasoning Benchmark in Romanian

Adrian Cosma, Ana-Maria Bucur, Emilian Radoi

机构 * POLITEHNICA Bucharest National University of Science and Technology(巴格达理工大学科学与技术国立大学) Interdisciplinary School of Doctoral Studies, University of Bucharest(布加勒斯特大学跨学科博士研究学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 5 Figures, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11849 2025-05-20 cs.AI cs.AR cs.LG cs.PL 81%

VeriReason: Reinforcement Learning with Testbench Feedback for Reasoning-Enhanced Verilog Generation

Yiting Wang, Guoheng Sun, Wanghao Ye, Gang Qu, Ang Li

机构 * Department of Electrical Engineering, University of Maryland(电气工程系,马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01698 2025-05-19 cs.CL cs.AI 81%

Do Theory of Mind Benchmarks Need Explicit Human-like Reasoning in Language Models?

Yi-Long Lu, Chunhui Zhang, Jiajun Song, Lifeng Fan, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10182 2025-05-16 cs.CL cs.LG 81%

Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning

Yoichi Ishibashi, Taro Yano, Masafumi Oyamada

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13517 2025-05-14 cs.CL cs.AI 81%

CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning

Hao Cui, Zahra Shamsi, Gowoon Cheon, Xuejian Ma, Shutong Li, Maria Tikhanovskaya, Peter Norgaard, Nayantara Mudur, Martyna Plomecka, Paul Raccuglia, Yasaman Bahri, Victor V. Albert, Pranesh Srinivasan, Haining Pan, Philippe Faist, Brian Rohr, Ekin Dogus Cubuk, Muratahan Aykol, Amil Merchant, Michael J. Statt, Dan Morris, Drew Purves, Elise Kleeman, Ruth Alcantara, Matthew Abraham, Muqthar Mohammad, Ean Phing VanLee, Chenfei Jiang, Elizabeth Dorfman, Eun-Ah Kim, Michael P Brenner, Viren Jain, Sameera Ponda, Subhashini Venugopalan

机构 * Google(谷歌) Harvard(哈佛大学) University of Zurich(苏黎世大学) NIST(国家标准与技术研究院) UMD College Park(大学公园大学分校) Rutgers(罗格斯大学) FU Berlin(柏林自由大学) Modelyst Cornell(康奈尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at ICLR 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05093 2025-05-13 cs.CL cs.AI 81%

Order Matters in Hallucination: Reasoning Order as Benchmark and Reflexive Prompting for Large-Language-Models

Zikai Xie

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 8 pages, submitted to ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15627 2025-05-07 cs.LG cs.AI 81%

HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI

Tidor-Vlad Pricope

机构 * Independent Machine Learning Engineer(独立机器学习工程师)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01539 2025-05-06 cs.AI cs.LG 81%

Parameterized Argumentation-based Reasoning Tasks for Benchmarking Generative Language Models

Cor Steging, Silja Renooij, Bart Verheij

机构 * Bernoulli Institute of Mathematics, Computer Science and Artificial Intelligence, University of Groningen(伯努利数学、计算机科学和人工智能研究所,格罗宁根大学) Department of Information and Computing Sciences, Utrecht University(信息与计算科学系,乌得勒支大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments This manuscript has been accepted for presentation as a short paper at the 20th International Conference of AI & Law in Chicago, June 16 to 20 of 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12511 2025-04-18 cs.HC cs.AI cs.CV cs.LG 81%

Multimodal LLM Augmented Reasoning for Interpretable Visual Perception Analysis

Shravan Chaudhari, Trilokya Akula, Yoon Kim, Tom Blake

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12256 2025-04-17 cs.CV cs.AI cs.LG 81%

FLIP Reasoning Challenge

Andreas Plesner, Turlan Kuzhagaliyev, Roger Wattenhofer

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Published at First Workshop on Open Science for Foundation Models at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19955 2025-04-17 cs.LG cs.AI cs.IR 81%

Bridging Stepwise Lab-Informed Pretraining and Knowledge-Guided Learning for Diagnostic Reasoning

Pengfei Hu, Chang Lu, Fei Wang, Yue Ning

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11186 2025-04-16 cs.CL cs.AI 81%

Benchmarking Next-Generation Reasoning-Focused Large Language Models in Ophthalmology: A Head-to-Head Evaluation on 5,888 Items

Minjie Zou, Sahana Srinivasan, Thaddaeus Wai Soon Lo, Ke Zou, Gabriel Dawei Yang, Xuguang Ai, Hyunjae Kim, Maxwell Singer, Fares Antaki, Kelvin Li, Robert Chang, Marcus Tan, David Ziyou Chen, Dianbo Liu, Qingyu Chen, Yih Chung Tham

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 83 pages, 6 figures, 3 tables, 9 supplementary figures, 7 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏