arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2505.21068 2025-05-28 cs.CL cs.CV 57%

Predicting Implicit Arguments in Procedural Video Instructions

Anil Batra, Laura Sevilla-Lara, Marcus Rohrbach, Frank Keller

机构 * University of Edinburgh(爱丁堡大学) TU Darmstadt(德累斯顿理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20505 2025-05-28 cs.CL cs.SE 57%

Large Language Models for IT Automation Tasks: Are We There Yet?

Md Mahadi Hassan, John Salvador, Akond Rahman, Santu Karmaker

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19484 2025-05-28 cs.CL 57%

CulFiT: A Fine-grained Cultural-aware LLM Training Paradigm via Multilingual Critique Data Synthesis

Ruixiang Feng, Shen Gao, Xiuying Chen, Lisi Chen, Shuo Shang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20293 2025-05-27 cs.CL 57%

Enhancing the Comprehensibility of Text Explanations via Unsupervised Concept Discovery

Yifan Sun, Danding Wang, Qiang Sheng, Juan Cao, Jintao Li

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Media Synthesis and Forensics Lab(媒体合成与取证实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19973 2025-05-27 cs.CR cs.AI 57%

DFIR-Metric: A Benchmark Dataset for Evaluating Large Language Models in Digital Forensics and Incident Response

Bilel Cherif, Tamas Bisztray, Richard A. Dubniczky, Aaesha Aldahmani, Saeed Alshehhi, Norbert Tihanyi

机构 * Technology Innovation Institute(技术创新研究所) University of Oslo(奥斯陆大学) Eötvös Loránd University(埃斯特哈兹洛朗大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18152 2025-05-27 cs.CL 57%

Fann or Flop: A Multigenre, Multiera Benchmark for Arabic Poetry Understanding in LLMs

Wafa Alghallabi, Ritesh Thawkar, Sara Ghaboura, Ketan More, Omkar Thawakar, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) Australian National University(澳大利亚国立大学) Aalto University(艾尔沃斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Github:https://github.com/mbzuai-oryx/FannOrFlop, Dataset:https://huggingface.co/datasets/omkarthawakar/FannOrFlop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10497 2025-05-27 cs.CL 57%

MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation

Weihao Xuan, Rui Yang, Heli Qi, Qingcheng Zeng, Yunze Xiao, Aosong Feng, Dairui Liu, Yun Xing, Junjue Wang, Fan Gao, Jinghui Lu, Yuang Jiang, Huitao Li, Xin Li, Kunyu Yu, Ruihai Dong, Shangding Gu, Yuekang Li, Xiaofei Xie, Felix Juefei-Xu, Foutse Khomh, Osamu Yoshie, Qingyu Chen, Douglas Teodoro, Nan Liu, Randy Goebel, Lei Ma, Edison Marrese-Taylor, Shijian Lu, Yusuke Iwasawa, Yutaka Matsuo, Irene Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13984 2025-05-27 cs.CL cs.MM 57%

Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI Evaluation

Dimitris Gkoumas, Maria Liakata

机构 * Queen Mary University of London(伦敦女王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19533 2025-05-27 cs.LG 57%

ExAnte: A Benchmark for Ex-Ante Inference in Large Language Models

Yachuan Liu, Xiaochun Wei, Lin Shi, Xinnuo Li, Bohan Zhang, Paramveer Dhillon, Qiaozhu Mei

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19511 2025-05-27 cs.CL 57%

Causal Distillation: Transferring Structured Explanations from Large to Compact Language Models

Aggrey Muhebwa, Khalid K. Osman

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19310 2025-05-27 cs.SE cs.AI 57%

Retrieval-Augmented Generation for Service Discovery: Chunking Strategies and Benchmarking

Robin D. Pesl, Jerin G. Mathew, Massimo Mecella, Marco Aiello

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2411.19804

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19191 2025-05-27 cs.CL 57%

Misleading through Inconsistency: A Benchmark for Political Inconsistencies Detection

Nursulu Sagimbayeva, Ruveyda Betül Bahçeci, Ingmar Weber

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 8 pages, 6 figures. Accepted for publication in the Proceedings of 1st Workshop on Misinformation Detection in the Era of LLMs (MisD) at ICWSM-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19031 2025-05-27 cs.CV cs.AI 57%

Medical Large Vision Language Models with Multi-Image Visual Ability

Xikai Yang, Juzheng Miao, Yuchen Yuan, Jiaze Wang, Qi Dou, Jinpeng Li, Pheng-Ann Heng

机构 * Dept. of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong, China(计算机科学与工程系,香港中文大学,香港,中国) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong, Hong Kong, China(医学智能与XR研究所,香港中文大学,香港,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18575 2025-05-27 cs.AI 57%

Response Uncertainty and Probe Modeling: Two Sides of the Same Coin in LLM Interpretability?

Yongjie Wang, Yibo Wang, Xin Zhou, Zhiqi Shen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 18 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21620 2025-05-27 cs.AI 57%

UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning

Zhengxi Lu, Yuxiang Chai, Yaxuan Guo, Xi Yin, Liang Liu, Hao Wang, Han Xiao, Shuai Ren, Guanjing Xiong, Hongsheng Li

机构 * vivo AI Lab(vivo人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Updated UI-R1-E-3B

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21017 2025-05-27 cs.CL 57%

PersuasiveToM: A Benchmark for Evaluating Machine Theory of Mind in Persuasive Dialogues

Fangxu Yu, Lai Jiang, Shenyi Huang, Zhen Wu, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) University of California, San Diego, CA, USA(美国加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12524 2025-05-27 eess.IV cs.AI cs.CV 57%

Efficient Lung Ultrasound Severity Scoring Using Dedicated Feature Extractor

Jiaqi Guo, Yunan Wu, Evangelos Kaimakamis, Georgios Petmezas, Vasileios E. Papageorgiou, Nicos Maglaveras, Aggelos K. Katsaggelos

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted by IEEE ISBI 2025 (Selected for oral presentation); 2025/4/15 (v2): Corrected a notation error in Figure 2

Journal ref 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, 2025, pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17380 2025-05-26 cs.CL 57%

AI-Augmented LLMs Achieve Therapist-Level Responses in Motivational Interviewing

Yinghui Huang, Yuxuan Jiang, Hui Liu, Yixin Cai, Weiqing Li, Xiangen Hu

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17202 2025-05-26 cs.HC cs.CL cs.CV 57%

CHART-6: Human-Centered Evaluation of Data Visualization Understanding in Vision-Language Models

Arnav Verma, Kushin Mukherjee, Christopher Potts, Elisa Kreiss, Judith E. Fan

机构 * Department of Psychology at Stanford University(斯坦福大学心理学系) Department of Linguistics at Stanford University(斯坦福大学语言学系) Department of Communication at University of California, Los Angeles(加州大学洛杉矶分校传播系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17116 2025-05-26 cs.CL cs.ET 57%

Comparative Evaluation of Prompting and Fine-Tuning for Applying Large Language Models to Grid-Structured Geospatial Data

Akash Dhruv, Yangxinyu Xie, Jordan Branham, Tanwi Mallick

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12972 2025-05-26 cs.CL 57%

KCIF: Knowledge-Conditioned Instruction Following

Rudra Murthy, Praveen Venkateswaran, Prince Kumar, Danish Contractor

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16591 2025-05-23 cs.CL 57%

Evaluating Large Language Model with Knowledge Oriented Language Specific Simple Question Answering

Bowen Jiang, Runchuan Zhu, Jiang Wu, Zinco Jiang, Yifan He, Junyuan Gao, Jia Yu, Rui Min, Yinfan Wang, Haote Yang, Songyang Zhang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai University(上海大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Equal contribution: Bowen Jiang, Runchuan Zhu, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16477 2025-05-23 cs.AI 57%

Advancing the Scientific Method with Large Language Models: From Hypothesis to Discovery

Yanbo Zhang, Sumeer A. Khan, Adnan Mahmud, Huck Yang, Alexander Lavin, Michael Levin, Jeremy Frey, Jared Dunnmon, James Evans, Alan Bundy, Saso Dzeroski, Jesper Tegner, Hector Zenil

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 45 pages

Journal ref npj Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14464 2025-05-23 cs.CL 57%

Not All Correct Answers Are Equal: Why Your Distillation Source Matters

Xiaoyu Tian, Yunjie Ji, Haotian Wang, Shuaiting Chen, Sitong Zhao, Yiping Peng, Han Zhao, Xiangang Li

机构 * Beike (Ke.com)(贝克(凯.com))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15771 2025-05-23 cs.LG 57%

ORION Grounded in Context: Retrieval-Based Method for Hallucination Detection

Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bressler, Shir Chorev, Philip Tannor

机构 * Deepchecks

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14846 2025-05-22 cs.CV cs.CL 57%

Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation

Yue Yang, Ajay Patel, Matt Deitke, Tanmay Gupta, Luca Weihs, Andrew Head, Mark Yatskar, Chris Callison-Burch, Ranjay Krishna, Aniruddha Kembhavi, Christopher Clark

机构 * University of Pennsylvania(宾夕法尼亚大学) Allen Institute for Artificial Intelligence(人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published in ACL 2025, project page: https://yueyang1996.github.io/cosyn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15372 2025-05-22 cs.CL 57%

X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System

Peng Wang, Ruihan Tao, Qiguang Chen, Mengkang Hu, Libo Qin

专题命中 推理评测 :planning(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15094 2025-05-22 cs.CL 57%

SciCUEval: A Comprehensive Dataset for Evaluating Scientific Context Understanding in Large Language Models

Jing Yu, Yuqi Tang, Kehua Feng, Mingyang Rao, Lei Liang, Zhiqiang Zhang, Mengshu Sun, Wen Zhang, Qiang Zhang, Keyan Ding, Huajun Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11638 2025-05-22 cs.CL cs.IR 57%

A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting

He Chang, Chenchen Ye, Zhulin Tao, Jie Wu, Zhengmao Yang, Yunshan Ma, Xianglin Huang, Tat-Seng Chua

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14438 2025-05-21 cs.SD cs.CL eess.AS 57%

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models

Yuanbo Fang, Haoze Sun, Jun Liu, Tao Zhang, Zenan Zhou, Weipeng Chen, Xiaofen Xing, Xiangmin Xu

机构 * South China University of Technology(华南理工大学) Baichuan Inc(百川科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏