arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2508.17378 2025-08-26 cs.CL 57%

UI-Level Evaluation of ALLaM 34B: Measuring an Arabic-Centric LLM via HUMAIN Chat

Omer Nacar

机构 * NAMAA Community(NAMAA社区) Riyadh - KSA(利雅得-科威特)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17294 2025-08-26 cs.LG 57%

Explainable AI (XAI) for Arrhythmia detection from electrocardiograms

Joschka Beck, Arlene John

机构 * Biomedical Signals and Systems Group University of Twente(生物医学信号与系统组代尔夫特理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08243 2025-08-26 cs.CL 57%

Jinx: Unlimited LLMs for Probing Alignment Failures

Jiahao Zhao, Liwei Dong

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments https://huggingface.co/Jinx-org

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21500 2025-08-26 cs.CL 57%

OpenHuEval: Evaluating Large Language Model on Hungarian Specifics

Haote Yang, Xingjian Wei, Jiang Wu, Noémi Ligeti-Nagy, Jiaxing Sun, Yinfan Wang, Zijian Győző Yang, Junyuan Gao, Jingchao Wang, Bowen Jiang, Shasha Wang, Nanjun Yu, Zihao Zhang, Shixin Hong, Hongwei Liu, Wei Li, Songyang Zhang, Dahua Lin, Lijun Wu, Gábor Prószéky, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) HUN-REN Hungarian Research Centre for Linguistics(匈牙利语言研究与研究中心) Wuhan University(武汉大学) Shanghai University(上海大学) University of Chinese Academy of Sciences(中国科学院大学) East China Normal University(华东师范大学) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) Chinese University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16788 2025-08-26 cs.CL 57%

Assess and Prompt: A Generative RL Framework for Improving Engagement in Online Mental Health Communities

Bhagesh Gaur, Karan Gupta, Aseem Srivastava, Manish Gupta, Md Shad Akhtar

机构 * IIIT Delhi, India(德里印度理工学院) Microsoft, India(微软印度)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

Comments Full Paper accepted in EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16641 2025-08-26 cs.LG stat.ML 57%

Enhancing Transformer-Based Foundation Models for Time Series Forecasting via Bagging, Boosting and Statistical Ensembles

Dhruv D. Modi, Rong Pan

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04866 2025-08-26 cs.CL 57%

ComplexTempQA:A 100m Dataset for Complex Temporal Question Answering

Raphael Gruber, Abdelrahman Abdallah, Michael Färber, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) Technical University Dresden(德累斯顿技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at EMNLP main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16402 2025-08-25 cs.SE cs.CL 57%

AetherCode: Evaluating LLMs' Ability to Win In Premier Programming Competitions

Zihan Wang, Jiaze Chen, Zhicheng Liu, Markus Mak, Yidi Du, Geonsik Moon, Luoqi Xu, Aaron Tua, Kunshuo Peng, Jiayi Lu, Mingfei Xia, Boqian Zou, Chenyang Ran, Guang Tian, Shoutai Zhu, Yeheng Duan, Zhenghui Kang, Zhenxing Lin, Shangshu Li, Qiang Luo, Qingshen Long, Zhiyong Chen, Yihan Xiao, Yurong Wu, Daoguang Zan, Yuyi Fu, Mingxuan Wang, Ming Ding

机构 * ByteDance M-A-P(字节跳动 M-A-P)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16265 2025-08-25 cs.CL 57%

M3TQA: Massively Multilingual Multitask Table Question Answering

Daixin Shu, Jian Yang, Zhenhe Wu, Xianjie Wu, Xianfu Cheng, Xiangyuan Guan, Yanghai Wang, Pengfei Wu, Tingyang Yang, Hualei Zhu, Wei Zhang, Ge Zhang, Jiaheng Liu, Zhoujun Li

机构 * CCSE, Beihang University(计算机科学与工程学院,北京航空航天大学) M-A-P(M-A-P研究所) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10868 2025-08-25 cs.CL 57%

NitiBench: A Comprehensive Study of LLM Framework Capabilities for Thai Legal Question Answering

Pawitsapak Akarajaradwong, Pirat Pothavorn, Chompakorn Chaksangchaichot, Panuthep Tasawong, Thitiwat Nopparatbundit, Keerakiat Pratai, Sarana Nutanong

机构 * VISAI AI(VISAI人工智能) Vidyasirimedhi Institute of Science and Technology(维达亚西米德希科学与技术研究院) Faculty of Law, Thammasat University(朱拉隆功大学法学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17032 2025-08-25 cs.CL 57%

MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Tail Knowledge

Jie He, Nan Hu, Wanqiu Long, Jiaoyan Chen, Jeff Z. Pan

机构 * School of Informatics, University of Edinburgh, UK(爱丁堡大学信息学院) Southeast University, Nanjing, Jiangsu, China(东南大学) University of Manchester, UK(曼彻斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15717 2025-08-22 cs.CV cs.AI 57%

StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding

Yanlai Yang, Zhuokai Zhao, Satya Narayan Shukla, Aashu Singh, Shlok Kumar Mishra, Lizhu Zhang, Mengye Ren

机构 * Meta AI New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15361 2025-08-22 cs.CL 57%

A Survey on Large Language Model Benchmarks

Shiwen Ni, Guhong Chen, Shuaimin Li, Xuanang Chen, Siyi Li, Bingli Wang, Qiyao Wang, Xingjian Wang, Yifan Zhang, Liyang Fan, Chengming Li, Ruifeng Xu, Le Sun, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所) Southern University of Science and Technology(南方科技大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Shanghai University of Electric Power(上海电力大学) Shanghai AI Lab(上海人工智能实验室) South China University of Technology(华南理工大学) Shenzhen University(深圳大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University of Advanced Technology(深圳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15274 2025-08-22 cs.CL cs.IR 57%

TComQA: Extracting Temporal Commonsense from Text

Lekshmi R Nair, Arun Sankar, Koninika Pal

机构 * Indian Institute of Technology(印度理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref IRRAG@SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15251 2025-08-22 eess.IV cs.AI cs.CV 57%

Explainable Knowledge Distillation for Efficient Medical Image Classification

Aqib Nazir Mir, Danish Raza Rizvi

机构 * Dept. of Computer Engineering(计算机工程系) Jamia Millia Islamia(Jamia Millia Islamia大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06994 2025-08-22 cs.CV cs.AI 57%

Cross-Modality Masked Learning for Survival Prediction in ICI Treated NSCLC Patients

Qilong Xing, Zikai Song, Bingxin Gong, Lian Yang, Junqing Yu, Wei Yang

机构 * School of Computer Science and Technology(计算机科学与技术学院) Department of Radiology, Union Hospital, Tongji Medical College(放射科、同济医学院附属医院)

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16622 2025-08-22 cs.CL 57%

Leveraging Large Language Models for Explainable Activity Recognition in Smart Homes: A Critical Evaluation

Michele Fiori, Gabriele Civitarese, Priyankar Choudhary, Claudio Bettini

机构 * EveryWare Lab, Dept. of Computer Science, University of Milan(米兰大学计算机科学系EveryWare实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15429 2025-08-22 cs.CL 57%

Pub-Guard-LLM: Detecting Retracted Biomedical Articles with Reliable Explanations

Lihu Chen, Shuojie Fu, Gabriel Freedman, Cemre Zor, Guy Martin, James Kinross, Uddhav Vaghela, Ovidiu Serban, Francesca Toni

机构 * Imperial College London(伦敦帝国学院) Amazon Web Services(亚马逊网络服务) National Health Service(国家健康服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments long paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03290 2025-08-22 cs.CV cs.AI 57%

Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models

Haibo Wang, Zhiyang Xu, Yu Cheng, Shizhe Diao, Yufan Zhou, Yixin Cao, Qifan Wang, Weifeng Ge, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Adobe Research(Adobe研究) Fudan University(复旦大学) Meta AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03608 2025-08-21 cs.AI cs.DC cs.ET cs.NI 57%

Benchmarking Vector, Graph and Hybrid Retrieval Augmented Generation (RAG) Pipelines for Open Radio Access Networks (ORAN)

Sarat Ahmad, Zeinab Nezami, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13790 2025-08-21 cs.AI 57%

The NordDRG AI Benchmark for Large Language Models

Tapio Pitkäranta

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Aalto University(阿alto大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13953 2025-08-21 cs.AI 57%

Benchmarking graph construction by large language models for coherence-driven inference

Steve Huntsman, Jewell Thomas

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11370 2025-08-21 cs.CL 57%

G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model

Jiahui Gao, Renjie Pi, Jipeng Zhang, Jiacheng Ye, Wanjun Zhong, Yufei Wang, Lanqing Hong, Jianhua Han, Hang Xu, Zhenguo Li, Lingpeng Kong

机构 * Noah’s Ark Lab(诺亚 Ark 实验室) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14080 2025-08-21 cs.LG 57%

KnowDR-REC: A Benchmark for Referring Expression Comprehension with Real-World Knowledge

Guanghao Jin, Jingpei Wu, Tianpei Guo, Yiyi Niu, Weidong Zhou, Guoyang Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13938 2025-08-20 cs.CL cs.CV 57%

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models

Jiacheng Ruan, Dan Jiang, Xian Gao, Ting Liu, Yuzhuo Fu, Yangyang Kang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13757 2025-08-20 cs.SE cs.AI 57%

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

James Meaden, Michał Jarosz, Piotr Jodłowski, Grigori Melnik

机构 * Codility

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13206 2025-08-20 cs.CL 57%

BQA: Body Language Question Answering Dataset for Video Large Language Models

Shintaro Ozaki, Kazuki Hayashi, Miyu Oba, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to ACL2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13223 2025-08-20 cs.CV cs.AI 57%

MIRAGE: Towards AI-Generated Image Detection in the Wild

Cheng Xia, Manxi Lin, Jiexiang Tan, Xiaoxiong Du, Yang Qiu, Junjun Zheng, Xiangheng Kong, Yuning Jiang, Bo Zheng

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12754 2025-08-19 cs.AI 57%

Beyond Ethical Alignment: Evaluating LLMs as Artificial Moral Assistants

Alessio Galatolo, Luca Alberto Rappuoli, Katie Winkle, Meriem Beloucif

机构 * Uppsala University(乌普萨拉大学) University of St. Andrews(圣安德鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Full version of the paper published in ECAI 2025 proceedings (IOS Press, CC BY-NC 4.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12669 2025-08-19 cs.CL cs.CY 57%

Leveraging Large Language Models for Predictive Analysis of Human Misery

Bishanka Seal, Rahul Seetharaman, Aman Bansal, Abhilash Nandy

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 14 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏