arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-29 至 2025-08-29 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 13 篇

2508.20384 2025-08-29 cs.AI 79%

Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM

Yongfu Zhu, Lin Sun, Guangxiang Zhao, Weihong Lin, Xiangzheng Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Under review for AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20151 2025-08-29 cs.AI 79%

IntentionReasoner: Facilitating Adaptive LLM Safeguards through Intent Reasoning and Selective Query Refinement

Yuanzhe Shen, Zisu Huang, Zhengkang Guo, Yide Liu, Guanxu Chen, Ruicheng Yin, Xiaoqing Zheng, Xuanjing Huang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20973 2025-08-29 cs.CL cs.AI cs.HC 73%

ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents

Tianjian Liu, Fanqi Wan, Jiajian Guo, Xiaojun Quan

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20583 2025-08-29 cs.CL cs.AI 62%

A Graph Talks, But Who's Listening? Rethinking Evaluations for Graph-Language Models

Soham Petkar, Hari Aakash K, Anirudh Vempati, Akshit Sinha, Ponnurangam Kumarauguru, Chirag Agarwal

机构 * plaksha.edu.in(普拉克斯哈大学) research.iiit.ac.in(IIIT研究机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19724 2025-08-29 cs.CL cs.AI 62%

NLKI: A lightweight Natural Language Knowledge Integration Framework for Improving Small VLMs in Commonsense VQA Tasks

Aritra Dutta, Swapnanil Mukherjee, Deepanway Ghosal, Somak Aditya

机构 * IIT Kharagpur(印度理工学院Kharagpur分校) Ashoka University(阿什oka大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15165 2025-08-29 cs.CL cs.AI cs.SE 62%

SoAy: A Solution-based LLM API-using Methodology for Academic Information Seeking

Yuanchun Wang, Jifan Yu, Zijun Yao, Jing Zhang, Yuyang Xie, Shangqing Tu, Yiyang Fu, Youhe Feng, Jinkai Zhang, Jingyao Zhang, Bowen Huang, Yuanyao Li, Huihui Yuan, Lei Hou, Juanzi Li, Jie Tang

机构 * Renmin University of China(中国人民大学) Key Laboratory of Data Engineering and Knowledge Engineering, MOE(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Institute of Education(教育学院) Department of Computer Science and Technology(计算机科学与技术系) Engineering Research Center of Database and Business Intelligence, MOE(数据库与商务智能工程研究中心) School of Information(信息学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments KDD 2025; 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22957 2025-08-29 cs.CL cs.AI cs.CY cs.MA 62%

Agent-to-Agent Theory of Mind: Testing Interlocutor Awareness among Large Language Models

Younwoo Choi, Changling Li, Yongjin Yang, Zhijing Jin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20867 2025-08-29 cs.CL 57%

MSRS: Evaluating Multi-Source Retrieval-Augmented Generation

Rohan Phanse, Yijie Zhou, Kejian Shi, Wencai Zhang, Yixin Liu, Yilun Zhao, Arman Cohan

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments COLM 2025; this article supersedes the preprint: arXiv:2309.08960

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07999 2025-08-29 cs.CL 57%

WideSearch: Benchmarking Agentic Broad Info-Seeking

Ryan Wong, Jiawei Wang, Junjie Zhao, Li Chen, Yan Gao, Long Zhang, Xuan Zhou, Zuo Wang, Kai Xiang, Ge Zhang, Wenhao Huang, Yang Wang, Ke Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 推理评测 :planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20420 2025-08-29 cs.CL 57%

CAMB: A comprehensive industrial LLM benchmark on civil aviation maintenance

Feng Zhang, Chengjie Pang, Yuehan Zhang, Chenyu Luo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20881 2025-08-29 cs.CV 50%

Understanding and evaluating computer vision models through the lens of counterfactuals

Pushkar Shukla

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20408 2025-08-29 cs.IR 50%

Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers

Haoyu Wu, Qingcheng Zeng, Kaize Ding

专题命中 推理评测 :reasoning(abstract)

Comments Proceedings of the 34th ACM International Conference on Information and Knowledge Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20345 2025-08-29 cs.CV cs.HC 50%

MedFoundationHub: A Lightweight and Secure Toolkit for Deploying Medical Vision Language Foundation Models

Xiao Li, Yanfan Zhu, Ruining Deng, Wei-Qi Wei, Yu Wang, Shilin Zhao, Yaohong Wang, Haichun Yang, Yuankai Huo

机构 * Vanderbilt University(范德比尔特大学) Weill Cornell Medicine(韦尔·科恩医学中心) Vanderbilt University Medical Center(范德比尔特大学医学中心) UT MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏