arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2511.16438 2025-11-21 cs.CL cs.IR 57%

ESGBench: A Benchmark for Explainable ESG Question Answering in Corporate Sustainability Reports

ESGBench:用于企业可持续发展报告中可解释ESG问答的基准

Sherine George, Nithish Saji

机构 * BNY FedEx

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ESGBench是一个用于评估企业可持续发展报告中可解释ESG问答系统性能的基准,通过领域相关问题和人工整理答案来评估模型推理能力,揭示了事实一致性、可追溯性和领域对齐等关键挑战。

Comments Workshop paper accepted at AI4DF 2025 (part of ACM ICAIF 2025). 3 pages including tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16231 2025-11-21 cs.LG 57%

Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective

Pass@k指标用于RLVR:探索的诊断工具,而非目标

Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文分析了pass@k指标作为强化学习中探索诊断工具的优劣,指出其作为优化目标的局限性,并提出鼓励高效探索的机制作为替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14813 2025-11-21 cs.LG 57%

DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models

DEVAL:一个用于评估和提升大语言模型推导能力的框架

Yifan Li, Qin Li, Min Zhang, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 DEVAL框架通过评估和提升大语言模型的推导能力,提出了一种新的提示工程方法DP,显著提高了模型在问题解决中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12851 2025-11-21 cs.CL 57%

ACEBench: Who Wins the Match Point in Tool Usage?

ACEBench: 工具使用场景中谁胜出?

Chen Chen, Xinlong Hao, Weiwen Liu, Xu Huang, Xingshan Zeng, Shuai Yu, Dexun Li, Shuai Wang, Weinan Gan, Yuefeng Huang, Wulong Liu, Xinzhi Wang, Defu Lian, Baoqun Yin, Yasheng Wang, Wu Liu

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ACEBench是一个用于评估大型语言模型工具使用能力的综合基准测试,通过三种类型的数据评估场景,深入分析LLMs在不同情境下的工具使用表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15567 2025-11-20 cs.CV cs.CL cs.HC 57%

Computer-Use Agents as Judges for Generative User Interface

计算机使用代理作为生成用户界面的法官

Kevin Qinghong Lin, Siyuan Hu, Linjie Li, Zhengyuan Yang, Lijuan Wang, Philip Torr, Mike Zheng Shou

机构 * University of Oxford(牛津大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室) Microsoft(微软公司)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 本研究提出Coder-CUA协作框架,通过代理作为法官与编码模型协作,提升自动GUI设计的效率和可靠性。

Comments Project: https://showlab.github.io/AUI Github: https://github.com/showlab/AUI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14903 2025-11-20 cs.LG cs.SE 57%

It's LIT! Reliability-Optimized LLMs with Inspectable Tools

Ruixin Zhang, Jon Donnelly, Zhicheng Guo, Ghazal Khalighinejad, Haiyang Huang, Alina Jade Barnett, Cynthia Rudin

机构 * Department of Computer Science(计算机科学系) Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Multi-Turn Interactions in Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14780 2025-11-20 cs.AI 57%

Ask WhAI:Probing Belief Formation in Role-Primed LLM Agents

Keith Moore, Jun W. Kim, David Lyu, Jeffrey Heo, Ehsan Adeli

机构 * Department of Biomedical Data Science, Stanford University(生物医学数据科学系,斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Preprint. Accepted for publication at AIAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14439 2025-11-20 cs.CL 57%

MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents

Jinru Ding, Lu Lu, Chao Ding, Mouxiao Bian, Jiayuan Chen, Wenrao Pang, Ruiyao Chen, Xinwei Peng, Renjie Lu, Sijie Ren, Guanxu Zhu, Xiaoqin Wu, Zhiqiang Liu, Rongzhao Zhang, Luyi Jiang, Bing Han, Yunqiu Wang, Jie Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13889 2025-11-20 cs.CV cs.LG 57%

Uni-Hema: Unified Model for Digital Hematopathology

Abdul Rehman, Iqra Rasool, Ayisha Imran, Mohsen Ali, Waqas Sultani

机构 * Information Technology University of Punjab(旁遮普信息科技大学) Chughtai Lab(楚格塔实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10683 2025-11-19 cs.RO cs.AI cs.CV 57%

MotIF: Motion Instruction Fine-tuning

Minyoung Hwang, Joey Hejna, Dorsa Sadigh, Yonatan Bisk

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13998 2025-11-19 cs.SE cs.AI 57%

LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering

Jielin Qiu, Zuxin Liu, Zhiwei Liu, Rithesh Murthy, Jianguo Zhang, Haolin Chen, Shiyu Wang, Ming Zhu, Liangwei Yang, Juntao Tan, Roshan Ram, Akshara Prabhakar, Tulika Awalgaonkar, Zixiang Chen, Zhepeng Cen, Cheng Qian, Shelby Heinecke, Weiran Yao, Silvio Savarese, Caiming Xiong, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 54-pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13892 2025-11-19 cs.AI 57%

Jailbreaking Large Vision Language Models in Intelligent Transportation Systems

Badhan Chandra Das, Md Tasnim Jawad, Md Jueal Mia, M. Hadi Amini, Yanzhao Wu

机构 * KFSCIS, Florida International University(凯斯-西储大学信息科学学院) Knight Foundation School of Computing and Information Sciences(骑士基金会计算与信息科学学院) Learning for InterDependent Networks Laboratory (solid lab)(依赖网络学习实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.01181 2025-11-19 cs.CV cs.AI 57%

SemCo: Toward Semantic Coherent Visual Relationship Forecasting

Yangjun Ou, Yao Liu, Li Mi, Zhenzhong Chen

机构 * School of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) ETH Zürich(苏黎世联邦理工学院) School of Remote Sensing and Information Engineering(遥感与信息工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13381 2025-11-18 cs.CL 57%

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts

Siyu Zhu, Mouxiao Bian, Yue Xie, Yongyu Tang, Zhikang Yu, Tianbin Li, Pengcheng Chen, Bing Han, Jie Xu, Xiaoyan Dong

机构 * Shanghai Children’s Hospital, School of Medicine,Shanghai Jiao Tong University(上海儿童医学中心,上海交通大学医学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University of Traditional Chinese Medicine(上海中医药大学) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18966 2025-11-18 cs.CL 57%

DataGen: Unified Synthetic Dataset Generation via Large Language Models

Yue Huang, Siyuan Wu, Chujie Gao, Dongping Chen, Qihui Zhang, Yao Wan, Tianyi Zhou, Jianfeng Gao, Chaowei Xiao, Lichao Sun, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Huazhong University of Science and Technology(华中科技大学) MBZUAI University of Washington(华盛顿大学) Peking University(北京大学) University of Maryland, College Park(马里兰大学学院市分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Lehigh University(莱斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13169 2025-11-18 cs.CL 57%

TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine

Tianai Huang, Jiayuan Chen, Lu Lu, Pengcheng Chen, Tianbin Li, Bing Han, Wenchao Tang, Jie Xu, Ming Li

机构 * School of Artificial Intelligence in Traditional Chinese Medicine, Shanghai University of Traditional Chinese Medicine, Shanghai, China(上海中医药大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Washington, Seattle, Washington, US(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12928 2025-11-18 cs.CL 57%

Visual Room 2.0: Seeing is Not Understanding for MLLMs

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学技术学院) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12520 2025-11-18 cs.CL 57%

TAdaRAG: Task Adaptive Retrieval-Augmented Generation via On-the-Fly Knowledge Graph Construction

Jie Zhang, Bo Tang, Wanzi Shao, Wenqiang Wei, Jihao Zhao, Jianqing Zhu, Zhiyu li, Wen Xi, Zehao Lin, Feiyu Xiong, Yanchao Tan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04614 2025-11-18 cs.AI 57%

Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation

Yuyang Wanyan, Xi Zhang, Haiyang Xu, Haowei Liu, Junyang Wang, Jiabo Ye, Yutong Kou, Ming Yan, Fei Huang, Xiaoshan Yang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(自动化研究所,中国科学院,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院,中国) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12133 2025-11-18 cs.CL 57%

AI-Salesman: Towards Reliable Large Language Model Driven Telemarketing

Qingyu Zhang, Chunlei Xin, Xuanang Chen, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Qing Ye, Qianlong Xie, Xingxing Wang

专题命中 推理评测 :planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12113 2025-11-18 cs.AI 57%

MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization

Lanxue Zhang, Yuqiang Xie, Fang Fang, Fanglong Dong, Rui Liu, Yanan Cao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 23 pages, 10 figures, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10688 2025-11-17 cs.CL 57%

Modeling and Predicting Multi-Turn Answer Instability in Large Language Models

Jiahang He, Rishi Ramachandran, Neel Ramachandran, Aryan Katakam, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Aryan Shrivastava

机构 * Algoverse AI Research(Algoverse AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10671 2025-11-17 cs.CL cs.CV 57%

Grounded Visual Factualization: Factual Anchor-Based Finetuning for Enhancing MLLM Factual Consistency

Filippo Morbiato, Luca Romano, Alessandro Persona

机构 * University of Padua(帕多瓦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06292 2025-11-17 cs.AI 57%

Synthetic Data-Driven Prompt Tuning for Financial QA over Tables and Documents

Yaoning Yu, Kai-Min Chang, Ye Yu, Kai Wei, Haojing Luo, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of South Florida(佛罗里达州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03662 2025-11-17 cs.CV cs.AI cs.RO 57%

Zero-Shot Temporal Interaction Localization for Egocentric Videos

Erhang Zhang, Junyi Ma, Yin-Dong Zheng, Yixuan Zhou, Hesheng Wang

机构 * IRMV Lab, the Department of Automation, Shanghai Jiao Tong University(IRMV实验室,自动化系,上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10284 2025-11-14 cs.AI 57%

Beyond Verification: Abductive Explanations for Post-AI Assessment of Privacy Leakage

Belona Sonna, Alban Grastien, Claire Benn

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted at the Workshop on Post-AI Formal Methods at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10075 2025-11-14 cs.CL 57%

Format Matters: The Robustness of Multimodal LLMs in Reviewing Evidence from Tables and Charts

Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Florian Boudin, Atsuhiro Takasu, Akiko Aizawa

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10014 2025-11-14 q-bio.QM cs.AI 57%

fastbmRAG: A Fast Graph-Based RAG Framework for Efficient Processing of Large-Scale Biomedical Literature

Guofeng Meng, Li Shen, Qiuyan Zhong, Wei Wang, Haizhou Zhang, Xiaozhen Wang

机构 * Changchun GeneScience Pharmaceuticals Co., Ltd.(长春基因科学制药有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 8 pages, 2 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09971 2025-11-14 cs.CL 57%

NumPert: Numerical Perturbations to Probe Language Models for Veracity Prediction

Peter Røysland Aarnes, Vinay Setty

机构 * University of Stavanger(斯塔万格大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted in ICJNLP/AACL SRW

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07127 2025-11-14 cs.LG 57%

REACT-LLM: A Benchmark for Evaluating LLM Integration with Causal Features in Clinical Prognostic Tasks

Linna Wang, Zhixuan You, Qihui Zhang, Jiunan Wen, Ji Shi, Yimin Chen, Yusen Wang, Fanqi Ding, Ziliang Feng, Li Lu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏