arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-20 至 2025-11-20 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 13 篇

2511.14777 2025-11-20 cs.AI 79%

The Illusion of Procedural Reasoning: Measuring Long-Horizon FSM Execution in LLMs

Mahdi Samiei, Mahdi Mansouri, Mahdieh Soleymani Baghshah

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08008 2025-11-20 cs.AI 79%

Combining LLM Semantic Reasoning with GNN Structural Modeling for Multi-View Multi-Label Feature Selection

Zhiqi Chen, Yuzhou Liu, Jiarui Liu, Wanfu Gao

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10900 2025-11-20 cs.CL cs.AI 79%

Expert-Guided Prompting and Retrieval-Augmented Generation for Emergency Medical Service Question Answering

Xueren Ge, Sahil Murtaza, Anthony Cortez, Homa Alemzadeh

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14214 2025-11-20 cs.AI cs.LG 62%

Do Large Language Models (LLMs) Understand Chronology?

Pattaraphon Kenny Wongchamcharoen, Paul Glasserman

机构 * University of California, Berkeley(加州大学伯克利分校) Columbia Business School(哥伦比亚大学商学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Version 2: corrected footnote and added code repository link. Extended version of our work presented at the AAAI-26 AI4TS Workshop (poster) and AAAI-26 Student Abstract Program (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15061 2025-11-20 cs.AI cs.IR cs.LG 62%

Beyond GeneGPT: A Multi-Agent Architecture with Open-Source LLMs for Enhanced Genomic Question Answering

Haodong Chen, Guido Zuccon, Teerapong Leelanupab

机构 * The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted to SIGIR-AP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15567 2025-11-20 cs.CV cs.CL cs.HC 57%

Computer-Use Agents as Judges for Generative User Interface

计算机使用代理作为生成用户界面的法官

Kevin Qinghong Lin, Siyuan Hu, Linjie Li, Zhengyuan Yang, Lijuan Wang, Philip Torr, Mike Zheng Shou

机构 * University of Oxford(牛津大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室) Microsoft(微软公司)

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 本研究提出Coder-CUA协作框架,通过代理作为法官与编码模型协作,提升自动GUI设计的效率和可靠性。

Comments Project: https://showlab.github.io/AUI Github: https://github.com/showlab/AUI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14903 2025-11-20 cs.LG cs.SE 57%

It's LIT! Reliability-Optimized LLMs with Inspectable Tools

Ruixin Zhang, Jon Donnelly, Zhicheng Guo, Ghazal Khalighinejad, Haiyang Huang, Alina Jade Barnett, Cynthia Rudin

机构 * Department of Computer Science(计算机科学系) Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Multi-Turn Interactions in Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14780 2025-11-20 cs.AI 57%

Ask WhAI:Probing Belief Formation in Role-Primed LLM Agents

Keith Moore, Jun W. Kim, David Lyu, Jeffrey Heo, Ehsan Adeli

机构 * Department of Biomedical Data Science, Stanford University(生物医学数据科学系,斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Preprint. Accepted for publication at AIAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14439 2025-11-20 cs.CL 57%

MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents

Jinru Ding, Lu Lu, Chao Ding, Mouxiao Bian, Jiayuan Chen, Wenrao Pang, Ruiyao Chen, Xinwei Peng, Renjie Lu, Sijie Ren, Guanxu Zhu, Xiaoqin Wu, Zhiqiang Liu, Rongzhao Zhang, Luyi Jiang, Bing Han, Yunqiu Wang, Jie Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13889 2025-11-20 cs.CV cs.LG 57%

Uni-Hema: Unified Model for Digital Hematopathology

Abdul Rehman, Iqra Rasool, Ayisha Imran, Mohsen Ali, Waqas Sultani

机构 * Information Technology University of Punjab(旁遮普信息科技大学) Chughtai Lab(楚格塔实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24709 2025-11-20 cs.CV 50%

IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video?

Yang Chen, Minghao Liu, Yufan Shen, Yunwen Li, Tianyuan Huang, Xinyu Fang, Tianyu Zheng, Wenxuan Huang, Cheng Yang, Daocheng Fu, Jianbiao Mei, Rong Wu, Yunfei Zhao, Licheng Wen, Xuemeng Yang, Song Mao, Qunshu Lin, Zhi Yu, Yongliang Shen, Yu Qiao, Botian Shi

机构 * IWR-Bench Team(IWR-Bench团队)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14937 2025-11-20 cs.CR 50%

CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs

Niloofar Mireshghallah, Neal Mangaokar, Narine Kokhlikyan, Arman Zharmagambetov, Manzil Zaheer, Saeed Mahloujifar, Kamalika Chaudhuri

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00261 2025-11-20 cs.CV cs.HC 50%

Spot The Ball: A Benchmark for Visual Social Inference

Neha Balamurugan, Sarah Wu, Adam Chun, Gabe Gaw, Cristobal Eyzaguirre, Tobias Gerstenberg

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏