arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-18 至 2025-11-18 共收录 169 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 36 篇

2511.05810 2025-11-18 cs.AI cs.CL cs.LG 67%

DiagnoLLM: A Hybrid Bayesian Neural Language Framework for Interpretable Disease Diagnosis

Bowen Xu, Xinyue Zeng, Jiazhen Hu, Tuo Wang, Adithya Kulkarni

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15501 2025-11-18 cs.CL cs.AI cs.LG 67%

DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios

Yao Huang, Yitong Sun, Yichi Zhang, Ruochen Zhang, Yinpeng Dong, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究所) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 17 figures, accepted by NeruIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19002 2025-11-18 cs.CV cs.AI cs.CL cs.LG 67%

VIR-Bench: Evaluating Geospatial and Temporal Understanding of MLLMs via Travel Video Itinerary Reconstruction

Hao Wang, Eiki Murata, Lingfang Zhang, Ayako Sato, So Fukuda, Ziqi Yin, Wentao Hu, Keisuke Nakao, Yusuke Nakamura, Sebastian Zwirner, Yi-Chia Chen, Hiroyuki Otomo, Hiroki Ouchi, Daisuke Kawahara

机构 * Waseda University(早稻田大学) CyberAgent, Inc.(CyberAgent公司) AI Shift, Inc.(AI Shift公司) Nara Institute of Science and Technology(奈良研究所)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12851 2025-11-18 cs.CL cs.AI 62%

NeuroLex: A Lightweight Domain Language Model for EEG Report Understanding and Generation

Kang Yin, Hye-Bin Shin

机构 * Dept. of Artificial Intelligence Korea University Seoul, Republic of Korea(人工智能系韩国大学首尔共和国韩国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12769 2025-11-18 cs.AI cs.LG 62%

Event-CausNet: Unlocking Causal Knowledge from Text with Large Language Models for Reliable Spatio-Temporal Forecasting

Luyao Niu, Zepu Wang, Shuyi Guan, Yang Liu, Peng Sun

机构 * Duke Kunshan University, China(杜克大学昆山分校) Peking University, China(北京大学) Tongji University, China(同济大学) University of Ottawa, Canada(渥太华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12630 2025-11-18 cs.CL cs.AI 62%

Knots: A Large-Scale Multi-Agent Enhanced Expert-Annotated Dataset and LLM Prompt Optimization for NOTAM Semantic Parsing

Maoqi Liu, Quan Fang, Yang Yang, Can Zhao, Kaiquan Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航) State Key Laboratory of CNS/ATM(国家空管流量管理技术实验室) Aviation Data Communication Corporation(航空数据通信公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12472 2025-11-18 cs.CL cs.AI 62%

Assessing LLMs for Serendipity Discovery in Knowledge Graphs: A Case for Drug Repurposing

Mengying Wang, Chenhui Ma, Ao Jiao, Tuo Liang, Pengjun Lu, Shrinidhi Hegde, Yu Yin, Evren Gurkan-Cavusoglu, Yinghui Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments The 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12460 2025-11-18 cs.LG cs.AI 62%

Personality-guided Public-Private Domain Disentangled Hypergraph-Former Network for Multimodal Depression Detection

Changzeng Fu, Shiwen Zhao, Yunze Zhang, Zhongquan Jian, Shiqi Zhao, Chaoran Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments AAAI 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00091 2025-11-18 cs.AI cs.CL 62%

Ensemble Debates with Local Large Language Models for AI Alignment

Ephraiem Sarabamoun

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments The manuscript is being withdrawn to incorporate additional revisions and improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12116 2025-11-18 cs.CL cs.AI 62%

LLMLagBench: Identifying Temporal Training Boundaries in Large Language Models

Piotr Pęzik, Konrad Kaczyński, Maria Szymańska, Filip Żarnecki, Zuzanna Deckert, Jakub Kwiatkowski, Wojciech Janowski

机构 * University of Lodz(洛兹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11831 2025-11-18 cs.AI cs.CV cs.LG 62%

TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models

Wenhao Zhou, Hao Zheng, Rong Zhao

机构 * Center for Brain-Inspired Computing Research (CBICR)(脑启发计算研究中心) Department of Precision Instruments(精密仪器系) IDG/McGovern Institute for Brain Research(IDG/麦戈文脑研究学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08824 2025-11-18 cs.RO cs.AI cs.CL cs.CY 62%

LLM-Driven Robots Risk Enacting Discrimination, Violence, and Unlawful Actions

Andrew Hundt, Rumaisa Azeem, Masoumeh Mansouri, Martim Brandão

机构 * Carnegie Mellon University(卡内基梅隆大学) King’s College London(伦敦国王学院) University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Published in International Journal of Social Robotics (2025). 49 pages (65 with references and appendix), 27 Figures, 8 Tables. Andrew Hundt and Rumaisa Azeem are equal contribution co-first authors. The positions of the two co-first authors were swapped from arxiv version 1 with the written consent of all four authors. The Version of Record is available via DOI: 10.1007/s12369-025-01301-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13381 2025-11-18 cs.CL 57%

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-World Clinical Contexts

Siyu Zhu, Mouxiao Bian, Yue Xie, Yongyu Tang, Zhikang Yu, Tianbin Li, Pengcheng Chen, Bing Han, Jie Xu, Xiaoyan Dong

机构 * Shanghai Children’s Hospital, School of Medicine,Shanghai Jiao Tong University(上海儿童医学中心,上海交通大学医学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University of Traditional Chinese Medicine(上海中医药大学) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18966 2025-11-18 cs.CL 57%

DataGen: Unified Synthetic Dataset Generation via Large Language Models

Yue Huang, Siyuan Wu, Chujie Gao, Dongping Chen, Qihui Zhang, Yao Wan, Tianyi Zhou, Jianfeng Gao, Chaowei Xiao, Lichao Sun, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Huazhong University of Science and Technology(华中科技大学) MBZUAI University of Washington(华盛顿大学) Peking University(北京大学) University of Maryland, College Park(马里兰大学学院市分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Lehigh University(莱斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13169 2025-11-18 cs.CL 57%

TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine

Tianai Huang, Jiayuan Chen, Lu Lu, Pengcheng Chen, Tianbin Li, Bing Han, Wenchao Tang, Jie Xu, Ming Li

机构 * School of Artificial Intelligence in Traditional Chinese Medicine, Shanghai University of Traditional Chinese Medicine, Shanghai, China(上海中医药大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Washington, Seattle, Washington, US(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12928 2025-11-18 cs.CL 57%

Visual Room 2.0: Seeing is Not Understanding for MLLMs

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学技术学院) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12520 2025-11-18 cs.CL 57%

TAdaRAG: Task Adaptive Retrieval-Augmented Generation via On-the-Fly Knowledge Graph Construction

Jie Zhang, Bo Tang, Wanzi Shao, Wenqiang Wei, Jihao Zhao, Jianqing Zhu, Zhiyu li, Wen Xi, Zehao Lin, Feiyu Xiong, Yanchao Tan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04614 2025-11-18 cs.AI 57%

Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation

Yuyang Wanyan, Xi Zhang, Haiyang Xu, Haowei Liu, Junyang Wang, Jiabo Ye, Yutong Kou, Ming Yan, Fei Huang, Xiaoshan Yang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(自动化研究所,中国科学院,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院,中国) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12133 2025-11-18 cs.CL 57%

AI-Salesman: Towards Reliable Large Language Model Driven Telemarketing

Qingyu Zhang, Chunlei Xin, Xuanang Chen, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Qing Ye, Qianlong Xie, Xingxing Wang

专题命中 推理评测 :planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12113 2025-11-18 cs.AI 57%

MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization

Lanxue Zhang, Yuqiang Xie, Fang Fang, Fanglong Dong, Rui Liu, Yanan Cao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 23 pages, 10 figures, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13242 2025-11-18 cs.CV 50%

MMD-Thinker: Adaptive Multi-Dimensional Thinking for Multimodal Misinformation Detection

Junjie Wu, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12363 2025-11-18 cs.CV 50%

Explainable AI-Generated Image Detection RewardBench

Michael Yang, Shijian Deng, William T. Doan, Kai Wang, Tianyu Yang, Harsh Singh, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) University of Notre Dame(诺特大学) Stony Brook University(石溪大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09415 2025-11-18 cs.CV 50%

FaceShield: Explainable Face Anti-Spoofing with Multimodal Large Language Models

Hongyang Wang, Yichen Shi, Zhuofu Tao, Yuhao Gao, Liepiao Zhang, Xun Lin, Jun Feng, Xiaochen Yuan, Zitong Yu, Xiaochun Cao

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by AAAI 2025. Hongyang Wang and Yichen Shi contribute equally. Corresponding author: Zitong Yu

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10810 2025-11-18 cs.CV 50%

SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding

Zhenyu Yang, Yuhang Hu, Zemin Du, Dizhan Xue, Shengsheng Qian, Jiahong Wu, Fan Yang, Weiming Dong, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Zhengzhou University(郑州大学) ShanghaiTech University(上海科技大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理评测 :reasoning(abstract)

Comments ICLR 2025 Accepted (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06251 2025-11-18 cs.CV 50%

Physics Knowledge in Frontier Models: A Diagnostic Study of Failure Modes

Ieva Bagdonaviciute, Vibhav Vineet

专题命中 推理评测 :reasoning(abstract)

Comments 8 pages, 7 figures. Preprint. v2: Updated experiments and diagnostics; formatting fixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02329 2025-11-18 cs.CV 50%

VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction Editing Data and Long Captions

Ziteng Wang, Siqi Yang, Limeng Qiao, Lin Ma

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05456 2025-11-18 cs.CV 50%

SITE: towards Spatial Intelligence Thorough Evaluation

Wenqi Wang, Reuben Tan, Pengyue Zhu, Jianwei Yang, Zhengyuan Yang, Lijuan Wang, Andrey Kolobov, Jianfeng Gao, Boqing Gong

机构 * Boston University(波士顿大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15631 2025-11-18 cs.SE 50%

Understanding and Estimating the Execution Time of Quantum Circuits

Ning Ma, Heng Li

专题命中 推理评测 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 21 篇

2511.13359 2025-11-18 cs.AI 83%

Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms

Yuhang Wang, Yanxu Zhu, Jitao Sang

机构 * Yuhang Wang, Yanxu Zhu, Jitao Sang(作者)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02492 2025-11-18 cs.CL cs.LG 81%

GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning

Chenglong Wang, Yongyu Mu, Hang Zhou, Yifu Huo, Ziming Zhu, Jiali Zeng, Murun Yang, Bei Li, Xiaoyang Hao, Chunliang Zhang, Fandong Meng, Jingbo Zhu, Tong Xiao

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏