arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-03 至 2025-10-03 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 23 篇

2510.01236 2025-10-03 cs.CL cs.LG 87%

GRPO++: Enhancing Dermatological Reasoning under Low Resource Settings

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque

机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology (BUET)(电气与电子工程系,孟加拉国工程与技术大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);分类 cs.CL、cs.LG

Comments Will be submitted at IEEE JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14245 2025-10-03 cs.AI cs.CL 86%

Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs

Xumeng Wen, Zihan Liu, Shun Zheng, Shengyu Ye, Zhirong Wu, Yang Wang, Zhijian Xu, Xiao Liang, Junjie Li, Ziming Miao, Jiang Bian, Mao Yang

机构 * Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Update with more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02204 2025-10-03 cs.CL 85%

Say One Thing, Do Another? Diagnosing Reasoning-Execution Gaps in VLM-Powered Mobile-Use Agents

Lingzhong Dong, Ziqi Zhou, Shuaibo Yang, Haiyue Sheng, Pengzhou Cheng, Zongru Wu, Zheng Wu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15337 2025-10-03 cs.CL 83%

Reasoning Models are Test Exploiters: Rethinking Multiple-Choice

Narun Raman, Taylor Lundy, Kevin Leyton-Brown

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11031 2025-10-03 cs.CL 83%

OntoURL: A Benchmark for Evaluating Large Language Models on Symbolic Ontological Understanding, Reasoning and Learning

Xiao Zhang, Huiyuan Lai, Qianru Meng, Johan Bos

机构 * University of Groningen(格罗宁根大学) Leiden University(莱顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02272 2025-10-03 cs.CL cs.AI 81%

Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective

Wen Yang, Junhong Wu, Chong Li, Chengqing Zong, Jiajun Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01700 2025-10-03 cs.AI cs.CV cs.LG 81%

VaPR -- Vision-language Preference alignment for Reasoning

Rohan Wadhawan, Fabrice Y Harel-Canada, Zi-Yi Dou, Suhaila Shakiah, Robinson Piramuthu, Nanyun Peng

机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) Amazon.com, Inc.(亚马逊公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Journal ref COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14459 2025-10-03 cs.CL cs.AI cs.IR 81%

Reasoning over User Preferences: Knowledge Graph-Augmented LLMs for Explainable Conversational Recommendations

Zhangchi Qiu, Linhao Luo, Shirui Pan, Alan Wee-Chung Liew

机构 * School of ICT, Griffith University(格里菲斯大学信息与通信技术学院) Department of Data Science and AI, Monash University(莫纳什大学数据科学与人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ICDM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01681 2025-10-03 cs.CV cs.AI 79%

Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning

Xuchen Li, Xuzhao Li, Jiahui Gao, Renjie Pi, Shiyu Hu, Wentao Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) ZGCA(北京智感科技有限公司) HKU(香港大学) HKUST(香港科技大学) NTU(国立台湾大学) PKU(北京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01582 2025-10-03 cs.CV cs.LG 79%

ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models

Krishna Teja Chitty-Venkata, Murali Emani

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24260 2025-10-03 cs.AI 79%

Rethinking and Benchmarking Large Language Models for Graph Reasoning

Yuwei Hu, Xinyi Huang, Zhewei Wei, Yongchao Liu, Chuntao Hong

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15596 2025-10-03 cs.CV 78%

EyePCR: A Comprehensive Benchmark for Fine-Grained Perception, Knowledge Comprehension and Clinical Reasoning in Ophthalmic Surgery

Gui Wang, Yang Wennuo, Xusen Ma, Zehao Zhong, Zhuoru Wu, Ende Wu, Rong Qu, Wooi Ping Cheah, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院) Wenzhou Medical University(温州医科大学) School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 推理评测 :reasoning(title,abstract)

Comments Strong accept by NeurIPS2025 Reviewers and AC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01391 2025-10-03 cs.CL 77%

TAG-EQA: Text-And-Graph for Event Question Answering via Structured Prompting Strategies

Maithili Kadam, Francis Ferraro

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted in *sem 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01654 2025-10-03 cs.CL cs.AI 73%

SoK: Measuring What Matters for Closed-Loop Security Agents

Mudita Khurana, Raunak Jain

机构 * IEEE

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01247 2025-10-03 cs.CL cs.AI 73%

Let's Play Across Cultures: A Large Multilingual, Multicultural Benchmark for Assessing Language Models' Understanding of Sports

Punit Kumar Singh, Nishant Kumar, Akash Ghosh, Kunal Pasad, Khushi Soni, Manisha Jaishwal, Sriparna Saha, Syukron Abu Ishaq Alfarozi, Asres Temam Abagissa, Kitsuchart Pasupa, Haiqin Yang, Jose G Moreno

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Sardar Patel Institute of Technology(萨达尔·帕特尔技术学院) Universitas Gadjah Mada(加查马大学) King Mongkut’s Institute of Technology Ladkrabang(拉差班国王技术学院) Shenzhen Technology University(深圳技术大学) Université de Toulouse(图卢兹大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 52 pages, 56 figures; appearing at EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02172 2025-10-03 cs.CL 70%

RESTRAIN: From Spurious Votes to Signals -- Self-Driven RL with Self-Penalization

Zhaoning Yu, Will Su, Leitian Tao, Haozhu Wang, Aashu Singh, Hanchao Yu, Jianyu Wang, Hongyang Gao, Weizhe Yuan, Jason Weston, Ping Yu, Jing Xu

机构 * Iowa State University(爱荷华州立大学) FAIR at Meta SuperIntelligence Lab(Meta超智能实验室FAIR团队) Meta

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01232 2025-10-03 cs.CL cs.AI 62%

Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks

Dongjun Kim, Gyuho Shim, Yongchan Chun, Minhyuk Kim, Chanjun Park, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系) School of Software, Soongsil University(顺天大学软件学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 5 figures. Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19430 2025-10-03 cs.CL cs.AI 62%

Deriving Strategic Market Insights with Large Language Models: A Benchmark for Forward Counterfactual Generation

Keane Ong, Rui Mao, Deeksha Varshney, Paul Pu Liang, Erik Cambria, Gianmarco Mengaldo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Published at Empirical Methods in Natural Language Processing 2025 (Main Conference) (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01887 2025-10-03 q-fin.CP cs.AI 57%

FINCH: Financial Intelligence using Natural language for Contextualized SQL Handling

Avinash Kumar Singh, Bhaskarjit Sarmah, Stefano Pasquali

机构 * Domyn

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01558 2025-10-03 cs.CE cs.LG eess.SP 57%

CardioRAG: A Retrieval-Augmented Generation Framework for Multimodal Chagas Disease Detection

Zhengyang Shen, Xuehao Zhai, Hua Tu, Mayue Shi

机构 * Department of Electrical and Electronic Engineering Imperial College London(帝国理工学院电子与电气工程系) Department of Civil and Environmental Engineering Imperial College London(帝国理工学院土木与环境工程系) Institute of Biomedical Engineering Department of Engineering Science University of Oxford(牛津大学生物医学工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 4 pages, 2 figures. Accepted for oral presentation at the 52nd international Computing in Cardiology Conference (CinC2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01398 2025-10-03 cs.AI 57%

Automating Data-Driven Modeling and Analysis for Engineering Applications using Large Language Model Agents

Yang Liu, Zaid Abulawi, Abhiram Garimidi, Doyeong Lim

机构 * Department of Nuclear Engineering, Texas A\&M University(核工程系,德克萨斯A&M大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01249 2025-10-03 cs.CL 57%

LOCA: Logical Chain Augmentation for Scientific Corpus Cleaning

You-Le Fang, Dong-Shan Jian, Xiang Li, Ce Meng, Ling-Shi Meng, Chen-Xu Yan, Zhi-Zhang Bian, Yan-Qing Ma

机构 * School of Physics, Peking University(北京大学物理学院) Center for High Energy Physics, Peking University(北京大学高等能源物理中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01691 2025-10-03 cs.CV 50%

MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs

Jiyao Liu, Jinjie Wei, Wanying Qu, Chenglong Ma, Junzhi Ning, Yunheng Li, Ying Chen, Xinzhe Luo, Pengcheng Chen, Xin Gao, Ming Hu, Huihui Xu, Xin Wang, Shujian Gao, Dingkang Yang, Zhongying Deng, Jin Ye, Lihao Liu, Junjun He, Ningsheng Xu

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract)

Comments 26 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏