arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-15 至 2025-08-15 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 18 篇

2508.09178 2025-08-15 cs.CV cs.AI 83%

IAD-R1: Reinforcing Consistent Reasoning in Industrial Anomaly Detection

Yanhui Li, Yunkang Cao, Chengliang Liu, Yuan Xiong, Xinghui Dong, Chao Huang

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10358 2025-08-15 cs.AI 79%

What to Ask Next? Probing the Imaginative Reasoning of LLMs with TurtleSoup Puzzles

Mengtao Zhou, Sifan Wu, Huan Zhang, Qi Sima, Bang Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10770 2025-08-15 cs.CV 78%

From Diagnosis to Improvement: Probing Spatio-Physical Reasoning in Vision Language Models

Tiancheng Han, Yunfei Gao, Yong Li, Wuzhou Yu, Qiaosheng Zhang, Wenqi Shao

专题命中 推理评测 :reasoning(title,abstract)

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10751 2025-08-15 cs.LG cs.AI cs.CL 78%

Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models

Zhipeng Chen, Xiaobo Qin, Youbin Wu, Yue Ling, Qinghao Ye, Wayne Xin Zhao, Guang Shi

机构 * Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

Comments Technical Report about RLVR: 32 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10681 2025-08-15 cs.CV 78%

IADGPT: Unified LVLM for Few-Shot Industrial Anomaly Detection, Localization, and Reasoning via In-Context Learning

Mengyang Zhao, Teng Fu, Haiyang Yu, Ke Niu, Bin Li

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10355 2025-08-15 cs.CL 77%

Making Qwen3 Think in Korean with Reinforcement Learning

Jungyup Lee, Jemin Kim, Sang Park, SeungJae Lee

机构 * Jungyup Lee, Jemin Kim, Sang Park, SeungJae Lee(作者)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10014 2025-08-15 cs.CL 70%

PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?

Lingfeng Zhou, Jialing Zhang, Jin Gao, Mohan Jiang, Dequan Wang

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14572 2025-08-15 cs.CL cond-mat.mtrl-sci cs.AI cs.LG 67%

Evaluating the Performance and Robustness of LLMs in Materials Science Q&A and Property Predictions

Hongchen Wang, Kangming Li, Scott Ramsay, Yao Fehlis, Edward Kim, Jason Hattrick-Simpers

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04801 2025-08-15 cs.CV 67%

OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLM

Jinhong Wang, Shuo Tong, Jian liu, Dongqi Tang, Weiqiang Wang, Wentong Li, Hongxia Xu, Danny Chen, Jintai Chen, Jian Wu

机构 * College of Computer Science & Technology, Zhejiang University(浙江大学计算机科学与技术学院) Transvascular Implantation Devices Research Institute and Liangzhu Laboratory(血管植入物研究机构和良渚实验室) Ant Group(蚂蚁集团) University of Notre Dame(圣母大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10535 2025-08-15 cs.CL cs.AI cs.SE 62%

CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks

Hongchao Jiang, Yiming Chen, Yushi Cao, Hung-yi Lee, Robby T. Tan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Dataset is available at https://huggingface.co/datasets/mattymchen/codejudgebench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10137 2025-08-15 cs.CL cs.AI 62%

mSCoRe: a $M$ultilingual and Scalable Benchmark for $S$kill-based $Co$mmonsense $Re$asoning

Nghia Trung Ngo, Franck Dernoncourt, Thien Huu Nguyen

机构 * Department of Computer Science, University of Oregon(俄勒冈大学计算机科学系) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10108 2025-08-15 cs.AI cs.CL 62%

Amazon Nova AI Challenge -- Trusted AI: Advancing secure, AI-assisted software development

Sattvik Sahai, Prasoon Goyal, Michael Johnston, Anna Gottardi, Yao Lu, Lucy Hu, Luke Dai, Shaohua Liu, Samyuth Sagi, Hangjie Shi, Desheng Zhang, Lavina Vaz, Leslie Ball, Maureen Murray, Rahul Gupta, Shankar Ananthakrishna

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 1st Proceedings of Amazon Nova AI Challenge (Trusted AI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09999 2025-08-15 cs.CL cs.LG 62%

XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs

Yuzhuo Xiao, Zeyu Han, Yuhan Wang, Huaizu Jiang

机构 * Guizhou University(贵州大学) Northeastern University(东北大学) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments For associated code and dataset, see https://github.com/neu-vi/XFacta

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10869 2025-08-15 cs.CV cs.AI 57%

Medico 2025: Visual Question Answering for Gastrointestinal Imaging

Sushant Gautam, Vajira Thambawita, Michael Riegler, Pål Halvorsen, Steven Hicks

机构 * SimulaMet - Simula Metropolitan Center for Digital Engineering, Oslo, Norway(SimulaMet - Simula Metropolitan Center for Digital Engineering,挪威奥斯陆) Simula Research Laboratory, Oslo, Norway(Simula研究实验室,挪威奥斯陆) OsloMet - Oslo Metropolitan University, Oslo, Norway(OsloMet - 奥斯陆 Metropolitan 大学,挪威奥斯陆)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10173 2025-08-15 cs.LG cs.CY 57%

Benchmark-Driven Selection of AI: Evidence from DeepSeek-R1

Petr Spelda, Vit Stritecky

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09956 2025-08-15 cs.CL 57%

Performance of GPT-5 Frontier Models in Ophthalmology Question Answering

Fares Antaki, David Mikhail, Daniel Milad, Danny A Mammo, Sumit Sharma, Sunil K Srivastava, Bing Yu Chen, Samir Touma, Mertcan Sevgi, Jonathan El-Khoury, Pearse A Keane, Qingyu Chen, Yih Chung Tham, Renaud Duval

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08909 2025-08-15 cs.AI 57%

Compass-Thinker-7B Technical Report

Anxiang Zeng, Haibo Zhang, Kaixiang Mo, Long Zhang, Shuman Liu, Yanhui Huang, Yawen Liu, Yuepeng Sheng, Yuwei Huang

机构 * Shopee LLM Team(Shopee LLM团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06869 2025-08-15 cs.CV cs.LG 57%

CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language Models

Junho Kim, Hyungjin Chung, Byung-Hoon Kim

机构 * EverEx Yonsei University(延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏