arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-15 至 2025-08-15 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 18 篇

2508.10770 2025-08-15 cs.CV 78%

From Diagnosis to Improvement: Probing Spatio-Physical Reasoning in Vision Language Models

Tiancheng Han, Yunfei Gao, Yong Li, Wuzhou Yu, Qiaosheng Zhang, Wenqi Shao

专题命中 推理评测 :reasoning(title,abstract)

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10751 2025-08-15 cs.LG cs.AI cs.CL 78%

Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models

Zhipeng Chen, Xiaobo Qin, Youbin Wu, Yue Ling, Qinghao Ye, Wayne Xin Zhao, Guang Shi

机构 * Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

Comments Technical Report about RLVR: 32 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10681 2025-08-15 cs.CV 78%

IADGPT: Unified LVLM for Few-Shot Industrial Anomaly Detection, Localization, and Reasoning via In-Context Learning

Mengyang Zhao, Teng Fu, Haiyang Yu, Ke Niu, Bin Li

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10355 2025-08-15 cs.CL 77%

Making Qwen3 Think in Korean with Reinforcement Learning

Jungyup Lee, Jemin Kim, Sang Park, SeungJae Lee

机构 * Jungyup Lee, Jemin Kim, Sang Park, SeungJae Lee(作者)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10014 2025-08-15 cs.CL 70%

PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?

Lingfeng Zhou, Jialing Zhang, Jin Gao, Mohan Jiang, Dequan Wang

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14572 2025-08-15 cs.CL cond-mat.mtrl-sci cs.AI cs.LG 67%

Evaluating the Performance and Robustness of LLMs in Materials Science Q&A and Property Predictions

Hongchen Wang, Kangming Li, Scott Ramsay, Yao Fehlis, Edward Kim, Jason Hattrick-Simpers

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04801 2025-08-15 cs.CV 67%

OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLM

Jinhong Wang, Shuo Tong, Jian liu, Dongqi Tang, Weiqiang Wang, Wentong Li, Hongxia Xu, Danny Chen, Jintai Chen, Jian Wu

机构 * College of Computer Science & Technology, Zhejiang University(浙江大学计算机科学与技术学院) Transvascular Implantation Devices Research Institute and Liangzhu Laboratory(血管植入物研究机构和良渚实验室) Ant Group(蚂蚁集团) University of Notre Dame(圣母大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10535 2025-08-15 cs.CL cs.AI cs.SE 62%

CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks

Hongchao Jiang, Yiming Chen, Yushi Cao, Hung-yi Lee, Robby T. Tan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Dataset is available at https://huggingface.co/datasets/mattymchen/codejudgebench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10137 2025-08-15 cs.CL cs.AI 62%

mSCoRe: a $M$ultilingual and Scalable Benchmark for $S$kill-based $Co$mmonsense $Re$asoning

Nghia Trung Ngo, Franck Dernoncourt, Thien Huu Nguyen

机构 * Department of Computer Science, University of Oregon(俄勒冈大学计算机科学系) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10108 2025-08-15 cs.AI cs.CL 62%

Amazon Nova AI Challenge -- Trusted AI: Advancing secure, AI-assisted software development

Sattvik Sahai, Prasoon Goyal, Michael Johnston, Anna Gottardi, Yao Lu, Lucy Hu, Luke Dai, Shaohua Liu, Samyuth Sagi, Hangjie Shi, Desheng Zhang, Lavina Vaz, Leslie Ball, Maureen Murray, Rahul Gupta, Shankar Ananthakrishna

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 1st Proceedings of Amazon Nova AI Challenge (Trusted AI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09999 2025-08-15 cs.CL cs.LG 62%

XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs

Yuzhuo Xiao, Zeyu Han, Yuhan Wang, Huaizu Jiang

机构 * Guizhou University(贵州大学) Northeastern University(东北大学) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments For associated code and dataset, see https://github.com/neu-vi/XFacta

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10869 2025-08-15 cs.CV cs.AI 57%

Medico 2025: Visual Question Answering for Gastrointestinal Imaging

Sushant Gautam, Vajira Thambawita, Michael Riegler, Pål Halvorsen, Steven Hicks

机构 * SimulaMet - Simula Metropolitan Center for Digital Engineering, Oslo, Norway(SimulaMet - Simula Metropolitan Center for Digital Engineering,挪威奥斯陆) Simula Research Laboratory, Oslo, Norway(Simula研究实验室,挪威奥斯陆) OsloMet - Oslo Metropolitan University, Oslo, Norway(OsloMet - 奥斯陆 Metropolitan 大学,挪威奥斯陆)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10173 2025-08-15 cs.LG cs.CY 57%

Benchmark-Driven Selection of AI: Evidence from DeepSeek-R1

Petr Spelda, Vit Stritecky

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09956 2025-08-15 cs.CL 57%

Performance of GPT-5 Frontier Models in Ophthalmology Question Answering

Fares Antaki, David Mikhail, Daniel Milad, Danny A Mammo, Sumit Sharma, Sunil K Srivastava, Bing Yu Chen, Samir Touma, Mertcan Sevgi, Jonathan El-Khoury, Pearse A Keane, Qingyu Chen, Yih Chung Tham, Renaud Duval

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08909 2025-08-15 cs.AI 57%

Compass-Thinker-7B Technical Report

Anxiang Zeng, Haibo Zhang, Kaixiang Mo, Long Zhang, Shuman Liu, Yanhui Huang, Yawen Liu, Yuepeng Sheng, Yuwei Huang

机构 * Shopee LLM Team(Shopee LLM团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06869 2025-08-15 cs.CV cs.LG 57%

CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language Models

Junho Kim, Hyungjin Chung, Byung-Hoon Kim

机构 * EverEx Yonsei University(延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2508.10020 2025-08-15 cs.CL cs.AI 86%

FedCoT: Communication-Efficient Federated Reasoning Enhancement for Large Language Models

Chuan Li, Qianyi Zhao, Fengran Mo, Cen Chen

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10057 2025-08-15 q-bio.NC cs.AI cs.CL 81%

Large Language Models Show Signs of Alignment with Human Neurocognition During Abstract Reasoning

Christopher Pinier, Sonia Acuña Vargas, Mariia Steeghs-Turchina, Dora Matzke, Claire E. Stevenson, Michael D. Nunez

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Presented at the 8th Annual Conference on Cognitive Computational Neuroscience (August 12-15, 2025; Amsterdam, The Netherlands); 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10115 2025-08-15 cs.LG cs.AI 73%

Less is More: Learning Graph Tasks with Just LLMs

Sola Shirai, Kavitha Srinivas, Julian Dolby, Michael Katz, Horst Samulowitz, Shirin Sohrabi

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10444 2025-08-15 cs.CL 70%

DiFaR: Enhancing Multimodal Misinformation Detection with Diverse, Factual, and Relevant Rationales

Herun Wan, Jiaying Wu, Minnan Luo, Xiangzheng Kong, Zihan Ma, Zhi Zeng

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03810 2025-08-15 cs.LG cs.AI cs.CL 67%

Grouped Sequency-arranged Rotation: Optimizing Rotation Transformation for Quantization for Free

Euntae Choi, Sumin Song, Woosang Lim, Sungjoo Yoo

机构 * Seoul National University(首尔国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10146 2025-08-15 cs.AI 57%

Agentic AI Frameworks: Architectures, Protocols, and Design Challenges

Hana Derouiche, Zaki Brahmi, Haithem Mazeni

机构 * University of Kairouan(卡鲁安大学) SMART Lab, University of Tunis(图纳大学SMART实验室) University of Sousse(索斯大学) Riadi Lab, Compus Manouba(曼努巴大学里亚迪实验室) University of Jandouba(贾杜巴大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17402 2025-08-15 cs.AI 57%

Assessing the Capability of Large Language Models for Domain-Specific Ontology Generation

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Robin Keskisarkka, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * University of Bologna, Italy(博洛尼亚大学,意大利) ISTC-CNR, Italy(ISTC-意大利国家研究理事会) Linköping University, Sweden(林雪平大学,瑞典)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

Journal ref Joint Proc. ESWC 2025 Workshops and Tutorials, CEUR-WS, Vol. 3977, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18405 2025-08-15 cs.AI cs.IR 57%

Leveraging Large Language Models for Relevance Judgments in Legal Case Retrieval

Shengjie Ma, Qi Chu, Jiaxin Mao, Xuhui Jiang, Haozhe Duan, Chong Chen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Beijing Normal University(北京师范大学) DataArc Tech Ltd.(数据弧科技有限公司) Huawei Cloud BU(华为云业务单元)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10572 2025-08-15 cs.CV 50%

Towards Agentic AI for Multimodal-Guided Video Object Segmentation

Tuyen Tran, Thao Minh Le, Truyen Tran

机构 * Applied Artificial Intelligence Institute, Deakin University, Australia(应用人工智能研究所,德金大学,澳大利亚)

专题命中 其他推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10371 2025-08-15 cs.RO 50%

Few-shot Vision-based Human Activity Recognition with MLLM-based Visual Reinforcement Learning

Wenqi Zheng, Yutaka Arakawa

机构 * Graduate School(研究生院) Faculty of Information Science(信息科学系) Electrical Engineering(电气工程) Kyushu University(九州大学) JAPAN(日本)

专题命中 其他推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10075 2025-08-15 astro-ph.IM 50%

Teaching LLMs to Speak Spectroscopy

Nesar Ramachandra, Yuan-Sen Ting, Zechang Sun, Azton Wells, Salman Habib

专题命中 其他推理 :reasoning(abstract)

Comments 6 pages, 1 figure, Accepted to the Machine Learning for Astrophysics (ML4Astro) Colocated Workshop at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏