arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-11 至 2025-08-11 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 8 篇

2412.13147 2025-08-11 cs.AI cs.CL 81%

Are Your LLMs Capable of Stable Reasoning?

Junnan Liu, Hongwei Liu, Linchen Xiao, Ziyi Wang, Kuikun Liu, Songyang Gao, Wenwei Zhang, Songyang Zhang, Kai Chen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Camera, Benchmark: https://huggingface.co/datasets/opencompass/LiveMathBench, Code: https://github.com/open-compass/GPassK

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05669 2025-08-11 cs.IR cs.AI cs.CL cs.CV cs.LG 67%

Fine-Tuning Vision-Language Models for Markdown Conversion of Financial Tables in Malaysian Audited Financial Reports

Jin Khye Tan, En Jun Choong, Ethan Jeremiah Chitty, Yan Pheng Choo, John Hsin Yang Wong, Chern Eu Cheah

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 14 figures, 5 tables. Evaluation code (LLM-as-a-judge and Markdown TEDS) is available at https://github.com/jinkhye/MyFinMarkdown. The development dataset and evaluation benchmark are available on Hugging Face at https://huggingface.co/datasets/jinkhye/MyFinMarkdown-sample and https://huggingface.co/datasets/jinkhye/MyFinMarkdown-bench respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17747 2025-08-11 cs.CL cs.AI 62%

Pretraining on the Test Set Is No Longer All You Need: A Debate-Driven Approach to QA Benchmarks

Linbo Cao, Jinman Zhao

机构 * Faculty of Mathematics University of Waterloo(数学系大学水疗)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 7 figures. Accepted to COLM 2025. Code available at: github.com/l6cao/Debate-Driven-Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14848 2025-08-11 cs.CL cs.LG cs.MA 62%

MAATS: A Multi-Agent Automated Translation System Based on MQM Evaluation

George Wang, Jiaqian Hu, Safinah Ali

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04030 2025-08-11 cs.SE cs.CL 57%

OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs

Wasi Uddin Ahmad, Aleksander Ficek, Mehrzad Samadi, Jocelyn Huang, Vahid Noroozi, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA圣克拉拉分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01943 2025-08-11 cs.CL 57%

OpenCodeReasoning: Advancing Data Distillation for Competitive Coding

Wasi Uddin Ahmad, Sean Narenthiran, Somshubra Majumdar, Aleksander Ficek, Siddhartha Jain, Jocelyn Huang, Vahid Noroozi, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA圣克拉拉分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05976 2025-08-11 cs.CV cs.RO 50%

PASG: A Closed-Loop Framework for Automated Geometric Primitive Extraction and Semantic Anchoring in Robotic Manipulation

Zhihao Zhu, Yifan Zheng, Siyu Pan, Yaohui Jin, Yao Mu

机构 * MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能教育部重点实验室、人工智能研究院、上海交通大学)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to ICCV 2025. 8 pages main paper, 8 figures, plus supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19015 2025-08-11 cs.CV cs.MM 50%

Can Multimodal Large Language Models Understand Spatial Relations?

Jingping Liu, Ziyan Liu, Zhedong Cen, Yan Zhou, Yinan Zou, Weiyan Zhang, Haiyun Jiang, Tong Ruan

机构 * School of Information Science and Engineering, East China University of Science and Technology, Shanghai, China(信息科学与工程学院,东华大学,上海,中国) School of Computer Science, Fudan University, Shanghai, China(计算机科学学院,复旦大学,上海,中国)

专题命中 推理评测 :reasoning(abstract)

Comments 13 pages, 7 figures, published to ACL 2025

Journal ref In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 620-632, 2025, Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏