arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-11 至 2025-09-11 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 5 篇

2506.07104 2025-09-11 cs.CL cs.AI 86%

How Far Are We from Optimal Reasoning Efficiency?

Jiaxuan Gao, Shu Yan, Qixin Tan, Lu Yang, Shusheng Xu, Wei Fu, Zhiyu Mei, Kaifeng Lyu, Yi Wu

机构 * IIIS, Tsinghua University(清华大学信息学院) Ant Research, RL Lab(蚂蚁研究院强化学习实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08742 2025-09-11 q-fin.CP cs.AI 79%

FinZero: Launching Multi-modal Financial Time Series Forecast with Large Reasoning Model

Yanlong Wang, Jian Xu, Fei Ma, Hongkang Zhang, Hang Yu, Tiantian Gao, Yu Wang, Haochen You, Shao-Lun Huang, Danny Dongning Sun, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Guangming Laboratory(光明实验室) Ant Group(蚂蚁集团) Columbia University(哥伦比亚大学) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08803 2025-09-11 cs.SI cs.AI cs.CL cs.CY 62%

Scaling Truth: The Confidence Paradox in AI Fact-Checking

Ihsan A. Qazi, Zohaib Khan, Abdullah Ghani, Agha A. Raza, Zafar A. Qazi, Wassay Sajjad, Ayesha Ali, Asher Javaid, Muhammad Abdullah Sohail, Abdul H. Azeemi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 65 pages, 26 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08008 2025-09-11 cs.SI cs.AI cs.MM 57%

A New Dataset and Benchmark for Grounding Multimodal Misinformation

Bingjian Yang, Danni Xu, Kaipeng Niu, Wenxuan Liu, Zheng Wang, Mohan Kankanhalli

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(多媒体软件国家工程研究中心,计算机科学学院,武汉大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学) School of Computer Science, Peking University(计算机科学学院,北京大学) State Key Laboratory for Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 6 pages, 5 figures, ACM Multimedia 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00419 2025-09-11 cs.CR cs.SE 50%

Teaching an Old LLM Secure Coding: Localized Preference Optimization on Distilled Preferences

Mohammad Saqib Hasan, Saikat Chakraborty, Santu Karmaker, Niranjan Balasubramanian

专题命中 推理评测 :reasoning(abstract)

Comments Accepted to ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏