arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-20 至 2025-10-20 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10 篇

2501.18492 2025-10-20 cs.CR cs.AI cs.LG 84%

GuardReasoner: Towards Reasoning-based LLM Safeguards

Yue Liu, Hongcheng Gao, Shengfang Zhai, Yufei He, Jun Xia, Zhengyu Hu, Yulin Chen, Xihong Yang, Jiaheng Zhang, Stan Z. Li, Hui Xiong, Bryan Hooi

机构 * NUS(新加坡国立大学) HKUST (Guangzhou)(香港科技大学(广州)) Westlake University(西湖大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

Comments 22 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15211 2025-10-20 cs.LG cs.AI 81%

ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning

Yongchan Kwon, Shang Zhu, Federico Bianchi, Kaitlyn Zhou, James Zou

机构 * Together AI Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00022 2025-10-20 cs.CL cs.LG physics.ed-ph 81%

Scaling Physical Reasoning with the PHYSICS Dataset

Shenghe Zheng, Qianjia Cheng, Junchi Yao, Mengsong Wu, Haonan He, Ning Ding, Yu Cheng, Shuyue Hu, Lei Bai, Dongzhan Zhou, Ganqu Cui, Peng Ye

机构 * Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) CUHK(香港中文大学) BUAA(北京航空航天大学) UESTC(电子科技大学) Soochow University(苏州大学) USTC(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to the NeurIPS Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04290 2025-10-20 cs.CV 78%

ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation

Jay Zhangjie Wu, Xuanchi Ren, Tianchang Shen, Tianshi Cao, Kai He, Yifan Lu, Ruiyuan Gao, Enze Xie, Shiyi Lan, Jose M. Alvarez, Jun Gao, Sanja Fidler, Zian Wang, Huan Ling

机构 * NVIDIA University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments Project Page: https://research.nvidia.com/labs/toronto-ai/chronoedit

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15558 2025-10-20 cs.CL cs.AI 62%

KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models

Dongjun Kim, Chanhee Park, Chanjun Park, Heuiseok Lim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15513 2025-10-20 cs.CL 57%

Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?

Ashutosh Bajpai, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) MongoDB, Inc.(MongoDB公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP Main Long Paper 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15406 2025-10-20 cs.CL 57%

VocalBench-DF: A Benchmark for Evaluating Speech LLM Robustness to Disfluency

Hongcheng Liu, Yixuan Hou, Heyang Liu, Yuhao Wang, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15162 2025-10-20 cs.CV cs.CL 57%

Train a Unified Multimodal Data Quality Classifier with Synthetic Data

Weizhi Wang, Rongmei Lin, Shiyang Li, Colin Lockard, Ritesh Sarkhel, Sanket Lokegaonkar, Jingbo Shang, Xifeng Yan, Nasser Zalmout, Xian Li

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Amazon Stores Foundational AI(亚马逊商店基础人工智能) UC San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03360 2025-10-20 cs.AI 57%

CogBench: A Large Language Model Benchmark for Multilingual Speech-Based Cognitive Impairment Assessment

Rui Feng, Zhiyao Luo, Wei Wang, Yuting Song, Yong Liu, Tingting Zhu, Jianqing Li, Xingyao Wang

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

Comments 19 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13564 2025-10-20 cs.CV cs.AI 57%

HumorDB: Can AI understand graphical humor?

Vedaant Jain, Felipe dos Santos Alves Feitosa, Gabriel Kreiman

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of São Paulo(圣保罗大学) Harvard Medical School(哈佛医学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 10 main figures, 4 additional appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏