arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-15 至 2025-10-15 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2508.00378 2025-10-15 cs.AI cs.CV 88%

CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding

Shixin Yi, Lin Shang

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

Comments The paper is not yet mature and needs further improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22017 2025-10-15 cs.CL 83%

The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models

Siqi Fan, Bowen Qin, Peng Han, Shuo Shang, Yequan Wang, Aixin Sun

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments Added new experiments and revised the manuscript for clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10207 2025-10-15 cs.AI 80%

Adaptive Dual Reasoner: Large Reasoning Models Can Think Efficiently by Hybrid Reasoning

Yujian Zhang, Keyu Chen, Zhifeng Shen, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11985 2025-10-15 cs.AI 79%

CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research

Owen Queen, Harrison G. Zhang, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12190 2025-10-15 cs.CV 78%

Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos

Shingo Yokoi, Kento Sasaki, Yu Yamaguchi

机构 * Turing Inc.(图灵公司)

专题命中 推理评测 :reasoning(title,abstract)

Comments 2nd Place Winner, ICCV 2025 2COOOL Competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07363 2025-10-15 cs.AI 74%

L2M-AID: Autonomous Cyber-Physical Defense by Fusing Semantic Reasoning of Large Language Models with Multi-Agent Reinforcement Learning (Preprint)

Tianxiang Xu, Zhichao Wen, Xinyu Zhao, Jun Wang, Yan Li, Chang Liu

机构 * Peking University(北京大学) RWTH Aachen University(亚琛工业大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Wuhan University(武汉大学) Thales Group(泰雷兹集团) Chinese Medical Information and Big Data Association(中国医学信息与大数据协会)

专题命中 推理评测 :reasoning(title);分类 cs.AI

Comments This preprint was submitted to IEEE TrustCom 2025. The accepted version will be published under copyright 2025 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12218 2025-10-15 cs.AI 70%

GOAT: A Training Framework for Goal-Oriented Agent with Tools

Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

机构 * Korea University(韩国大学) Trillion Labs(万亿实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 32 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10845 2025-10-15 cs.CV 67%

CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving

Hidehisa Arai, Keita Miwa, Kento Sasaki, Yu Yamaguchi, Kohei Watanabe, Shunsuke Aoki, Issei Yamamoto

机构 * Turing Inc.(图灵公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments WACV 2025, Project Page: https://turingmotors.github.io/covla-ad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12750 2025-10-15 cs.CV cs.AI cs.LG 62%

VQArt-Bench: A semantically rich VQA Benchmark for Art and Cultural Heritage

A. Alfarano, L. Venturoli, D. Negueruela del Castillo

机构 * University of Zurich, Max Planck Society(苏黎世大学、马克斯·普朗克研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12633 2025-10-15 cs.LG cs.AI cs.DC 62%

Laminar: A Scalable Asynchronous RL Post-Training Framework

Guangming Sheng, Yuxuan Tong, Borui Wan, Wang Zhang, Chaobo Jia, Xibin Wu, Yuqi Wu, Xiang Li, Chi Zhang, Yanghua Peng, Haibin Lin, Xin Liu, Chuan Wu

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11977 2025-10-15 cs.AI cs.CL 62%

Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation

Sayash Kapoor, Benedikt Stroebl, Peter Kirgis, Nitya Nadgir, Zachary S Siegel, Boyi Wei, Tianci Xue, Ziru Chen, Felix Chen, Saiteja Utpala, Franck Ndzomga, Dheeraj Oruganty, Sophie Luskin, Kangheng Liu, Botao Yu, Amit Arora, Dongyoon Hahm, Harsh Trivedi, Huan Sun, Juyong Lee, Tengjun Jin, Yifan Mai, Yifei Zhou, Yuxuan Zhu, Rishi Bommasani, Daniel Kang, Dawn Song, Peter Henderson, Yu Su, Percy Liang, Arvind Narayanan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01909 2025-10-15 cs.AI cs.CL cs.CY cs.HC cs.SC 62%

Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models

Ranjie Duan, Jiexi Liu, Xiaojun Jia, Shiji Zhao, Ruoxi Cheng, Fengxiang Wang, Cheng Wei, Yong Xie, Chang Liu, Defeng Li, Yinpeng Dong, Yichi Zhang, Yuefeng Chen, Chongwen Wang, Xingjun Ma, Xingxing Wei, Yang Liu, Hang Su, Jun Zhu, Xinfeng Li, Yitong Sun, Jie Zhang, Jinzhao Hu, Sha Xu, Wenchao Yang, Yitong Yang, Xingyao Zhang, Yingshui Tan, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴AAIG)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Technical Report Code & Model weights available: https://github.com/Alibaba-AAIG/Oyster

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14094 2025-10-15 cs.LG cs.AI 62%

Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets

Benjamin Pikus, Pratyush Ranjan Tiwari, Burton Ye

机构 * Independent(独立研究者) Eternis Labs(Eternis实验室) Writer, Inc(Writer公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22337 2025-10-15 cs.CL cs.IR 57%

A Comprehensive Taxonomy of Negation for NLP and Neural Retrievers

Roxana Petcu, Samarth Bhargav, Maarten de Rijke, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00739 2025-10-15 cs.CL 57%

DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments

Chiyu Zhang, Marc-Alexandre Cote, Michael Albada, Anush Sankaran, Jack W. Stokes, Tong Wang, Amir Abdi, William Blum, Muhammad Abdul-Mageed

机构 * Microsoft(微软公司) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025 Workshop Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12422 2025-10-15 cs.CV 50%

VideoLucy: Deep Memory Backtracking for Long Video Understanding

Jialong Zuo, Yongtai Deng, Lingdong Kong, Jingkang Yang, Rui Jin, Yiwei Zhang, Nong Sang, Liang Pan, Ziwei Liu, Changxin Gao

机构 * National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(多谱段信息智能处理国家级重点实验室,人工智能与自动化学院,华中科技大学) NUS(国立大学新加坡) S-Lab, NTU(NTU的S实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

Comments NeurIPS-2025 Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12400 2025-10-15 cs.CV 50%

Towards General Urban Monitoring with Vision-Language Models: A Review, Evaluation, and a Research Agenda

André Torneiro, Diogo Monteiro, Paulo Novais, Pedro Rangel Henriques, Nuno F. Rodrigues

机构 * ALGORITMI Research Centre/LASI(ALGORITMI研究机构/LASI) University of Minho(明霍大学) Logimade(Logimade公司) INESC TEC(INESC TEC研究机构) Ai, School of Technology(2Ai技术学院) IPCA

专题命中 推理评测 :reasoning(abstract)

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏