arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-08 至 2025-10-08 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 23 篇

2510.05458 2025-10-08 cs.CL 57%

SocialNLI: A Dialogue-Centric Social Inference Dataset

Akhil Deo, Kate Sanders, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05362 2025-10-08 cs.CL 57%

Residualized Similarity for Faithfully Explainable Authorship Verification

Peter Zeng, Pegah Alipoormolabashi, Jihu Mun, Gourab Dey, Nikita Soni, Niranjan Balasubramanian, Owen Rambow, H. Schwartz

机构 * Department of Computer Science(计算机科学系) Department of Linguistics(语言学系) Institute for Advanced Computational Science(先进计算科学研究院) Stony Brook University(石溪大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05046 2025-10-08 cs.CL 57%

COLE: a Comprehensive Benchmark for French Language Understanding Evaluation

David Beauchemin, Yan Tremblay, Mohamed Amine Youssef, Richard Khoury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Submitted to ACL Rolling Review of October

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09098 2025-10-08 cs.CL 57%

SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models

Kehua Feng, Xinyi Shen, Weijie Wang, Xiang Zhuang, Yuqi Tang, Qiang Zhang, Keyan Ding

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 33 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05533 2025-10-08 q-fin.PM 50%

The New Quant: A Survey of Large Language Models in Financial Prediction and Trading

Weilong Fu

专题命中 推理评测 :reasoning(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05365 2025-10-08 cs.SE 50%

Test Case Generation from Bug Reports via Large Language Models: A Cognitive Layered Evaluation Framework

Irtaza Sajid Qureshi, Zhen Ming, Jiang

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08833 2025-10-08 cs.CY 50%

Position: The Pitfalls of Over-Alignment: Overly Caution Health-Related Responses From LLMs are Unethical and Dangerous

Wenqi Marshall Guo, Yiyang Du, Heidi J. S. Tworek, Shan Du

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19271 2025-10-08 cs.SE 50%

VerifyThisBench: Generating Code, Specifications, and Proofs All at Once

Xun Deng, Sicheng Zhong, Barış Bayazıt, Andreas Veneris, Fan Long, Xujie Si

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15192 2025-10-08 cs.CV 50%

Leveraging Foundation Models for Multimodal Graph-Based Action Recognition

Fatemeh Ziaeetabar, Florentin Wörgötter

机构 * School of Mathematics, Statistics and Computer Science, College of Science, University of Tehran(数学、统计与计算机科学学院,科学学院,塔里斯坦大学)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 8 篇

2510.05593 2025-10-08 cs.CV cs.AI cs.CL 86%

Improving Chain-of-Thought Efficiency for Autoregressive Image Generation

Zeqi Gu, Markos Georgopoulos, Xiaoliang Dai, Marjan Ghazvininejad, Chu Wang, Felix Juefei-Xu, Kunpeng Li, Yujun Shi, Zecheng He, Zijian He, Jiawei Zhou, Abe Davis, Jialiang Wang

机构 * Meta Superintelligence Labs(Meta超智能实验室) Meta FAIR Cornell University(康奈尔大学) Stony Brook University(石溪大学)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18269 2025-10-08 cs.RO 82%

FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models

Zhide Zhong, Haodong Yan, Junfeng Li, Xiangchen Liu, Xin Gong, Tianran Zhang, Wenxuan Song, Jiayi Chen, Xinhu Zheng, Hesheng Wang, Haoang Li

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05480 2025-10-08 cs.AI cs.SE 79%

Vul-R2: A Reasoning LLM for Automated Vulnerability Repair

Xin-Cheng Wen, Zirui Lin, Yijun Yang, Cuiyun Gao, Deheng Ye

机构 * Tencent Inc.(腾讯公司) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

Comments 13 pages, 8 figures. This paper is accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02725 2025-10-08 cs.CL 79%

SAFER: Advancing Safety Alignment via Efficient Ex-Ante Reasoning

Kehua Feng, Keyan Ding, Yuhao Wang, Menghan Li, Fanjunduo Wei, Xinda Wang, Qiang Zhang, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学Hangzhou全球科技创新中心) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05498 2025-10-08 cs.CL 77%

Prototype-Based Dynamic Steering for Large Language Models

Ceyhun Efe Kayan, Li Zhang

机构 * Drexel University(德雷塞尔大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09947 2025-10-08 cs.SE 67%

Toward Green Code: Prompting Small Language Models for Energy-Efficient Code Generation

Humza Ashraf, Syed Muhammad Danish, Shadikur Rahman, Zeeshan Sattar

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19823 2025-10-08 cs.LG cs.AI 62%

Persona Features Control Emergent Misalignment

Miles Wang, Tom Dupré la Tour, Olivia Watkins, Alex Makelov, Ryan A. Chi, Samuel Miserendino, Jeffrey Wang, Achyuta Rajaram, Johannes Heidecke, Tejal Patwardhan, Dan Mossing

机构 * OpenAI

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05133 2025-10-08 cs.CL 57%

Characterizing Model Behavior Under Synthetic Data Training: An Empirical Study Across Scales and Mixing Ratios

Y. Du, G. Wu, G. Tang, W. Wang, Q. Fan

机构 * Independent Research Collaboration(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

Comments 17 pages. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏