arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-29 至 2025-10-29 共收录 68 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2505.17100 2025-10-29 cs.CL 83%

Any Large Language Model Can Be a Reliable Judge: Debiasing with a Reasoning-based Bias Detector

Haoyan Yang, Runxue Bao, Cao Xiao, Jun Ma, Parminder Bhatia, Shangqian Gao, Taha Kass-Hout

机构 * New York University(纽约大学) GE Healthcare(通用电气医疗) Florida State University(佛罗里达州立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2025 (Camera-Ready Version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24390 2025-10-29 cs.AI 79%

Improving LLM Reasoning via Dependency-Aware Query Decomposition and Logic-Parallel Content Expansion

Xianjun Gao, Jianchun Liu, Hongli Xu, Liusheng Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15737 2025-10-29 cs.AI cs.CL cs.LG 67%

TableTime: Reformulating Time Series Classification as Training-Free Table Understanding with Large Language Models

Jiahao Wang, Mingyue Cheng, Qingyang Mao, Yitong Zhou, Daoyu Wang, Qi Liu, Feiyang Xu, Xin Li

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24706 2025-10-29 cs.CL cs.AI cs.HC cs.SE 62%

ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?

Shuqing Li, Jiayi Yan, Chenyu Niu, Jen-tse Huang, Yun Peng, Wenxuan Wang, Yepang Liu, Michael R. Lyu

机构 * Chinese University of Hong Kong(香港中文大学) Southern University of Science and Technology(南方科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24320 2025-10-29 cs.CL cs.AI 62%

Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning

Zhiheng Xi, Jixuan Huang, Xin Guo, Boyang Hong, Dingwen Yang, Xiaoran Fan, Shuo Li, Zehui Chen, Junjie Ye, Siyu Yuan, Zhengyin Du, Xuesong Yao, Yufei Xu, Jiecao Chen, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) ByteDance Seed(字节跳动种子)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Preprint, 25 pages, 9 figures. Code: https://github.com/WooooDyy/Critique-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23941 2025-10-29 cs.CL cs.AI 62%

Auto prompting without training labels: An LLM cascade for product quality assessment in e-commerce catalogs

Soham Satyadharma, Fatemeh Sheikholeslami, Swati Kaul, Aziz Umit Batur, Suleiman A. Khan

机构 * Amazon Catalog AI(亚马逊目录人工智能)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21727 2025-10-29 cs.IR cs.AI cs.LG 62%

Your Dense Retriever is Secretly an Expeditious Reasoner

Yichi Zhang, Jun Bai, Zhixin Cai, Shuhan Qin, Zhuofan Chen, Jinghua Guan, Wenge Rong

机构 * School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院) Beijing Institute for General Artificial Intelligence, China(北京通用人工智能研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24695 2025-10-29 cs.CL 57%

AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis

Xuanzhong Chen, Zile Qiao, Guoxin Chen, Liangcai Su, Zhen Zhang, Xinyu Wang, Pengjun Xie, Fei Huang, Jingren Zhou, Yong Jiang

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24505 2025-10-29 cs.CL 57%

CritiCal: Can Critique Help LLM Uncertainty or Confidence Calibration?

Qing Zong, Jiayu Liu, Tianshi Zheng, Chunyang Li, Baixuan Xu, Haochen Shi, Weiqi Wang, Zhaowei Wang, Chunkit Chan, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(计算机科学与工程系,香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24424 2025-10-29 cs.LG cs.CV 57%

Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning

Amit Peleg, Naman Deep Singh, Matthias Hein

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24019 2025-10-29 cs.SE cs.AI 57%

Lifecycle-Aware code generation: Leveraging Software Engineering Phases in LLMs

Xing Xing, Wei Wang, Lipeng Ma, Weidong Yang, Junjie Zheng

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18868 2025-10-29 cs.AI cs.NE 57%

A Neuroscience-Inspired Dual-Process Model of Compositional Generalization

Alex Noviello, Claas Beger, Jacob Groner, Kevin Ellis, Weinan Sun

机构 * Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) Department of Neurobiology and Behavior, Cornell University(神经生物学与行为系,康奈尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 14 篇

2510.24150 2025-10-29 cs.CL cs.AI 81%

Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean

Chanwoo Park, Suyoung Park, JiA Kang, Jongyeon Park, Sangho Kim, Hyunji M. Park, Sumin Bae, Mingyu Kang, Jaejin Lee

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments submitted to ACL ARR Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24446 2025-10-29 cs.CL cs.CV 79%

SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space

Viktoriia Zinkovich, Anton Antonov, Andrei Spiridonov, Denis Shepelev, Andrey Moskalenko, Daria Pugacheva, Elena Tutubalina, Andrey Kuznetsov, Vlad Shakhuro

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24299 2025-10-29 cs.AI 79%

Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank

Jiayu Liu, Wei Dai, Zhenya Huang, Ning Miao, Enhong Chen

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(人工智能与数据科学学院,中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学) Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22414 2025-10-29 cs.HC 78%

Complementary Human-AI Clinical Reasoning in Ophthalmology

Mertcan Sevgi, Fares Antaki, Abdullah Zafar Khan, Ariel Yuhan Ong, David Adrian Merle, Kuang Hu, Shafi Balal, Sophie-Christin Kornelia Ernst, Josef Huemer, Gabriel T. Kaufmann, Hagar Khalid, Faye Levina, Celeste Limoli, Ana Paula Ribeiro Reis, Samir Touma, Anil Palepu, Khaled Saab, Ryutaro Tanno, Valentin Liévin, Tao Tu, Yong Cheng, Mike Schaekermann, S. Sara Mahdavi, Elahe Vedadi, David Stutz, Vivek Natarajan, Alan Karthikesalingam, Pearse A. Keane, Wei-Hung Weng

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17102 2025-10-29 cs.CV 78%

GRASP: Geospatial pixel Reasoning viA Structured Policy learning

Chengjie Jiang, Yunqi Zhou, Jiafeng Yan, Jing Li, Jiayang Li, Yue Zhou, Hongjie He, Jonathan Li

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Information, Central University of Finance and Economics(中央财经大学信息学院) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(教育部地理信息科学重点实验室,华东师范大学) School of Electronic and Computer Engineering, Peking University(北京大学电子工程学院) Department of Geography and Environmental Management, University of Waterloo(滑铁卢大学地理与环境管理系)

专题命中 推理评测 :reasoning(title,abstract)

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24345 2025-10-29 cs.CL cs.AI 62%

LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability

Zikai Xiao, Fei Huang, Jianhong Tu, Jianhui Wei, Wen Ma, Yuxuan Zhou, Jian Wu, Bowen Yu, Zuozhu Liu, Junyang Lin

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23948 2025-10-29 cs.LG cs.AI 62%

ChessQA: Evaluating Large Language Models for Chess Understanding

Qianfeng Wen, Zhenwei Tang, Ashton Anderson

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 33 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01161 2025-10-29 cs.LG cs.AI 62%

Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?

Haizhong Zheng, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23960 2025-10-29 cs.CV cs.AI cs.CR 57%

SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability

Peiyang Xu, Minzhou Pan, Zhaorun Chen, Shuang Yang, Chaowei Xiao, Bo Li

机构 * University of Chicago(芝加哥大学) Virtue AI Meta University of Wisconsin, Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 42 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23775 2025-10-29 cs.CV cs.AI eess.IV 57%

Explainable Detection of AI-Generated Images with Artifact Localization Using Faster-Than-Lies and Vision-Language Models for Edge Devices

Aryan Mathur, Asaduddin Ahmed, Pushti Amit Vasoya, Simeon Kandan Sonar, Yasir Z, Madesh Kuppusamy

机构 * Indian Institute of Technology Palakkad, India(印度帕拉卡德理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00063 2025-10-29 physics.chem-ph cs.AI 57%

MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision

Yuyang Wu, Jinhui Ye, Shuhao Zhang, Lu Dai, Yonatan Bisk, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 9 pages

Journal ref EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06560 2025-10-29 cs.CL 57%

NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables

Lanrui Wang, Mingyu Zheng, Hongyin Tang, Zheng Lin, Yanan Cao, Jingang Wang, Xunliang Cai, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24367 2025-10-29 cs.SE 50%

LLM-as-a-Judge for Software Engineering: Literature Review, Vision, and the Road Ahead

Junda He, Jieke Shi, Terry Yue Zhuo, Christoph Treude, Jiamou Sun, Zhenchang Xing, Xiaoning Du, David Lo

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20510 2025-10-29 cs.CV 50%

CPathAgent: An Agent-based Foundation Model for Interpretable High-Resolution Pathology Image Analysis Mimicking Pathologists' Diagnostic Logic

Yuxuan Sun, Yixuan Si, Chenglu Zhu, Kai Zhang, Zhongyi Shui, Bowen Ding, Tao Lin, Lin Yang

机构 * College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) Research Center for Industries of the Future and School of Engineering, Westlake University, China(未来产业研究中心和西湖大学工程学院) Department of Computer Science and Engineering, The Ohio State University, USA(俄亥俄州立大学计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract)

Comments 52 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 12 篇

2510.23966 2025-10-29 cs.LG cs.SE 85%

A Pragmatic Way to Measure Chain-of-Thought Monitorability

Scott Emmons, Roland S. Zimmermann, David K. Elson, Rohin Shah

机构 * Google(谷歌)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.LG

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23630 2025-10-29 cs.LG cs.AI cs.CL 82%

NUM2EVENT: Interpretable Event Reasoning from Numerical time-series

Ninghui Feng, Yiyan Qi

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) University of Nottingham Ningbo(诺丁汉大学宁波校区)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08146 2025-10-29 cs.LG cs.AI 81%

Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning

Aman Sharma, Paras Chopra

机构 * Lossfunk

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14617 2025-10-29 cs.CL cs.CY 79%

The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness

Sahar Abdelnabi, Ahmed Salem

机构 * Microsoft(微软公司) ELLIS Institute Tübingen & MPI for Intelligent Systems(图宾根ELLIS研究所及智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

Comments NeurIPS 2025 (Spotlight). Code is available at: https://github.com/microsoft/Test_Awareness_Steering

详情

展开后加载摘要…

URL PDF HTML 收藏