arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-25 至 2025-09-25 共收录 64 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2509.11686 2025-09-25 cs.SE cs.AI 57%

Do Code Semantics Help? A Comprehensive Study on Execution Trace-Based Information for Code Large Language Models

Jian Wang, Xiaofei Xie, Qiang Hu, Shangqing Liu, Yi Li

机构 * Singapore Management University(新加坡国立管理学院) Nanyang Technological University(南洋理工大学) Tianjin University(天津大学) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments EMNLP2025-findings https://openreview.net/forum?id=d4ICISW2T4

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 7 篇

2501.04341 2025-09-25 cs.CL 89%

Understanding Before Reasoning: Enhancing Chain-of-Thought with Iterative Summarization Pre-Prompting

Dong-Hai Zhu, Yu-Jie Xiong, Jia-Chen Zhang, Xi-Jiong Xie, Chun-Ming Xia

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(电子工程学院,上海工程技术大学) School of Information Science and Engineering, Ningbo University(信息科学与工程学院,宁波大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18961 2025-09-25 cs.AI cs.IR 79%

Weaver: Interweaving SQL and LLM for Table Reasoning

Rohit Khoja, Devanshu Gupta, Yanjie Fu, Dan Roth, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20109 2025-09-25 cs.RO cs.AI cs.CL 73%

Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving

Pengxiang Li, Yinan Zheng, Yue Wang, Huimin Wang, Hang Zhao, Jingjing Liu, Xianyuan Zhan, Kun Zhan, Xianpeng Lang

机构 * LiAuto Tsinghua University(清华大学)

专题命中 复杂问题求解 :planning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20175 2025-09-25 cs.AI cs.CL 62%

Federation of Agents: A Semantics-Aware Communication Fabric for Large-Scale Agentic AI

Lorenzo Giusti, Ole Anton Werner, Riccardo Taiello, Matilde Carvalho Costa, Emre Tosun, Andrea Protani, Marc Molina, Rodrigo Lopes de Almeida, Paolo Cacace, Diogo Reis Santos, Luigi Serio

机构 * CERN(欧洲核子研究中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20021 2025-09-25 cs.AI cs.CL cs.RO 62%

Embodied AI: From LLMs to World Models

Tongtong Feng, Xin Wang, Yu-Gang Jiang, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by IEEE CASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22803 2025-09-25 cs.CV cs.HC cs.LG 57%

Intervening in Black Box: Concept Bottleneck Model for Enhancing Human Neural Network Mutual Understanding

Nuoye Xiong, Anqi Dong, Ning Wang, Cong Hua, Guangming Zhu, Lin Mei, Peiyi Shen, Liang Zhang

机构 * Xidian University(西安电子科技大学) KTH Royal Institute of Technology(皇家理工学院) Donghai Laboratory(东海实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19209 2025-09-25 cs.CL 57%

Augmenting Multi-Agent Communication with State Delta Trajectory

Yichen Tang, Weihang Su, Yujia Zhou, Yiqun Liu, Min Zhang, Shaoping Ma, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 13 篇

2505.23368 2025-09-25 cs.CL 86%

Threading the Needle: Reweaving Chain-of-Thought Reasoning to Explain Human Label Variation

Beiduo Chen, Yang Janet Liu, Anna Korhonen, Barbara Plank

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL

Comments Accepted by EMNLP 2025 Main (Oral), 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19841 2025-09-25 cs.CV 78%

ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection

Tai-Ming Huang, Wei-Tung Lin, Kai-Lung Hua, Wen-Huang Cheng, Junichi Yamagishi, Jun-Cheng Chen

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04974 2025-09-25 cs.CV cs.AI cs.CL cs.LG 67%

Towards Visual Text Grounding of Multimodal Large Language Model

Ming Li, Ruiyi Zhang, Jian Chen, Chenguang Wang, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, Tong Sun

机构 * Adobe Research(Adobe研究院) University of Maryland(马里兰大学) University at Buffalo(布法罗大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20208 2025-09-25 cs.CL cs.AI cs.DB 62%

Play by the Type Rules: Inferring Constraints for LLM Functions in Declarative Programs

Parker Glenn, Alfy Samuel, Daben Liu

机构 * Capital One

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19370 2025-09-25 cs.CL cs.AI 62%

Meow: End-to-End Outline Writing for Automatic Academic Survey

Zhaoyu Ma, Yuan Shan, Jiahao Zhao, Nan Xu, Lei Wang

机构 * Beijing Wenge Technology Co.,Ltd(北京文格科技有限公司) Peking University(北京大学) Duke University(杜克大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19326 2025-09-25 cs.CL cs.AI 62%

Unveiling the Merits and Defects of LLMs in Automatic Review Generation for Scientific Papers

Ruochi Li, Haoxuan Zhang, Edward Gehringer, Ting Xiao, Junhua Ding, Haihua Chen

机构 * North Carolina State University(北卡罗来纳州立大学) University of North Texas(德克萨斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted as short paper at 25th IEEE International Conference on Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19322 2025-09-25 cs.CL cs.AI 62%

Readme_AI: Dynamic Context Construction for Large Language Models

Millie Vyas, Timothy Blattner, Alden Dima

机构 * Purdue University(普渡大学) National Institute of Standards and Technology(国家标准技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19926 2025-09-25 cs.LG 57%

MMSE-Calibrated Few-Shot Prompting for Alzheimer's Detection

Jana Sweidan, Mounim A. El-Yacoubi, Nasredine Semmar

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18813 2025-09-25 cs.CL 57%

MAPEX: A Multi-Agent Pipeline for Keyphrase Extraction

Liting Zhang, Shiwan Zhao, Aobo Kong, Qicheng Li

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(天津大学计算机学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18993 2025-09-25 cs.CL cs.DB 57%

MEBench: Benchmarking Large Language Models for Cross-Document Multi-Entity Question Answering

Teng Lin, Yuyu Luo, Honglin Zhang, Jicheng Zhang, Chunlin Liu, Kaishun Wu, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China Mobile Information Technology Company Limited(中国移动信息技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23601 2025-09-25 cs.CV 50%

EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis

Shengyuan Liu, Boyun Zheng, Wenting Chen, Zhihao Peng, Zhenfei Yin, Jing Shao, Jiancong Hu, Yixuan Yuan

机构 * Chinese University of Hong Kong(中国香港大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) The Sixth Affiliated Hospital, Sun Yat-sen University(中山大学第六附属医院)

专题命中 推理评测 :reasoning(abstract)

Comments 40 pages, 22 figures; Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19843 2025-09-25 cs.CV cs.RO 50%

PersONAL: Towards a Comprehensive Benchmark for Personalized Embodied Agents

Filippo Ziliotto, Jelin Raphael Akkara, Alessandro Daniele, Lamberto Ballan, Luciano Serafini, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·科塞拉基金会)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10697 2025-09-25 cs.NE 50%

Language Model Evolutionary Algorithms for Recommender Systems: Benchmarks and Algorithm Comparisons

Jiao Liu, Zhu Sun, Shanshan Feng, Caishun Chen, Yew-Soon Ong

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他推理 13 篇

2508.12587 2025-09-25 cs.CV 85%

Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models

Tan-Hanh Pham, Chris Ngo

机构 * Harvard Medical School, Harvard University(哈佛医学院、哈佛大学) Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提尼乌拉A.马丁努斯生物医学成像中心、麻省总医院) Knovel Engineering Lab, Singapore(Knovel工程实验室、新加坡)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20336 2025-09-25 cs.LG cs.AI 82%

Uncovering Graph Reasoning in Decoder-only Transformers with Circuit Tracing

Xinnan Dai, Chung-Hsiang Lo, Kai Guo, Shenglai Zeng, Dongsheng Luo, Jiliang Tang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by the Workshop on Efficient Reasoning, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19894 2025-09-25 cs.LG cs.CL 81%

PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning

Xueliang Zhao, Wei Wu, Jian Guan, Zhuocheng Gong, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19762 2025-09-25 cs.AI 79%

The Conductor and the Engine: A Path Towards Co-Designed Reasoning

Yuanxin Wang, Pawel Filipczuk, Anisha Garg, Amaan Dhada, Mohammad Hassanpour, David Bick, Ganesh Venkatesh

机构 * Applied AI Research, Cerebras(应用人工智能研究,Cerebras)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10979 2025-09-25 cs.CL 79%

How Well Can Reasoning Models Identify and Recover from Unhelpful Thoughts?

Sohee Yang, Sang-Woo Lee, Nora Kassner, Daniela Gottesman, Sebastian Riedel, Mor Geva

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

Comments Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19587 2025-09-25 cs.SE cs.AI 70%

Reverse Engineering User Stories from Code using Large Language Models

Mohamed Ouf, Haoyu Li, Michael Zhang, Mariam Guizani

机构 * Queen's University(皇后大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20051 2025-09-25 cs.LG cs.AI 62%

One Filters All: A Generalist Filter for State Estimation

Shiqi Liu, Wenhan Cao, Chang Liu, Zeyu He, Tianyi Zhang, Shengbo Eben Li

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) College of Engineering, Peking University(北京大学工程学院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19593 2025-09-25 cs.CL cs.AI 62%

GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models

Dylan Hutson, Daniel Vennemeyer, Aneesh Deshmukh, Justin Zhan, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025, 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19839 2025-09-25 cs.AI 57%

LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation

Huizhen Shu, Xuying Li, Zhuo Li

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

Comments 9-page NeurIPS 2025 preprint including 3 figures and 1 table, with additional appendix material. Prepared using the NeurIPS 2025 preprint template and compiled with pdfLaTeX. All references are included via the provided .bbl file. Figures are in PDF format. No external supplementary files. All necessary style files and images are included

详情

展开后加载摘要…

URL PDF HTML 收藏